Kimi K3란 무엇인가?
Kimi K3는 Moonshot AI의 새로운 플래그십 멀티모달 추론 모델입니다. 단일 채팅 프롬프트에 답하는 데 그치지 않고, 수 시간에 걸친 코딩, 조사, 도구 사용 및 수정 작업을 수행하도록 설계되었습니다.
이 모델은 2026년 7월 16일 Kimi.com, Kimi Work, Kimi Code 및 Kimi API에서 출시되었습니다. 총 2.8조 개의 파라미터와 100만 토큰 컨텍스트 윈도우를 제공하며 텍스트, 이미지 및 동영상 입력을 기본 지원합니다. 출력은 여전히 텍스트입니다.
내부적으로 K3는 896개의 전문가 중 한 번에 16개를 활성화하는 Mixture-of-Experts 아키텍처를 사용합니다. Moonshot은 긴 시퀀스와 깊은 모델 레이어를 통과하는 정보의 흐름을 개선하기 위해 Kimi Delta Attention, Attention Residuals 및 Stable LatentMoE도 도입했습니다. Moonshot은 이러한 변경 사항으로 Kimi K2보다 약 2.5배 높은 스케일링 효율을 달성한다고 주장하지만, 이 수치는 독립적인 테스트가 아니라 개발사가 제시한 것입니다. Moonshot의 Kimi K3 기술 블로그에서 현재 아키텍처 세부 정보를 확인할 수 있으며, 더完整한 기술 보고서는 아직 공개되지 않았습니다.
| 사양 |
Kimi K3 |
| 개발사 |
Moonshot AI |
| 공개 출시 |
2026년 7월 16일 |
| 전체 / 활성화 파라미터 |
2.8T / 104B |
|
| 아키텍처Mixture-of-Experts |
| 전문가 |
총 896개, 활성 16개 |
| 컨텍스트 윈도우 |
100만 토큰 |
| 입력 |
텍스트, 이미지 및 동영상 |
| 출력 |
텍스트 |
| API 모델 문자열 |
kimi-k3 |
| 사고 모드 | 항상 활성화
|
| 웨이트 제공 여부 |
`moonshotai/Kimi-K3 | 에서 전체 웨이트 공개
이로써 K3는 현재까지 발표된 가장 큰 AI 모델 중 하나가 되었습니다. 하지만 규모 자체가 유용성을 결정하지는 않습니다. 진정한 질문은 Moonshot이 이러한 파라미터를 더 나은 작업 완료 성능으로 전환했는지 여부입니다.
이번 출시로 초기 출시 보도에서 남아 있던 한 가지 불확실성도 해소되었습니다. 기술 보고서가 이제 공개되었습니다. 그러나 독립적인 평가의 필요성이 사라진 것은 아니며, 2.8T 모델이 간편하게 자체 호스팅할 수 있는 프로젝트가 되는 것도 아닙니다.
Kimi K3는 정말 GPT-5.6 및 Claude Fable 5에 가까운가?
전반적인 지능에서는 아직 그렇지 않습니다. 하지만 여러 에이전트 및 장기 작업에서는 그렇습니다.
Moonshot 자체의 발표는 그 발표로 인해 만들어진 많은 헤드라인보다 신중한 표현을 사용합니다. 회사는 K3의 전반적인 성능이 여전히 Claude Fable 5 및 GPT-5.6 Sol에 뒤처진다고 밝혔습니다. 그럼에도 코딩, 지식 작업 및 추론 전반에서 프런티어 수준의 결과를 보고했습니다.
한 가지 예는 GPU 커널 최적화입니다. Moonshot은 각 모델을 동일한 샌드박스에 배치하고 4개의 GPU 작업을 최적화할 수 있도록 최대 24시간을 제공했습니다. 이 테스트에서 K3는 Fable 5와 경쟁력 있는 성능을 보였고 GPT-5.6 Sol, GPT-5.5 및 Opus 4.8을 앞섰습니다. 이는 저수준 성능 엔지니어링에서 상당한 결과입니다. 하지만 K3가 모든 면에서 더 뛰어난 지능을 갖췄다는 증거는 아닙니다.
독립적인 테스트는 더 넓은 관점을 제공합니다. Artificial Analysis는 Kimi K3에 Intelligence Index 57점을 부여했으며, 이는 GPT-5.5 및 Claude Opus 4.8과 비슷하지만 Fable 5 및 GPT-5.6 Sol보다는 낮은 수준입니다. 가장 강력한 결과는 모든 지능 영역이 아니라 에이전트 실행 및 자동화에서 나타났습니다. Artificial Analysis는 7월 16일 K3 평가 결과를 공개했습니다.
| 평가 |
Kimi K3 결과 |
의미 |
| AA Intelligence Index |
57 |
GPT-5.5 및 Opus 4.8에 근접, GPT-5.6 Sol 및 Fable 5에는 뒤처짐 |
| GDPval-AA v2 |
1,668 Elo |
실제 에이전트 작업에서 강력한 실행 능력 |
| AutomationBench-AA |
53%, 1위 |
SaaS 워크플로 자동화에 특히 효과적 |
| AA-Briefcase |
1,547 Elo, 2위 |
강력한 장기 지식 작업 성능 |
| 전지성 정확도 |
46% |
K2.6의 33%에서 상승 |
| 환각률 |
51% |
K2.6의 39%보다 높음 |
마지막 행이 특히 우려스러웠습니다. K3는 더 뛰어난 능력을 갖추게 되었지만, Artificial Analysis는 환각도 더 많이 발생한다고 측정했습니다. 더 많은 질문에 올바르게 답했지만, 근거 없는 주장의 비율도 높아졌습니다.
이러한 상충 관계는 실제 운영에서 중요합니다. 긴 에이전트 워크플로를 완료하면서 조용히 잘못된 가정을 추가하는 모델은, 사실성은 더 안정적이지만 느린 모델보다 검증에 더 큰 비용을 초래할 수 있습니다.
하나의 리더보드만으로 비교를 확정할 수 없는 이유
K3는 이미 하나 이상의 프런트엔드 생성 리더보드에서 정상에 올랐습니다. GPU 최적화, SaaS 자동화 및 장기 지식 작업에서도 좋은 성능을 보입니다. 하지만 이러한 결과는 동일한 능력을 측정하지 않습니다.
프런트엔드 아레나는 사용자가 생성된 인터페이스를 얼마나 선호하는지 측정합니다. AutomationBench는 에이전트가 소프트웨어 워크플로를 수행할 수 있는지 측정합니다. GPU 커널 최적화는 저수준 시스템 엔지니어링을 테스트합니다. 이 중 어느 것도 K3가 연구, 사실 회상, 디버깅, 프레젠테이션 디자인 또는 일반 추론을 더 잘하는지 독립적으로 답해주지는 않습니다.
방어 가능한 결론은 더 제한적입니다. Kimi K3는 에이전트 작업의 프런티어 그룹에 진입했지만, 더 넓은 비교에서는 GPT-5.6 Sol과 Fable 5가 여전히 앞서 있습니다. 현재 폐쇄형 모델의 최고 성능을 원하는 개발자는 GPT-5.6 Sol API를 검토할 수 있으며, Claude Opus 4.8은 복잡한 코딩 및 연구 워크플로를 위한 더욱 검증된 선택지입니다.
오픈 웨이트 문제는 해결되었지만, 배포 문제는 아직 해결되지 않았다
출시 주간에 제기된 질문은 Moonshot이 실제로 웨이트를 공개할 것인가였습니다. 이제 공개했습니다. 공식 moonshotai/Kimi-K3 저장소에는 전체 체크포인트, 모델 카드, 기술 보고서, 추론 코드 및 Kimi K3 라이선스가 포함되어 있습니다.
정확한 표현은 여전히 중요합니다. Kimi K3는 오픈 웨이트 모델이지, 무조건적인 “완전한 오픈 소스” 릴리스는 아닙니다. 자체 라이선스는 광범위한 사용, 수정, 파인튜닝, 배포 및 재배포를 허용하지만, 대규모 Model-as-a-Service 사업과 초대형 상용 제품에는 조건을 추가합니다. 학습 데이터는 공개되지 않았습니다.
사용 가능하다는 것과 사용하기 쉽다는 것은 다릅니다. 저장소는 약 1.56TB이며, Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 배포를 권장합니다. 따라서 K3는 클라우드 및 엔터프라이즈 인프라 팀에게는 의미가 있지만, 일반적인 워크스테이션에 내려받아 사용하는 모델은 아닙니다.
그래도 이번 출시는 중요합니다. 이제 조직은 체크포인트를 직접 검토하고, 추론을 맞춤화하고, 파생 모델을 파인튜닝하며, 하나의 호스팅 엔드포인트에 전적으로 의존하지 않고 모델을 운영할 수 있는 실질적인 경로를 갖게 되었습니다. 그 대가는 하드웨어, 서빙 엔지니어링 및 라이선스 검토입니다.
Kimi K2.7에서 Kimi K3로 무엇이 바뀌었나?
K3는 단순히 버전 번호만 커진 Kimi K2.7이 아닙니다.
Kimi K2.7 Code는 K2.6을 기반으로 한 코딩 중심 에이전트 모델입니다. 모델 카드는 실제 소프트웨어 엔지니어링, 장시간 코딩 세션, 도구 사용 및 낮은 추론 토큰 소비를 강조합니다. K3는 이러한 역할을 코딩, 시각적 추론, 연구 및 엔드투엔드 지식 작업을 포괄하는 일반 플래그십 모델로 확장합니다.
컨텍스트 윈도우는 256K에서 100만 토큰으로 늘어났습니다. 총 파라미터는 1조 개에서 2.8조 개로 증가했고, 전문가 수는 384개에서 896개로 늘었습니다. 가격도 함께 상승했습니다.
| 기능 |
Kimi K3 |
Kimi K2.7 Code |
| 포지셔닝 |
일반 플래그십 |
코딩 중심 모델 |
| 총 파라미터 |
2.8T |
1T |
| 전문가 |
896개, 16개 활성 |
384개, 8개 활성 |
| 컨텍스트 윈도우 |
1M |
256K |
| 표준 입력 | $3.00/MTok
| $0.95/MTok
|
| 출력 | $15.00/MTok
| $4.00/MTok
|
| 캐시된 입력 | $0.30/MTok
| $0.19/MTok
|
| 웨이트 |
Kimi K3 라이선스에 따라 제공 |
제공됨 |
따라서 K3의 가치 제안은 “거의 무료인 프런티어 지능”이 아닙니다. 즉시 사용할 수 있는 종량제 API와 인프라를 직접 운영할 준비가 된 팀을 위한 공개 웨이트라는 두 가지 배포 경로를 제공하는, 프런티어에 근접한 에이전트 성능입니다.
공식 K2.7 Code 모델 카드에는 아키텍처, 벤치마크 방법론 및 배포 지침이 포함되어 있습니다.
Kimi K3는 100만 토큰 컨텍스트를 어떻게 처리하는가
100만 토큰 컨텍스트 윈도우를 통해 K3는 대규모 코드베이스, 기술 문서 모음, 긴 에이전트 기록 및 중간 도구 결과를 하나의 요청으로 처리할 수 있습니다.
이는 장시간 실행되는 에이전트에 특히 중요합니다. 코딩 모델은 수십 단계에 걸쳐 초기 사양, 저장소 구조, 터미널 출력, 테스트 실패, 이전 수정 사항 및 리뷰어 피드백을 유지해야 할 수 있습니다. 작업 중간에 이러한 제약 조건 중 하나라도 잃어버리면 에이전트가 생산적으로 보이지만 완료에는 실패하는 경우가 많습니다.
K3는 자동 컨텍스트 캐싱도 적용합니다. 개발자는 캐시 ID를 생성하거나 별도의 TTL 값을 설정할 필요가 없습니다. 요청 사이에 긴 접두부가 변경되지 않으면 시스템이 자동으로 캐시 적중을 시도합니다. 캐시된 입력 비용은 토큰 100만 개당 3.00달러가 아니라 0.30달러입니다.
하지만 컨텍스트 용량이 완벽한 컨텍스트 활용을 의미하지는 않습니다. 모델에 100만 토큰을 입력한다고 해서 모든 줄에 올바른 중요도를 부여한다는 보장은 없습니다. 입력이 길어지면 비용과 처리 시간이 증가하고 관련 없는 자료로 인해 주의가 분산될 수도 있습니다.
여전히 가장 합리적인 접근 방식은 먼저 관련성이 높은 파일을 검색하고, 캐싱을 위해 안정적인 참조 콘텐츠를 앞부분에 유지하며, 한도 내에 들어간다는 이유만으로 전체 지식 기반을 전송하지 않는 것입니다. Kimi의 API 가이드는 100만 토큰 컨텍스트와 자동 캐싱 동작을 설명합니다.
Kimi K3 API 가격은 더 이상 저가가 아니다
Moonshot의 공식 Kimi K3 API는 고정 종량제 가격을 적용합니다. 요청이 더 큰 컨텍스트 구간을 넘어가더라도 요금은 변경되지 않습니다.
| 토큰 유형 |
토큰 100만 개당 가격 |
| 캐시된 입력 | $0.30
|
| 표준 입력 | $3.00
|
| 출력 | $15.00
|
캐시되지 않은 입력 토큰 100,000개를 사용하고 출력 토큰 20,000개를 생성하는 짧은 에이전트 작업의 예상 모델 비용은 다음과 같습니다:
(0.1 × $3) + (0.02 × $15) = $0.60
이제 캐시된 토큰 800,000개, 새 입력 토큰 50,000개 및 출력 토큰 50,000개를 사용하는 반복적인 장기 컨텍스트 워크플로를 생각해 보겠습니다:
(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14
캐싱 덕분에 두 번째 예시의 비용은 관리 가능한 수준이지만, K3는 분명히 기존의 “중국 모델은 API가 매우 저렴하다”는 공식에 들어맞지 않습니다.
Artificial Analysis는 K3의 Intelligence Index 작업 평균 비용을 0.94달러로 측정했습니다. 이는 GPT-5.6 Sol의 1.04달러에 근접하며 Opus 4.8의 1.80달러의 약 절반입니다. GLM-5.2는 동일한 평가 작업을 훨씬 저렴하게 완료했습니다.
비교 결과는 모델에 어디에서 액세스하는지에 따라서도 달라집니다.
GPT Proto의 Kimi K3 API는 현재 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러이며, 이는 Moonshot의 3달러/15달러 정가보다 10% 낮습니다. GPT Proto는 동일한 API 키와 공유 잔액으로 GPT-5.6 Sol 및 GLM-5.2도 제공하므로 별도의 공급자 계정 없이 작업 수준의 비교를 더 쉽게 수행할 수 있습니다.
따라서 K3의 가치 제안은 “거의 무료인 프런티어 지능”이 아닙니다. 즉시 사용할 수 있는 종량제 API와 인프라를 직접 운영할 준비가 된 팀을 위한 공개 웨이트라는 두 가지 배포 경로를 제공하는, 프런티어에 근접한 에이전트 성능입니다.
Kimi K3 API와 오픈 웨이트: 무엇을 사용해야 하는가?
이제 Kimi K3는 개발자에게 실질적인 배포 선택지를 제공합니다. 두 경로 모두 모델 성능이 매력 요소이지만, 운영 방식은 완전히 다릅니다.
| 호스팅 Kimi K3 API |
Kimi K3 오픈 웨이트 |
| 토큰당 지불 |
가속기 용량을 구매하거나 임대 |
| 공급자가 확장, 캐싱, 업데이트 및 장애를 관리 |
팀이 서빙, 확장, 모니터링, 업그레이드 및 장애를 관리 |
| 평가 및 프로덕션으로 가는 가장 빠른 경로 |
데이터, 추론 및 모델 수정에 대한 가장 높은 통제력 |
| 호스팅 서비스는 텍스트, 이미지 및 동영상 입력을 문서화함 |
현재 공개 저장소 메타데이터는 텍스트와 이미지에 집중되어 있으므로 동영상 경로가 동일하게 지원되는지 확인한 후 이를 약속해야 함 |
| 1.56TB 다운로드 불필요 |
96개 웨이트 샤드로 약 1.56TB |
| 클러스터 배포 프로젝트 불필요 |
Moonshot은 64개 이상의 가속기를 권장 |
아직 제품-시장 적합성을 검증하는 중이거나 트래픽이 가변적이거나 팀이 이미 대규모 모델 인프라를 운영하고 있지 않다면 먼저 API를 사용하세요. GPT Proto Kimi K3 API를 사용하면 하나의 키와 잔액으로 K3, GPT-5.6 Sol, GLM-5.2 및 기타 모델을 더 쉽게 비교할 수 있습니다.
프라이빗 배포, 파인튜닝, 맞춤형 추론 또는 공급자 독립성이 클러스터 운영을 정당화할 만큼 충분한 비즈니스 가치를 제공한다면 웨이트를 사용하세요. 상용 배포 전에 “오픈”이 MIT를 의미한다고 가정하지 말고 Kimi K3 라이선스를 검토하세요.
Kimi K3와 GLM-5.2, GPT-5.6 및 Opus 4.8 비교
벤치마크 승자가 자동으로 올바른 프로덕션 모델이 되는 것은 아닙니다. 유용한 선택은 무엇이 실패할 수 있는지, 워크플로가 얼마나 오래 실행되는지, 웨이트 소유가 중요한지에 따라 달라집니다.
| 모델 |
다음과 같은 경우 선택 |
| Kimi K3 |
긴 멀티모달 에이전트 워크플로가 필요하고, 지금 호스팅 API를 사용하거나 Kimi K3 라이선스에 따른 오픈 웨이트 배포 경로를 원할 때 |
| GPT-5.6 Sol |
소유권보다 일반적인 추론 품질과 안정적인 프로덕션 성능이 중요할 때 |
| Claude Fable 5 |
측정된 에이전트 지식 작업의 최고 성능이 필요하고 액세스할 수 있을 때 |
| Claude Opus 4.8 |
복잡한 코딩, 연구 및 신중한 지시 따르기를 위해 이미 Claude 워크플로에 의존할 때 |
| GLM-5.2 |
이미 웨이트를 사용할 수 있는 저비용 에이전트 코딩이 필요할 때 |
| Kimi K2.7 Code |
워크로드가 주로 코딩이며 K3의 높은 가격을 정당화하기 어려울 때 |
K3의 가장 명확한 사용 사례는 세 가지 조건이 함께 나타날 때입니다. 장시간 실행되는 작업, 멀티모달 입력, 그리고 모델 배포를 직접 제어해야 할 이유입니다. 이러한 요구 사항이 없다면 K3의 규모는 더 작은 문제에 대한 비싼 해답이 될 수 있습니다.
폭넓은 지능과 신뢰성이 우선이라면 GPT-5.6 Sol이 여전히 더 강력한 선택입니다. Opus 4.8은 성숙한 Claude 기반 코딩 또는 연구 워크플로를 갖춘 팀에 적합합니다. GLM-5.2는 이미 100만 토큰 컨텍스트와 더 낮은 작업 비용의 오픈 웨이트를 제공하므로 경제성 측면에서 더 어려운 경쟁자입니다.
현재 제 경험칙은 간단합니다. 오픈 웨이트와 장기 멀티모달 에이전트가 중요하면 K3를 선택하세요. 모델 소유보다 신뢰성이 중요하면 GPT-5.6 또는 Opus를 선택하세요. 비용이 협상할 수 없는 제약 조건이라면 GLM-5.2를 선택하세요.
아직 GPT Proto를 통해 Kimi K3를 사용할 수 있는가?
예. Kimi K3는 이제 GPT Proto Kimi K3 API를 통해 사용할 수 있습니다.
현재 GPT Proto 요금은 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러이며, Moonshot의 현재 3달러/15달러 정가보다 10% 낮습니다. GPT Proto API 키와 함께 모델 문자열 kimi-k3를 사용하면 K3의 장기 컨텍스트 코딩, 멀티모달 분석, 도구 호출 및 구조화된 출력 기능에 액세스할 수 있습니다.
동일한 키와 공유 잔액으로 GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 및 200개 이상의 텍스트, 이미지, 동영상 및 오디오 모델도 사용할 수 있습니다. 따라서 프로덕션 트래픽을 변경하기 전에 동일한 저장소 또는 에이전트 워크플로에서 K3를 대안 모델과 실용적으로 테스트할 수 있습니다.
GPT Proto에서 Kimi K3를 사용해 보거나 전체 GPT Proto AI 모델 갤러리를 둘러볼 수 있습니다. 모델의 웨이트와 기술 보고서는 이제 공개되었지만, 독립적인 배포 테스트, 양자화, 처리량 데이터 및 프레임워크 지원이 성숙해지면 이 글을 다시 검토해야 합니다.
최종 평가: 근접했지만 벤치마크는 여전히 중요하다
Kimi K3는 파라미터 수 때문에 주목받는 단순한 대형 중국 모델이 아닙니다. 독립적인 테스트는 더 중요한 결론을 뒷받침합니다. K3는 자동화, 장기 지식 작업 및 에이전트 실행에서 프런티어 시스템과 경쟁력 있는 성능을 보입니다.
그렇다고 전체적으로 GPT-5.6 Sol 또는 Claude Fable 5보다 뛰어나다는 의미는 아닙니다. 측정된 환각 증가도 사라지지 않습니다. 7월 28일 달라진 점은 배포입니다. 약속된 웨이트, 라이선스, 모델 카드 및 기술 보고서가 이제 공개되었습니다.
따라서 K3는 동급에서 가장 뛰어난 오픈 웨이트 옵션 중 하나이지만, 이 표현에는 두 가지 주석이 필요합니다. 라이선스는 MIT가 아닌 자체 라이선스이며, 1.56TB 저장소와 64개 이상의 가속기 권장 사양으로 인해 자체 호스팅은 일반적인 개발팀의 범위를 넘어섭니다.
제 결론은 이렇습니다. 먼저 API를 사용해 K3가 실제 작업을 개선하는지 확인하세요. 직접 인프라 공급자가 되는 데 따르는 통제, 맞춤화 또는 데이터 경계가 그 비용을 정당화할 때만 웨이트로 전환하세요.