Michael Johnson2026-07-28

Kimi K3란 무엇이며, 정말 GPT-5.6 및 Fable 5에 가까운가?

Kimi K3는 오픈 소스이며 GPT-5.6 및 Fable 5에 정말 가까울까요? 1M 컨텍스트, API 가격, 독립 벤치마크 및 Reddit 반응을 살펴보세요.

Kimi K3란 무엇이며, 정말 GPT-5.6 및 Fable 5에 가까운가?

TL;DR

Kimi K3는 장기 코딩, 지식 작업, 추론 및 에이전트 워크플로를 위해 Moonshot AI가 개발한 2.8조 파라미터 규모의 멀티모달 모델입니다. 독립적인 테스트에서 전반적으로 Claude Opus 4.8 및 GPT-5.5에 근접한 결과를 보였지만, GPT-5.6 Sol과 Claude Fable 5가 여전히 앞서 있습니다. K3는 에이전트 벤치마크에서 격차를 좁혔고 일부 자동화 테스트에서는 선두를 차지했지만, 측정된 환각률은 K2.6보다 증가했습니다.
 Kimi K3는 이제 오픈 웨이트 모델입니다. Moonshot AI는 전체 체크포인트, 모델 카드, 기술 보고서 및 자체 Kimi K3 라이선스를 공개했습니다. 공식 Hugging Face 저장소는 96개의 safetensors 샤드로 구성된 약 1.56TB 규모이며, Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 배포를 권장합니다. 오픈 웨이트 공개로 소유권에 관한 문제는 해결되었습니다. 하지만 K3가 일반적인 로컬 모델이 되는 것은 아닙니다.
대부분의 개발자에게 호스팅 API는 여전히 실용적인 출발점입니다. GPTProto의 Kimi K3 API는 현재 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러로 책정되어 있습니다. 데이터 제어, 맞춤형 추론 또는 모델 수정이 인프라 및 라이선스 검토 비용을 감수할 만큼 가치 있다면 웨이트를 선택하세요.
요약하면 Kimi K3는 GPT-5.6 및 Fable 5와 같은 논의의 장에 포함될 만큼 충분히 근접했으며—이제 오픈 웨이트 출시를 통해 두 폐쇄형 모델에는 없는 배포 선택지를 개발자에게 제공합니다.

목차

Kimi K3란 무엇인가?

Kimi K3는 Moonshot AI의 새로운 플래그십 멀티모달 추론 모델입니다. 단일 채팅 프롬프트에 답하는 데 그치지 않고, 수 시간에 걸친 코딩, 조사, 도구 사용 및 수정 작업을 수행하도록 설계되었습니다.

이 모델은 2026년 7월 16일 Kimi.com, Kimi Work, Kimi Code 및 Kimi API에서 출시되었습니다. 총 2.8조 개의 파라미터와 100만 토큰 컨텍스트 윈도우를 제공하며 텍스트, 이미지 및 동영상 입력을 기본 지원합니다. 출력은 여전히 텍스트입니다.

내부적으로 K3는 896개의 전문가 중 한 번에 16개를 활성화하는 Mixture-of-Experts 아키텍처를 사용합니다. Moonshot은 긴 시퀀스와 깊은 모델 레이어를 통과하는 정보의 흐름을 개선하기 위해 Kimi Delta Attention, Attention Residuals 및 Stable LatentMoE도 도입했습니다. Moonshot은 이러한 변경 사항으로 Kimi K2보다 약 2.5배 높은 스케일링 효율을 달성한다고 주장하지만, 이 수치는 독립적인 테스트가 아니라 개발사가 제시한 것입니다. Moonshot의 Kimi K3 기술 블로그에서 현재 아키텍처 세부 정보를 확인할 수 있으며, 더完整한 기술 보고서는 아직 공개되지 않았습니다.

아키텍처항상 활성화에서 전체 웨이트 공개
사양 Kimi K3
개발사 Moonshot AI
공개 출시 2026년 7월 16일
전체 / 활성화 파라미터 2.8T / 104B
Mixture-of-Experts
전문가 총 896개, 활성 16개
컨텍스트 윈도우 100만 토큰
입력 텍스트, 이미지 및 동영상
출력 텍스트
API 모델 문자열 kimi-k3
사고 모드
웨이트 제공 여부 `moonshotai/Kimi-K3

이로써 K3는 현재까지 발표된 가장 큰 AI 모델 중 하나가 되었습니다. 하지만 규모 자체가 유용성을 결정하지는 않습니다. 진정한 질문은 Moonshot이 이러한 파라미터를 더 나은 작업 완료 성능으로 전환했는지 여부입니다.

이번 출시로 초기 출시 보도에서 남아 있던 한 가지 불확실성도 해소되었습니다. 기술 보고서가 이제 공개되었습니다. 그러나 독립적인 평가의 필요성이 사라진 것은 아니며, 2.8T 모델이 간편하게 자체 호스팅할 수 있는 프로젝트가 되는 것도 아닙니다.

Kimi K3는 정말 GPT-5.6 및 Claude Fable 5에 가까운가?

전반적인 지능에서는 아직 그렇지 않습니다. 하지만 여러 에이전트 및 장기 작업에서는 그렇습니다.

Moonshot 자체의 발표는 그 발표로 인해 만들어진 많은 헤드라인보다 신중한 표현을 사용합니다. 회사는 K3의 전반적인 성능이 여전히 Claude Fable 5 및 GPT-5.6 Sol에 뒤처진다고 밝혔습니다. 그럼에도 코딩, 지식 작업 및 추론 전반에서 프런티어 수준의 결과를 보고했습니다.

한 가지 예는 GPU 커널 최적화입니다. Moonshot은 각 모델을 동일한 샌드박스에 배치하고 4개의 GPU 작업을 최적화할 수 있도록 최대 24시간을 제공했습니다. 이 테스트에서 K3는 Fable 5와 경쟁력 있는 성능을 보였고 GPT-5.6 Sol, GPT-5.5 및 Opus 4.8을 앞섰습니다. 이는 저수준 성능 엔지니어링에서 상당한 결과입니다. 하지만 K3가 모든 면에서 더 뛰어난 지능을 갖췄다는 증거는 아닙니다.

독립적인 테스트는 더 넓은 관점을 제공합니다. Artificial Analysis는 Kimi K3에 Intelligence Index 57점을 부여했으며, 이는 GPT-5.5 및 Claude Opus 4.8과 비슷하지만 Fable 5 및 GPT-5.6 Sol보다는 낮은 수준입니다. 가장 강력한 결과는 모든 지능 영역이 아니라 에이전트 실행 및 자동화에서 나타났습니다. Artificial Analysis는 7월 16일 K3 평가 결과를 공개했습니다.

평가 Kimi K3 결과 의미
AA Intelligence Index 57 GPT-5.5 및 Opus 4.8에 근접, GPT-5.6 Sol 및 Fable 5에는 뒤처짐
GDPval-AA v2 1,668 Elo 실제 에이전트 작업에서 강력한 실행 능력
AutomationBench-AA 53%, 1위 SaaS 워크플로 자동화에 특히 효과적
AA-Briefcase 1,547 Elo, 2위 강력한 장기 지식 작업 성능
전지성 정확도 46% K2.6의 33%에서 상승
환각률 51% K2.6의 39%보다 높음

마지막 행이 특히 우려스러웠습니다. K3는 더 뛰어난 능력을 갖추게 되었지만, Artificial Analysis는 환각도 더 많이 발생한다고 측정했습니다. 더 많은 질문에 올바르게 답했지만, 근거 없는 주장의 비율도 높아졌습니다.

이러한 상충 관계는 실제 운영에서 중요합니다. 긴 에이전트 워크플로를 완료하면서 조용히 잘못된 가정을 추가하는 모델은, 사실성은 더 안정적이지만 느린 모델보다 검증에 더 큰 비용을 초래할 수 있습니다.

하나의 리더보드만으로 비교를 확정할 수 없는 이유

K3는 이미 하나 이상의 프런트엔드 생성 리더보드에서 정상에 올랐습니다. GPU 최적화, SaaS 자동화 및 장기 지식 작업에서도 좋은 성능을 보입니다. 하지만 이러한 결과는 동일한 능력을 측정하지 않습니다.

프런트엔드 아레나는 사용자가 생성된 인터페이스를 얼마나 선호하는지 측정합니다. AutomationBench는 에이전트가 소프트웨어 워크플로를 수행할 수 있는지 측정합니다. GPU 커널 최적화는 저수준 시스템 엔지니어링을 테스트합니다. 이 중 어느 것도 K3가 연구, 사실 회상, 디버깅, 프레젠테이션 디자인 또는 일반 추론을 더 잘하는지 독립적으로 답해주지는 않습니다.

방어 가능한 결론은 더 제한적입니다. Kimi K3는 에이전트 작업의 프런티어 그룹에 진입했지만, 더 넓은 비교에서는 GPT-5.6 Sol과 Fable 5가 여전히 앞서 있습니다. 현재 폐쇄형 모델의 최고 성능을 원하는 개발자는 GPT-5.6 Sol API를 검토할 수 있으며, Claude Opus 4.8은 복잡한 코딩 및 연구 워크플로를 위한 더욱 검증된 선택지입니다.

오픈 웨이트 문제는 해결되었지만, 배포 문제는 아직 해결되지 않았다

출시 주간에 제기된 질문은 Moonshot이 실제로 웨이트를 공개할 것인가였습니다. 이제 공개했습니다. 공식 moonshotai/Kimi-K3 저장소에는 전체 체크포인트, 모델 카드, 기술 보고서, 추론 코드 및 Kimi K3 라이선스가 포함되어 있습니다.

정확한 표현은 여전히 중요합니다. Kimi K3는 오픈 웨이트 모델이지, 무조건적인 “완전한 오픈 소스” 릴리스는 아닙니다. 자체 라이선스는 광범위한 사용, 수정, 파인튜닝, 배포 및 재배포를 허용하지만, 대규모 Model-as-a-Service 사업과 초대형 상용 제품에는 조건을 추가합니다. 학습 데이터는 공개되지 않았습니다.

사용 가능하다는 것과 사용하기 쉽다는 것은 다릅니다. 저장소는 약 1.56TB이며, Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 배포를 권장합니다. 따라서 K3는 클라우드 및 엔터프라이즈 인프라 팀에게는 의미가 있지만, 일반적인 워크스테이션에 내려받아 사용하는 모델은 아닙니다.

그래도 이번 출시는 중요합니다. 이제 조직은 체크포인트를 직접 검토하고, 추론을 맞춤화하고, 파생 모델을 파인튜닝하며, 하나의 호스팅 엔드포인트에 전적으로 의존하지 않고 모델을 운영할 수 있는 실질적인 경로를 갖게 되었습니다. 그 대가는 하드웨어, 서빙 엔지니어링 및 라이선스 검토입니다.

Kimi K2.7에서 Kimi K3로 무엇이 바뀌었나?

K3는 단순히 버전 번호만 커진 Kimi K2.7이 아닙니다.

Kimi K2.7 Code는 K2.6을 기반으로 한 코딩 중심 에이전트 모델입니다. 모델 카드는 실제 소프트웨어 엔지니어링, 장시간 코딩 세션, 도구 사용 및 낮은 추론 토큰 소비를 강조합니다. K3는 이러한 역할을 코딩, 시각적 추론, 연구 및 엔드투엔드 지식 작업을 포괄하는 일반 플래그십 모델로 확장합니다.

컨텍스트 윈도우는 256K에서 100만 토큰으로 늘어났습니다. 총 파라미터는 1조 개에서 2.8조 개로 증가했고, 전문가 수는 384개에서 896개로 늘었습니다. 가격도 함께 상승했습니다.

$3.00/MTok$0.95/MTok$15.00/MTok$4.00/MTok$0.30/MTok$0.19/MTok
기능 Kimi K3 Kimi K2.7 Code
포지셔닝 일반 플래그십 코딩 중심 모델
총 파라미터 2.8T 1T
전문가 896개, 16개 활성 384개, 8개 활성
컨텍스트 윈도우 1M 256K
표준 입력
출력
캐시된 입력
웨이트 Kimi K3 라이선스에 따라 제공 제공됨

따라서 K3의 가치 제안은 “거의 무료인 프런티어 지능”이 아닙니다. 즉시 사용할 수 있는 종량제 API와 인프라를 직접 운영할 준비가 된 팀을 위한 공개 웨이트라는 두 가지 배포 경로를 제공하는, 프런티어에 근접한 에이전트 성능입니다.

공식 K2.7 Code 모델 카드에는 아키텍처, 벤치마크 방법론 및 배포 지침이 포함되어 있습니다.

Kimi K3는 100만 토큰 컨텍스트를 어떻게 처리하는가

100만 토큰 컨텍스트 윈도우를 통해 K3는 대규모 코드베이스, 기술 문서 모음, 긴 에이전트 기록 및 중간 도구 결과를 하나의 요청으로 처리할 수 있습니다.

이는 장시간 실행되는 에이전트에 특히 중요합니다. 코딩 모델은 수십 단계에 걸쳐 초기 사양, 저장소 구조, 터미널 출력, 테스트 실패, 이전 수정 사항 및 리뷰어 피드백을 유지해야 할 수 있습니다. 작업 중간에 이러한 제약 조건 중 하나라도 잃어버리면 에이전트가 생산적으로 보이지만 완료에는 실패하는 경우가 많습니다.

K3는 자동 컨텍스트 캐싱도 적용합니다. 개발자는 캐시 ID를 생성하거나 별도의 TTL 값을 설정할 필요가 없습니다. 요청 사이에 긴 접두부가 변경되지 않으면 시스템이 자동으로 캐시 적중을 시도합니다. 캐시된 입력 비용은 토큰 100만 개당 3.00달러가 아니라 0.30달러입니다.

하지만 컨텍스트 용량이 완벽한 컨텍스트 활용을 의미하지는 않습니다. 모델에 100만 토큰을 입력한다고 해서 모든 줄에 올바른 중요도를 부여한다는 보장은 없습니다. 입력이 길어지면 비용과 처리 시간이 증가하고 관련 없는 자료로 인해 주의가 분산될 수도 있습니다.

여전히 가장 합리적인 접근 방식은 먼저 관련성이 높은 파일을 검색하고, 캐싱을 위해 안정적인 참조 콘텐츠를 앞부분에 유지하며, 한도 내에 들어간다는 이유만으로 전체 지식 기반을 전송하지 않는 것입니다. Kimi의 API 가이드는 100만 토큰 컨텍스트와 자동 캐싱 동작을 설명합니다.

Kimi K3 API 가격은 더 이상 저가가 아니다

Moonshot의 공식 Kimi K3 API는 고정 종량제 가격을 적용합니다. 요청이 더 큰 컨텍스트 구간을 넘어가더라도 요금은 변경되지 않습니다.

$0.30$3.00$15.00
토큰 유형 토큰 100만 개당 가격
캐시된 입력
표준 입력
출력

캐시되지 않은 입력 토큰 100,000개를 사용하고 출력 토큰 20,000개를 생성하는 짧은 에이전트 작업의 예상 모델 비용은 다음과 같습니다:

(0.1 × $3) + (0.02 × $15) = $0.60

이제 캐시된 토큰 800,000개, 새 입력 토큰 50,000개 및 출력 토큰 50,000개를 사용하는 반복적인 장기 컨텍스트 워크플로를 생각해 보겠습니다:

(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14

캐싱 덕분에 두 번째 예시의 비용은 관리 가능한 수준이지만, K3는 분명히 기존의 “중국 모델은 API가 매우 저렴하다”는 공식에 들어맞지 않습니다.

Artificial Analysis는 K3의 Intelligence Index 작업 평균 비용을 0.94달러로 측정했습니다. 이는 GPT-5.6 Sol의 1.04달러에 근접하며 Opus 4.8의 1.80달러의 약 절반입니다. GLM-5.2는 동일한 평가 작업을 훨씬 저렴하게 완료했습니다.

비교 결과는 모델에 어디에서 액세스하는지에 따라서도 달라집니다.

GPT Proto의 Kimi K3 API는 현재 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러이며, 이는 Moonshot의 3달러/15달러 정가보다 10% 낮습니다. GPT Proto는 동일한 API 키와 공유 잔액으로 GPT-5.6 SolGLM-5.2도 제공하므로 별도의 공급자 계정 없이 작업 수준의 비교를 더 쉽게 수행할 수 있습니다.

따라서 K3의 가치 제안은 “거의 무료인 프런티어 지능”이 아닙니다. 즉시 사용할 수 있는 종량제 API와 인프라를 직접 운영할 준비가 된 팀을 위한 공개 웨이트라는 두 가지 배포 경로를 제공하는, 프런티어에 근접한 에이전트 성능입니다.

Kimi K3 API와 오픈 웨이트: 무엇을 사용해야 하는가?

 이제 Kimi K3는 개발자에게 실질적인 배포 선택지를 제공합니다. 두 경로 모두 모델 성능이 매력 요소이지만, 운영 방식은 완전히 다릅니다.

호스팅 Kimi K3 API Kimi K3 오픈 웨이트
토큰당 지불 가속기 용량을 구매하거나 임대
공급자가 확장, 캐싱, 업데이트 및 장애를 관리 팀이 서빙, 확장, 모니터링, 업그레이드 및 장애를 관리
평가 및 프로덕션으로 가는 가장 빠른 경로 데이터, 추론 및 모델 수정에 대한 가장 높은 통제력
호스팅 서비스는 텍스트, 이미지 및 동영상 입력을 문서화함 현재 공개 저장소 메타데이터는 텍스트와 이미지에 집중되어 있으므로 동영상 경로가 동일하게 지원되는지 확인한 후 이를 약속해야 함
1.56TB 다운로드 불필요 96개 웨이트 샤드로 약 1.56TB
클러스터 배포 프로젝트 불필요 Moonshot은 64개 이상의 가속기를 권장

아직 제품-시장 적합성을 검증하는 중이거나 트래픽이 가변적이거나 팀이 이미 대규모 모델 인프라를 운영하고 있지 않다면 먼저 API를 사용하세요. GPT Proto Kimi K3 API를 사용하면 하나의 키와 잔액으로 K3, GPT-5.6 Sol, GLM-5.2 및 기타 모델을 더 쉽게 비교할 수 있습니다.

프라이빗 배포, 파인튜닝, 맞춤형 추론 또는 공급자 독립성이 클러스터 운영을 정당화할 만큼 충분한 비즈니스 가치를 제공한다면 웨이트를 사용하세요. 상용 배포 전에 “오픈”이 MIT를 의미한다고 가정하지 말고 Kimi K3 라이선스를 검토하세요.

Kimi K3와 GLM-5.2, GPT-5.6 및 Opus 4.8 비교

벤치마크 승자가 자동으로 올바른 프로덕션 모델이 되는 것은 아닙니다. 유용한 선택은 무엇이 실패할 수 있는지, 워크플로가 얼마나 오래 실행되는지, 웨이트 소유가 중요한지에 따라 달라집니다.

모델 다음과 같은 경우 선택
Kimi K3 긴 멀티모달 에이전트 워크플로가 필요하고, 지금 호스팅 API를 사용하거나 Kimi K3 라이선스에 따른 오픈 웨이트 배포 경로를 원할 때
GPT-5.6 Sol 소유권보다 일반적인 추론 품질과 안정적인 프로덕션 성능이 중요할 때
Claude Fable 5 측정된 에이전트 지식 작업의 최고 성능이 필요하고 액세스할 수 있을 때
Claude Opus 4.8 복잡한 코딩, 연구 및 신중한 지시 따르기를 위해 이미 Claude 워크플로에 의존할 때
GLM-5.2 이미 웨이트를 사용할 수 있는 저비용 에이전트 코딩이 필요할 때
Kimi K2.7 Code 워크로드가 주로 코딩이며 K3의 높은 가격을 정당화하기 어려울 때

K3의 가장 명확한 사용 사례는 세 가지 조건이 함께 나타날 때입니다. 장시간 실행되는 작업, 멀티모달 입력, 그리고 모델 배포를 직접 제어해야 할 이유입니다. 이러한 요구 사항이 없다면 K3의 규모는 더 작은 문제에 대한 비싼 해답이 될 수 있습니다.

폭넓은 지능과 신뢰성이 우선이라면 GPT-5.6 Sol이 여전히 더 강력한 선택입니다. Opus 4.8은 성숙한 Claude 기반 코딩 또는 연구 워크플로를 갖춘 팀에 적합합니다. GLM-5.2는 이미 100만 토큰 컨텍스트와 더 낮은 작업 비용의 오픈 웨이트를 제공하므로 경제성 측면에서 더 어려운 경쟁자입니다.

현재 제 경험칙은 간단합니다. 오픈 웨이트와 장기 멀티모달 에이전트가 중요하면 K3를 선택하세요. 모델 소유보다 신뢰성이 중요하면 GPT-5.6 또는 Opus를 선택하세요. 비용이 협상할 수 없는 제약 조건이라면 GLM-5.2를 선택하세요.

아직 GPT Proto를 통해 Kimi K3를 사용할 수 있는가?

예. Kimi K3는 이제 GPT Proto Kimi K3 API를 통해 사용할 수 있습니다.

현재 GPT Proto 요금은 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러이며, Moonshot의 현재 3달러/15달러 정가보다 10% 낮습니다. GPT Proto API 키와 함께 모델 문자열 kimi-k3를 사용하면 K3의 장기 컨텍스트 코딩, 멀티모달 분석, 도구 호출 및 구조화된 출력 기능에 액세스할 수 있습니다.

동일한 키와 공유 잔액으로 GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 및 200개 이상의 텍스트, 이미지, 동영상 및 오디오 모델도 사용할 수 있습니다. 따라서 프로덕션 트래픽을 변경하기 전에 동일한 저장소 또는 에이전트 워크플로에서 K3를 대안 모델과 실용적으로 테스트할 수 있습니다.

GPT Proto에서 Kimi K3를 사용해 보거나 전체 GPT Proto AI 모델 갤러리를 둘러볼 수 있습니다. 모델의 웨이트와 기술 보고서는 이제 공개되었지만, 독립적인 배포 테스트, 양자화, 처리량 데이터 및 프레임워크 지원이 성숙해지면 이 글을 다시 검토해야 합니다.

최종 평가: 근접했지만 벤치마크는 여전히 중요하다

Kimi K3는 파라미터 수 때문에 주목받는 단순한 대형 중국 모델이 아닙니다. 독립적인 테스트는 더 중요한 결론을 뒷받침합니다. K3는 자동화, 장기 지식 작업 및 에이전트 실행에서 프런티어 시스템과 경쟁력 있는 성능을 보입니다.

그렇다고 전체적으로 GPT-5.6 Sol 또는 Claude Fable 5보다 뛰어나다는 의미는 아닙니다. 측정된 환각 증가도 사라지지 않습니다. 7월 28일 달라진 점은 배포입니다. 약속된 웨이트, 라이선스, 모델 카드 및 기술 보고서가 이제 공개되었습니다.
따라서 K3는 동급에서 가장 뛰어난 오픈 웨이트 옵션 중 하나이지만, 이 표현에는 두 가지 주석이 필요합니다. 라이선스는 MIT가 아닌 자체 라이선스이며, 1.56TB 저장소와 64개 이상의 가속기 권장 사양으로 인해 자체 호스팅은 일반적인 개발팀의 범위를 넘어섭니다.
제 결론은 이렇습니다. 먼저 API를 사용해 K3가 실제 작업을 개선하는지 확인하세요. 직접 인프라 공급자가 되는 데 따르는 통제, 맞춤화 또는 데이터 경계가 그 비용을 정당화할 때만 웨이트로 전환하세요.

크리에이티브 스튜디오

프로덕션 API로 이미지, 영상 등을 생성해 보세요.

만들기 시작하기
크리에이티브 스튜디오
관련 모델
모든 모델
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
20% OFF
Z-AI
by Z-AI
10% OFF

자주 묻는 질문

Kimi K3란 무엇인가요?

Kimi K3는 Moonshot AI가 개발한 2.8조 파라미터 규모의 멀티모달 AI 모델입니다. 장기 코딩, 지식 작업, 추론, 시각적 이해 및 에이전트 워크플로를 위해 설계되었습니다.

Kimi K3는 언제 출시되었나요?

Kimi K3는 2026년 7월 16일 출시되었습니다. Moonshot은 전체 모델 웨이트를 2026년 7월 27일까지 공개할 예정이라고 밝혔습니다.

Kimi K3는 오픈 소스인가요?

Kimi K3는 오픈 웨이트 모델입니다. Moonshot AI는 자체 Kimi K3 라이선스에 따라 전체 체크포인트, 모델 카드, 추론 코드 및 기술 보고서를 공개했습니다. 학습 데이터는 공개되지 않았고, 라이선스에는 대규모 Model-as-a-Service 사업 및 초대형 상용 제품에 대한 조건이 포함되어 있으므로 “완전한 오픈 소스”라는 표현은 지나치게 포괄적입니다.

Kimi K3의 컨텍스트 윈도우는 얼마인가요?

Kimi K3는 100만 토큰 컨텍스트 윈도우를 지원합니다. 반복되는 긴 접두부에 대한 자동 컨텍스트 캐싱도 제공합니다.

Kimi K3 API 비용은 얼마인가요?

공식 Kimi K3 API는 표준 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러, 캐시된 입력 토큰 100만 개당 0.30달러입니다.

Kimi K3가 GPT-5.6 Sol보다 뛰어난가요?

전체적으로는 아닙니다. Kimi K3는 일부 에이전트 및 전문 테스트에서 GPT-5.6 Sol을 앞서거나 근접하지만, Moonshot과 독립적인 테스트 모두 더 폭넓은 지능에서는 GPT-5.6 Sol이 앞선다고 평가합니다.

Kimi K3가 Claude Fable 5보다 뛰어난가요?

현재 증거에 따르면 그렇지 않습니다. K3는 여러 장기 및 에이전트 작업에서 Fable 5에 근접하지만, 출시 시점에 이용 가능한 더 광범위한 독립 평가에서는 Fable 5가 여전히 앞서 있습니다.

Kimi K3가 GLM-5.2보다 뛰어난가요?

Kimi K3는 측정된 지능 및 에이전트 성능의 상한이 더 높습니다. GLM-5.2는 더 저렴하고 작으며 이미 오픈 웨이트 모델로 제공되므로 더 실용적인 선택일 수 있습니다.v

Kimi K3를 로컬에서 실행할 수 있나요?

웨이트는 다운로드할 수 있지만, 실용적인 배포는 일반적인 의미의 로컬 실행이 아닙니다. 공식 저장소는 약 1.56TB이며 Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 구성을 권장합니다.

Kimi K3 API와 오픈 웨이트 중 무엇을 사용해야 하나요?

평가, 가변적인 트래픽 및 관리형 운영에는 API부터 시작하세요. 프라이빗 배포, 파인튜닝, 맞춤형 추론 또는 공급자 독립성이 하드웨어, 서빙 작업 및 라이선스 검토를 정당화할 때 웨이트를 사용하세요.
2026년 개발자를 위한 최고의 AI API: 10개 플랫폼 비교

2026년 개발자를 위한 최고의 AI API: 10개 플랫폼 비교

TL;DR Best direct APIs: OpenAI is the safest general-purpose default; Anthropic Claude is strongest for coding and long-running agents; Gemini suits low-cost multimodal prototyping; and DeepSeek leads on text-token price. Best multi-model options: OpenRouter is the clearest choice for testing many LLMs. GPTProto is the stronger fit when one product needs text, image, and video models under one API key and shared balance. Best infrastructure choices: Amazon Bedrock fits AWS-governed enterprise deployments, while Replicate, fal.ai, and Together AI are better suited to open-model or generative-media inference. There is no universal winner. Compare workload fit, model coverage, real billing units, production controls, and switching cost. Prices and availability were checked on July 14, 2026; verify live provider pages before deployment.

Tiffany Layne | 2026-07-15

GPT-5.6 Sol vs Claude Fable 5: 토큰당 더 저렴한가, 아니면 믿고 쓰기에 더 저렴한가? (2026)

GPT-5.6 Sol vs Claude Fable 5: 토큰당 더 저렴한가, 아니면 믿고 쓰기에 더 저렴한가? (2026)

2주 전만 해도 이 비교의 답은 지루했습니다. GPT-5.6 Sol을 사용할 수 없었기 때문에 Claude Fable 5를 선택하면 됐습니다. Sol은 약 20개 기관만 참여할 수 있는 정부 검증 프리뷰 안에 갇혀 있었습니다. 이제 그 제약은 사라졌습니다. OpenAI는 GPT-5.6 제품군인 — Sol, Terra, Luna — 을 2026년 7월 9일 에 정식 출시했고, Fable 5는 미국 상무부가 출시를 중단시켰던 수출 통제를 해제한 뒤 7월 1일부터 전 세계에서 사용할 수 있었습니다. 따라서 질문이 다시 유효해졌고, 더 이상 접근성에 관한 문제가 아닙니다. 어떤 모델의 실패 방식을 감당할 수 있는지에 관한 문제입니다. 먼저 제가 내린 결론을 말한 다음, 근거를 보여드리겠습니다. 요약 Sol은 재무팀이 중요하게 보는 모든 기준에서 더 저렴합니다. GPTProto에서 Sol은 입력/출력 토큰 100만 개당 4달러/24달러인 반면 Fable 5는 8달러/40달러이며, 토큰이 아니라 완료된 작업을 기준으로 측정하면 격차는 더 커집니다. 반면 Fable 5의 핵심 설계 목표는 예측 가능한 동작입니다. 위험 신호가 감지된 프롬프트는 더 안전한 모델로 전환되며, Sol을 감독 없는 파이프라인에 연결하는 사람이라면 걱정해야 할 습관도 아직 나타나지 않았습니다. 독립 평가 기관 METR은 Sol이 테스트한 모든 공개 모델 중 보상 해킹 비율이 가장 높다고 지적했습니다. 따라서 "토큰당 더 저렴한 모델"은 명확히 Sol입니다. "아무도 지켜보지 않을 때 믿고 쓰기에 더 저렴한 모델"은 Fable입니다. 이 글의 대부분은 이 두 문장이 왜 서로 상쇄되지 않는지 설명합니다. 두 모델 모두 하나의 GPTProto 키와 잔액으로 사용할 수 있으므로 전체 스택을 하나의 답변에 맡기지 않고 작업별로 모델을 라우팅할 수 있습니다. 자세한 내용은 글 마지막에서 다룹니다.

Michael Johnson | 2026-07-10

코딩을 위한 MiniMax M3: 벤치마크, 실제 가격, API로 호출하는 방법 (2026)

코딩을 위한 MiniMax M3: 벤치마크, 실제 가격, API로 호출하는 방법 (2026)

MiniMax M3는 코딩에 적합할까요? 짧게 답하면, 에이전트 기반 작업과 여러 파일을 다루는 작업에는 적합합니다. 다만 다른 내용을 읽기 전에 먼저 알려드릴 두 가지 주의점이 있습니다. 주요 코딩 점수 대부분은 MiniMax가 자체 인프라에서 직접 측정했으며, "100만 토큰 컨텍스트"에는 특히 코딩 에이전트에 큰 영향을 주는 512K 기준 가격 급등 구간이 있습니다. 이런 점을 알고 있다면 두 가지 모두 충분히 관리할 수 있습니다. 하지만 대부분의 출시 관련 보도에서는 이 내용이 명확하게 드러나지 않습니다. M3를 둘러싼 코딩 관련 설명이 하나의 숫자, 즉 SWE-Bench Pro의 59%로 단순화되었고, 그 숫자가 충분한 검토 없이 과도한 역할을 하고 있기 때문에 이 글을 씁니다. 이 글에서는 실제 모델의 정체, 독립적인 측정 결과, 실제 코딩 작업에서의 비용, 그리고 GPTProto API를 통해 호출하는 방법을 다룹니다. 결론만 알고 싶다면 이렇게 요약할 수 있습니다. 모든 주요 모델에 동일한 테스트를 수행하는 한 독립 리뷰어는 M3를 "실제 코딩에서는 GPT와 Opus에 근접하지만, 아직 그들을 넘어서지는 못한 모델"로 평가했습니다. 중립적인 벤치마크 결과도 이와 일치합니다.

Schuyler Stacy | 2026-07-02

코딩을 위한 GLM-5.2 vs Kimi K3: 2026년 개발자에게 더 나은 모델은?

코딩을 위한 GLM-5.2 vs Kimi K3: 2026년 개발자에게 더 나은 모델은?

TL;DR: 어렵고 장시간 실행되거나 시각적 요소가 필요한 작업에서는 Kimi K3가 더 강력한 코딩 모델입니다. Moonshot이 공개한 코딩 비교에서 GLM-5.2를 앞서며, 호스팅 서비스에서 이미지와 동영상도 입력으로 받을 수 있습니다. GLM-5.2는 일상적인 저장소 작업의 기본값으로는 여전히 더 낫습니다. 비용이 훨씬 저렴하고 운영하기 쉬우며, 허용 범위가 넓은 MIT 라이선스를 사용하기 때문입니다. Kimi K3도 이제 가중치를 공개했지만, 1.56TB 규모의 저장소, 64개 이상의 가속기를 권장하는 배포 환경, 맞춤형 라이선스로 인해 자체 호스팅에는 훨씬 더 큰 투자가 필요합니다. 역량이 병목이면 Kimi를, 비용과 운영 단순성이 매일 중요하면 GLM을 선택하세요. GLM-5.2와 Kimi K3 Code 비교에서 흥미로운 점은 두 모델 모두 React 컴포넌트를 작성하거나 짧은 알고리즘을 해결할 수 있다는 사실이 아닙니다. 이 수준의 모델은 이미 그 기준을 충족합니다. 중요한 질문은 과제가 복잡해졌을 때 어떤 일이 발생하는가입니다. 저장소 감사, 여러 파일에 걸친 마이그레이션, 스크린샷에서만 나타나는 버그, 또는 여러 시스템의 일관성을 유지해야 하는 실행 가능한 Three.js 프로토타입 같은 작업 말입니다. 가격 차이가 중요해지기 시작하는 지점도 바로 여기입니다. Kimi K3는 가장 어려운 공개 테스트에서 더 나은 성능을 보이지만, 공식 출력 가격은 GLM-5.2보다 세 배 이상 비쌉니다. 수천 건의 일반적인 리뷰를 처리하는 팀이라면 GLM을 사용할 때 달러당 더 많은 작업을 수행할 수 있습니다. 반면 하나의 까다로운 시각적 프로젝트를 해결하려는 개발자라면 K3에 기꺼이 비용을 지불할 수 있습니다.

Tiffany Layne | 2026-07-28