TL;DR
更新 — 2026年7月28日:Kimi K3の完全な重みが公開されました。Moonshot AIは、公式リポジトリで2.8Tチェックポイント、技術レポート、Kimi K3 Licenseを公開しました。このリリースにより、GPT-5.6 Solに対するK3の制御性とデプロイ面での優位性は高まりましたが、独立ベンチマークの結果が変わったわけではなく、K3を自前で運用するコストが下がったわけでもありません。
Kimi K3はトークン単価が安く、GPT-5.6 Solは重要な本番エージェントのデフォルトとして優れています。この2つは両立します。
価格表が示すほど差は大きくありません。Artificial Analysisのテストでは、GPT-5.6 Sol maxのIntelligence Indexは59で、Kimi K3は57です。一方、測定されたタスクあたりのコストはSolが約1.04ドル、K3が0.95ドルで、公式の出力価格から想像される2倍の差ではありません。
簡単に言えば、幅広い信頼性、コーディングエージェントの性能、OpenAIのホスト型ツール群を重視するなら GPT-5.6 Sol を選びます。動画入力、長文コンテキスト、低い定価、または公開されたオープンウェイトへのアクセスが判断を左右するならKimi K3を選びます。
Kimi K3 対 GPT-5.6 Sol:簡単な結論
| 最も重視する点が… |
選ぶモデル |
理由 |
| 幅広い知能と本番エージェント |
GPT-5.6 Sol |
独立したIntelligence、Coding、Agenticの各指数で優位 |
| 科学技術コーディングまたは長文コンテキスト推論 |
Kimi K3をテスト |
K3はSciCodeで優位、AA-LCRでもSolをわずかに上回る |
| この2モデルで最も安いトークン料金 |
Kimi K3 |
公式価格は100万トークンあたり3ドル/15ドル、Solは5ドル/30ドル |
| 測定上のタスクあたりコストが最も安い |
Kimi K3(僅差) |
現在のAA比較では約0.95ドル対1.04ドル |
| 目に見える開始が速い |
Kimi K3 |
初回トークンまでの測定時間は4.23秒、Sol maxは136.8秒 |
| 出力開始後の生成が速い |
GPT-5.6 Sol |
毎秒63トークン、K3は毎秒39トークン |
| ネイティブ動画理解 |
Kimi K3 |
K3はテキスト、画像、動画に対応し、Solはテキストと画像に対応 |
| 成熟したホスト型ツールとコンピューター操作 |
GPT-5.6 Sol |
OpenAIはウェブ検索、ファイル検索、コードインタープリター、コンピューター操作、MCPなどを文書化 |
| 日常利用向けのより安価なモデル |
GPT-5.6 Terra |
GPT Protoでは、入力・出力の両方でTerraがK3より安い |
| 大量利用でコスト重視のトラフィック |
GPT-5.6 Luna |
この4モデルの中で最も低価格 |
これは永続的な順位ではなく、現時点の結果です。K3は2026年7月16日にリリースされたばかりで、両社はまだ提供方式と推論制御を変更しています。
仕様とAPI料金
| |
|
|
| 仕様 |
Kimi K3 |
GPT-5.6 Sol |
| プロバイダー |
Moonshot AI |
OpenAI |
| コンテキストウィンドウ |
1,048,576 tokens |
1,050,000 tokens |
| 最大出力 |
デフォルト131,072。総コンテキスト予算内でさらに拡張可能 |
128,000 tokens |
| ネイティブ入力 |
テキスト、画像、動画 |
テキスト、画像 |
| 出力 |
テキスト |
テキスト |
| 公式入力価格/100万 |
$3.00 |
$5.00 |
| 公式キャッシュ済み入力/100万 |
$0.30 |
$0.50 |
| 公式出力価格/100万 |
$15.00 |
$30.00 |
| GPT Proto入力価格/100万 |
$2.70 |
$4.00 |
| GPT Proto出力価格/100万 |
$13.50 |
$24.00 |
| モデル文字列 |
kimi-k3 |
gpt-5.6-sol |
| 2026年7月28日時点の重みの提供状況 |
Kimi K3 Licenseの下で完全な2.8Tチェックポイントを公開 |
なし |
| セルフホスティング規模 |
約1.56 TB。Moonshotは64基以上のアクセラレーターを推奨 |
該当なし |
コンテキスト上限は実質的に同等です。重要な違いは、各モデルがそのコンテキストをどう扱うか、どの入力形式に対応するか、提供基盤に何が必要かです。
OpenAIの直接APIでは長文コンテキスト追加料金も適用されます。入力が272Kトークンを超えるプロンプトは、リクエスト全体について入力が2倍、出力が1.5倍で請求されます。Moonshotが公開しているK3料金には、より大きなコンテキスト用の追加階層はありません。エージェントが500Kトークンのプロンプトを繰り返し送る場合、この料金差は見出し上のコンテキスト数より重要になる可能性があります。
K3のアーキテクチャとリリースの詳細は、Kimi K3とは?をご覧ください。ここでは購入とデプロイの判断に焦点を当てます。
ベンチマーク:全体ではSolが優位だが、K3にも明確な強みがある
Artificial Analysisでは現在、GPT-5.6 Sol maxがより強い総合プロファイルを示しています。ただし差は大きくありません。
| |
|
|
|
| 独立評価 |
Kimi K3 |
GPT-5.6 Sol max |
勝者 |
| Intelligence Index |
57 |
59 |
Sol |
| Coding Index |
76.2 |
77.4 |
Sol |
| Agentic Index |
50.1 |
54.0 |
Sol |
| Terminal-Bench v2.1 |
85% |
88% |
Sol |
| SciCode |
59% |
56% |
K3 |
| Humanity’s Last Exam |
44% |
47% |
Sol |
| GPQA Diamond |
94% |
94% |
引き分け |
| AA-LCR長文コンテキスト推論 |
75% |
74% |
K3 |
| AA-Briefcase |
1,543 Elo |
1,496 Elo |
K3 |
| MMMU-Pro視覚推論 |
81% |
83% |
Sol |
妥当な結論は「Solがすべてに勝つ」ではありません。そうではないからです。Solは総合指数とターミナル作業で優位ですが、K3も科学技術コーディング、長文コンテキスト推論、知識労働の成果物で十分な強さを示します。
評価ラッパーも重要です。Moonshot独自のベンチマーク表では、タスクに応じてKimiCode、Claude Code、Codexが使われています。したがってベンダーのチャートは有用な証拠ですが、厳密な実験室比較ではありません。本番では、最終的な評価者は自分のエージェント、ツール、失敗条件であるべきです。
料金:トークンが安くても、タスクが大幅に安くなるとは限らない
公式定価では、K3の出力料金はSolの半分です。100万トークンあたり15ドル対30ドルです。GPT Protoでは同じ料金が13.50ドル対24ドルです。
入力10万トークン、出力2万トークンの同一リクエストなら、GPT Protoでの計算は簡単です。
Kimi K3: (0.10 × $2.70) + (0.02 × $13.50) = $0.54
GPT-5.6 Sol: (0.10 × $4.00) + (0.02 × $24.00) = $0.88
トークン使用量が同じならK3は39%安くなります。しかし推論モデルが同じトークン数を使うことはほとんどありません。同じタスクでK3が4万出力トークンを生成すると、コストは0.81ドルに上がり、Solの0.88ドルに近づきます。
そのため、現在のArtificial Analysisのタスクあたりコストの結果は価格表より有用です。加重比較では、Intelligence IndexタスクあたりK3は約0.95ドル、Sol maxは1.04ドルです。K3の方が安いものの、その差は約9%にすぎません。
初期のRedditでの議論も、より混乱した形で同じ論点に至りました。K3の長い推論により自分たちのテストでは成功した実行のコストが2~3倍になったというユーザーもいれば、推論設定が混在している、またはタスクあたりではなくベンチマーク総額を比較していると指摘するユーザーもいました。どちらの指摘も有用ですが、普遍的なベンチマークではありません。
実務上の原則は、総入力、キャッシュ済み入力、推論出力、回答出力、リトライ、経過時間を記録することです。「100万トークンあたりの価格」は、表の1列にすぎません。
速度:K3は早く開始し、Solは速く書き出す
Artificial Analysisの測定では、K3の初回トークンまでが4.23秒、Sol maxが136.8秒でした。生成開始後は順序が逆転し、Solは毎秒63トークン、K3は毎秒39トークンでした。
どちらのモデルが速く感じられるでしょうか?
-
ストリーミングチャットや対話型コーディングアシスタントでは、K3の早い初回トークンにより応答性が高く感じられます。
-
長いレポートやエージェントのトレースでは、Solの高い出力速度が遅い開始時間を一部取り戻します。
-
バックグラウンドエージェントでは、どちらの数値も、タスク全体の時間やリトライなしで完了するかほど重要ではありません。
これらの数値はSLAではなく、測定時点のスナップショットとして扱ってください。プロバイダーの容量、プロンプトキャッシュ、推論の強度、地域ルーティングによって変動します。
開発者体験:隠れた違い
K3は、既存のあらゆる推論ループのドロップイン置換ではありません。Moonshotによれば、このモデルは保持された思考履歴に敏感です。完全な過去の推論状態を返さないシステムや、セッション途中でK3に切り替えるシステムでは、不安定な結果が生じる可能性があります。Moonshotは互換性を検証済みの構成を推奨し、セッション途中のモデル切り替えに注意を促しています。
この挙動はインフラにも影響します。初期のコミュニティテスター1人は、自分のワークロードでK3の推論が出力の73~83%を消費し、視覚タスクによっては50~60分かかったと報告しています。同じテスターは、より長時間存続するストリーミング接続と大きなトークン予算を必要としました。これは1人のワークロードであり、一般的なレイテンシーの主張ではありません。それでも移行前のチェック項目として有用です。
すでにOpenAI Responses APIを利用しているなら、Solの方が整理された選択肢です。OpenAIはSolのモデルページで、構造化出力、関数呼び出し、ウェブ・ファイル検索、コードインタープリター、ホスト型シェル、コンピューター操作、MCPなどを文書化しています。代償は高い定価と、ダウンロード可能な重みの経路がないことです。
K3には、Solが現在対抗できない開発者向けの利点が2つあります。ホスト型製品でのネイティブ動画入力と、公開されたモデル重みです。後者の利点は具体化しました。Moonshot AIは完全なチェックポイント、技術レポート、vLLM、SGLang、TokenSpeed向けのデプロイガイダンスを公開しています。
この制御性には2つのコストがあります。第一に、Kimi K3 LicenseはMITではなく独自ライセンスで、大規模なModel-as-a-Service事業や非常に大規模な商用製品に条件を追加しています。第二に、公式リポジトリは約1.56 TBで、Moonshotは64基以上のアクセラレーターを備えたスーパーノード構成を推奨しています。オープンウェイトによってセルフホスティングは可能になりますが、経済的なデフォルトになるわけではありません。
そのため、ホスト型プラットフォームとしての分かりやすさではSolが優位です。K3は、より強力な「デプロイを選べる」選択肢になりました。まずAPIで始め、データ管理、カスタマイズ、インフラ経済性が作業を正当化するなら、セルフマネージド推論へ移行できます。
Kimi K3 API 対 オープンウェイト
ホスト型Kimi K3 APIとオープンウェイトのリリースは、異なる問題を解決します。APIはK3を従量課金サービスに変えます。リクエストを送信し、トークン料金を支払い、キャッシュ、ルーティング、スケーリング、障害対応をプロバイダーに任せます。重みを使う場合、K3はチームが所有すべきインフラになります。
| 次の場合はホスト型APIを選びます… |
次の場合はオープンウェイトを選びます… |
| 今週中にK3を評価したい |
データを自社環境内に保持する必要がある |
| クラスターの購入・運用よりトークン課金の方が簡単 |
カスタム推論、ファインチューニング、デプロイ制御が必要 |
| マネージドスケーリング、キャッシュ、可用性が必要 |
専用インフラを正当化できるほど利用量が大きく安定している |
| 文書化されたホスト型動画入力経路が必要 |
法務・インフラチームがチェックポイントの機能同等性とライセンスを確認済み |
私の判断では、ほとんどのチームはAPIから始めるべきです。1.56 TBのチェックポイントと64基以上のアクセラレーター推奨は、損益分岐点を高くします。重みが重要なのは、ホスト型プロバイダーから離脱する道を作るからであり、ダウンロードすれば自動的にトークン課金より安くなるからではありません。
Kimi K3 対 GPT-5.6 Sol、Terra、Luna
最も有用な比較はKimi K3とGPT-5.6 Solだけではありません。K3は性能面でSolと競合しますが、API価格はTerraに近い位置にあります。
| |
|
|
| GPT Proto上のモデル |
100万あたりの入力/出力 |
最初に試す用途 |
| GPT-5.6 Sol |
$4 / $24 |
品質の上限、難しいコーディング、長時間のエージェント実行 |
| Kimi K3 |
$2.70 / $13.50 |
長時間のマルチモーダルエージェント、動画入力、将来オープンウェイトでのデプロイが必要になる可能性のあるワークロード |
| GPT-5.6 Terra |
$2 / $12 |
バランスの取れた本番トラフィック |
| GPT-5.6 Luna |
$0.80 / $4.80 |
小型モデルの評価を通過する大量タスク |
私のルーティング推奨は明快です。Solで品質の上限を確認します。動画、長文コンテキストの挙動、または重みのロードマップが重要ならK3をテストします。次に、Terraがより低い料金で十分な品質を維持できるかを確認します。分類、抽出、ルーティング、短いコード支援なら、フロンティアモデルの料金を払う前にLunaを試してください。
4モデルすべてが、1つのキーと共通残高でGPT Protoモデルコレクションから利用できます。
両方のモデルで同じプロンプトを実行する
次のPythonスクリプトは、GPT Protoが文書化しているChat Completionsエンドポイントを使用し、モデル文字列だけを切り替えます。これは接続性と出力を確認するテストであり、公平なベンチマークではありません。モデルのデフォルトや推論設定は異なる場合があります。
import json
import os
import time
import requests
API_URL = "https://gptproto.com/v1/chat/completions"
API_KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {
"Authorization": API_KEY,
"Content-Type": "application/json",
}
PROMPT = """You are reviewing a production Python service.
Identify the three highest-risk failure modes in the code supplied by the user,
propose a minimal patch, and return a short verification plan.
If evidence is missing, say what you would inspect instead of inventing it."""
def run(model: str) -> dict:
payload = {
"model": model,
"messages": [{"role": "user", "content": PROMPT}],
"stream": False,
}
started = time.perf_counter()
response = requests.post(
API_URL,
headers=HEADERS,
json=payload,
timeout=900,
)
response.raise_for_status()
data = response.json()
data["client_wall_time_seconds"] = round(
time.perf_counter() - started,
2,
)
return data
for model_name in ("kimi-k3", "gpt-5.6-sol"):
result = run(model_name)
print(f"\n=== {model_name} ===")
print("wall time:", result["client_wall_time_seconds"])
print("usage:", json.dumps(result.get("usage", {}), indent=2))
print(result["choices"][0]["message"]["content"])
依存関係をpip install requestsでインストールし、GPTPROTO_API_KEYを設定して、どちらのモデルも見た可能性が低い非公開タスクを使います。本格的な評価では、代表的なタスクを少なくとも20件実行し、完了率、リグレッション、リトライ、総コスト、レビュー時間を評価してください。
最終結論
GPT-5.6 Solは、より安全な一般向け推奨としてこの比較に勝ちます。独立した総合、コーディング、エージェント指数で優位に立ち、初回トークン後の生成も速く、OpenAIのツールエコシステムに自然に適合します。
Kimi K3は、条件付きでより興味深い選択肢です。一部のコーディングおよび長文コンテキスト評価ではSolを上回れるほど近い性能を持ち、トークン単価が安く、ホスト型サービスで動画を受け付け、公開済みのオープンウェイトチェックポイントも提供します。代償は、より重い推論挙動、独自ライセンス、一般的な開発者向けハードウェアではなく大規模アクセラレータークラスターを想定したセルフホスティング規模です。
実際のアプリケーション向けに選ぶなら、Kimi K3とGPT-5.6 Solだけで決めないでください。TerraとLunaもテストしましょう。最適な本番モデルとは、最も派手なローンチチャートを持つモデルではなく、タスクレベルの受け入れテストを最も低コストで通過するモデルです。