更新 — 2026年7月28日:Moonshot AIは、Kimi K3の完全な重み、モデルカード、カスタムライセンス、技術レポートを公開しました。これにより、Kimi側の提供状況に関する疑問は解消されました。ただし、2.8兆パラメータモデルのセルフホスティングが容易になったわけではありません。公式リポジトリは約1.56 TBあり、Moonshotは64基以上のアクセラレーターを備えたスーパーノード構成を推奨しています。
Qwen 3.8 MaxとKimi K3の比較は、2つの巨大な中国製AIモデルによる単純な対決に見えます。Alibabaの2.4兆パラメータのプレビュー版と、Moonshot AIの2.8兆パラメータのフラッグシップモデルです。数字からは単純な結論が導かれます。より大きなモデルが勝つはずだ、と。
しかし、入手可能な証拠はそのような結果を示していません。また、開発者にとって最も有用な比較でもありません。
2026年7月23日時点で、Qwen 3.8 MaxはAlibabaのToken Planを通じて提供される、なお変化の続くプレビューです。一方、Kimi K3にはすでに文書化されたAPI、公開済みのトークン価格、100万トークンのコンテキストウィンドウ、完全な重みをリリースする日付付きの計画があります。性能差は小さいかもしれません。しかし、製品としての準備状況には差があります。
私の判断は明快です。今日、実際のアプリケーションを構築し、予算を立てる必要があるなら、Kimi K3のほうが安全な選択です。Qwen 3.8 Max Previewは、特にAlibabaのプロモーションCreditsによって低コストで試せる間は、コーディングワークフローでテストする価値があります。しかし、本番採用を決めるには、まだ安定した情報が十分に提供されていません。
要約:現時点で本番環境に安全なのはKimi K3
従来型のAPI、予測可能なトークン単価、ネイティブな画像・動画理解、または今すぐ顧客向け製品の背後に配置できるモデルが必要なら、Kimi K3を選びましょう。すでにAlibabaのコーディングエコシステムを利用しており、将来性のある新モデルを低いプロモーションコストで試したいなら、Qwen 3.8 Max Previewを選びましょう。
公開時点で利用できた唯一の詳細な同条件のコーディングテストでは、Kimi K3が83点、Qwen 3.8 Maxが80点でした。この3点差は有用な証拠ですが、普遍的な順位を示すものではありません。テストでは、Qwenはより明確なシステム境界と完璧なツール実行を示し、Kimiは修正履歴と再生成をより完全に処理しました。両モデルとも、事実確認による修正が必要な、裏付けのない推論を行いました。
平たく言えば、現時点で導入判断ではKimiが勝っています。Qwenは性能競争に敗れたわけではありません。勝ったと宣言するには、まだ早すぎるのです。
Qwen 3.8 MaxとKimi K3の概要
| カテゴリー |
Qwen 3.8 Max |
Kimi K3 |
| 製品ステータス |
安定した本番API |
安定した本番API |
| 総パラメータ数 |
2.4T |
2.8T |
| アクティブパラメータ数 |
95B |
104B |
| コンテキストウィンドウ |
最大100万トークン |
1,048,576トークン |
| 入力 |
テキスト、画像、動画 |
テキスト、画像、動画 |
| 公式API価格 |
$2/M(入力)、$6/M(出力) |
$3/M(入力)、$15/M(出力) |
| GPT Protoでの利用 |
今すぐ利用可能 |
今すぐ利用可能 |
| オープンウェイト |
発表済み、まだダウンロード不可 |
公開済み |
| ホスト型APIに最適な用途 |
コスト重視のマルチモーダルコーディングと長時間稼働するエージェント |
修正の多いエージェントとKimi固有のワークフロー |
| セルフホスティングに最適な用途 |
チェックポイントとライセンスの公開を待つ |
データセンター規模のハードウェアを備えたKimi K3 |
比較はより対等になったが、導入方法には依然として違いがある
Qwen3.8-MaxとKimi K3は、どちらも本番利用可能なAPIモデルになりました。主な違いは、もはや「プレビュー対本番」ではありません。現在の違いは、ホスト型APIの価値と、すぐに利用できるオープンウェイトの所有権です。
Qwen 3.8 Maxは安定した本番APIに
Alibabaは2026年8月3日、安定版のqwen3.8-maxモデルをリリースしました。これにより、従来のPreview時代の位置づけは、通常の従量課金API利用へと置き換えられました。
本番リリースでは、1リクエストあたり約950億のアクティブパラメータを持つ、2.4兆パラメータのSparse Mixture-of-Expertsアーキテクチャが文書化されています。最大100万トークンのコンテキストウィンドウ、最大128Kの出力トークン、テキスト・画像・動画入力に対応します。
これにより、実用面での比較は変わります。Qwen3.8-Maxは、従来のCreditsベースのPersonal Token Planに頼ることなく、顧客向けアプリケーション、コーディングエージェント、マルチモーダル分析などの本番ワークロードで評価できるようになりました。
公式価格もKimi K3より低く設定されています。
| モデル |
入力価格 |
出力価格 |
| Qwen3.8-Max |
100万トークンあたり$2 |
100万トークンあたり$6 |
| Kimi K3 |
100万トークンあたり$3 |
100万トークンあたり$15 |
ホスト型APIを利用するチームにとって、GPT Proto上のQwen3.8-Maxは、実験的なエンドポイントではなく、本番環境で真剣に検討できる選択肢になりました。
ただし、Alibabaが発表したオープンウェイトのチェックポイントは、まだリリースされていません。最終的な重み、ライセンス、セルフホスティング条件が正式公開されるまでは、利用可能だと想定しないでください。
Kimi K3はダウンロード可能な重みを公開済み
Kimi K3は、ホスト型APIとダウンロード可能なチェックポイントの両方で利用できます。Moonshot AIは、モデルの重み、モデルカード、技術レポート、導入ガイド、カスタムライセンスを公開しています。
Kimi K3は総パラメータ数2.8兆、トークンごとのアクティブパラメータ数は約1,040億です。導入ドキュメントでは、vLLM、SGLang、TokenSpeedなどのフレームワークが対象となっており、管理対象またはプライベートなインフラストラクチャへの移行経路がより明確です。
そのため、ダウンロード可能な重み、導入環境の所有権、または今すぐのセルフホスティングが絶対条件である場合、Kimi K3のほうが実用的な選択肢です。
オープンウェイトだからといって、Kimi K3をローカルで簡単かつ安価に実行できるわけではありません。依然として数兆パラメータ規模のモデルであり、データセンター規模のストレージ、メモリ、ネットワーク、アクセラレーター容量が必要です。また、カスタムライセンスにより、非常に大規模な商用製品やModel-as-a-Serviceの導入に条件が課される可能性があります。
導入方法の違いが意味すること
| 導入要件 |
より適した出発点 |
理由 |
| ホスト型の本番API |
Qwen 3.8 Max |
公式の出力トークン価格が大幅に低い安定API |
| マルチモーダルコーディングと視覚分析 |
Qwen 3.8 Max |
テキスト、画像、動画のネイティブ入力 |
| 今すぐダウンロード可能な重み |
Kimi K3 |
チェックポイントとライセンスがすでに公開されている |
| プライベートまたは管理対象の導入 |
Kimi K3 |
チーム独自のインフラストラクチャに公開済みモデルを導入できる |
| 簡単なローカルインストール |
どちらでもない |
両モデルともセルフホスティングには本格的なインフラストラクチャが必要 |
| APIの直接比較テスト |
両方をテスト |
受理されたタスク、再試行、ツール失敗、レイテンシ、総コストを比較する |
したがって、Qwenが「単なるPreview」だから比較が不平等なのではなくなりました。両モデルとも本番APIワークロードに対応できます。残る違いはより単純です。Qwen3.8-Maxは現在、ホスト型APIとしてコストと性能のより優れた組み合わせを提供し、Kimi K3は公開済みの重みへの即時アクセスと、より大きな導入制御を提供します。
開発者がQwen 3.8 MaxをKimi K3と比較テストする方法
| テスト |
両モデルに与えるもの |
測定項目 |
| リポジトリのアーキテクチャレビュー |
同じ固定コミット、アーキテクチャに関する質問、読み取り専用ツール、制限時間 |
正しいファイル引用、見落とした依存関係、裏付けのない主張、レビュー時間 |
| 複数ファイルの実装 |
同じ課題、テスト、書き込み可能なファイル、ツール権限 |
テストの合格、変更されたファイル、再試行、リグレッション、人による修正 |
| フロントエンドの視覚的修正 |
同じスクリーンショット、ソースファイル、ブラウザツール、目標とする動作 |
視覚的一致、妥当なコード、修正ループ、最終テスト結果 |
エージェントのシェルと権限は同一に保ちます。固定の制限時間を設定します。特に変化の続くQwenのPreviewについては、完全なモデルIDと日付を記録します。そのうえで、タスク完了、経過時間、入力・出力トークン、キャッシュヒット、失敗したツール呼び出し、再試行、人による介入、最終的に合格したテストを記録します。
回答が「詳しそうに見える」からといって採点してはいけません。パッチが機能するか、モデルの主張がレビューに耐えるかを確認してください。
重要なアーキテクチャ上の意思決定には、もう1つ有用な方法があります。両モデルを独立して実行し、レビュー時にはモデルの識別情報を隠して、意見の相違を比較するのです。269ファイルのテストでは、Qwenのシステム境界とKimiのライフサイクルモデルを組み合わせて初めて、最も優れた設計が得られました。QwenとKimiのどちらが正しいかという問いへの答えが、両方を使って検証することになる場合もあります。
Qwen 3.8 MaxとKimi K3の価格
| モデル |
公式入力価格 |
公式出力価格 |
| Qwen3.8-Max |
100万トークンあたり$2 |
100万トークンあたり$6 |
| Kimi K3 |
100万トークンあたり$3 |
100万トークンあたり$15 |
| GPT Proto上のKimi K3 |
100万トークンあたり$2.70 |
100万トークンあたり$13.50 |
公式の定価では、Qwenの出力トークンはKimi K3より60%安価です。この差は、長い計画、ツールの実行履歴、説明、パッチを生成する推論重視のコーディングエージェントにとって重要です。
トークン価格がコストのすべてではありません。再試行、失敗したツール呼び出し、人による修正、レイテンシ、受理されたタスクの完了率を測定してください。修正やり直しのループを減らせるなら、より優れた修正・ライフサイクル処理を持つKimiのほうが、特定のワークフローでは安くなる可能性もあります。
本番予算を計算する前に、GPT Protoの現在の価格について、最新のQwen3.8-Max APIページを確認してください。
どのモデルを選ぶべきか?
| 状況 |
より適した選択 |
理由 |
| ホスト型の本番API |
Qwen 3.8 Max |
安定したアクセスと大幅に低い公式出力価格 |
| 複雑なマルチモーダルコーディング |
Qwen 3.8 Max |
テキスト、画像、動画入力に対応し、フロントエンドおよび視覚エージェント向けの強い位置づけ |
| アーキテクチャの境界とツール規律 |
まずQwenをテスト |
Previewは同条件のテストで44回中44回のツール呼び出しを完了 |
| 修正と再生成の履歴 |
まずKimiをテスト |
Kimiは同条件のテストでライフサイクル状態をより完全に処理 |
| 今すぐダウンロード可能な重み |
Kimi K3 |
完全なチェックポイントとライセンスがすでに公開済み |
| セルフホスティングの複雑さを最小化 |
どちらでもない |
両方とも、本格的なインフラストラクチャを必要とする数兆パラメータモデル |
| 1つのアカウントで直接比較テスト |
GPT Proto経由で両方 |
同じタスク、ツール、推論設定、評価基準で実行 |
マルチモーダル入力、推論、エージェントの挙動
| 機能 |
Qwen 3.8 Max Preview |
Kimi K3 |
| 画像理解 |
文書化済み |
文書化済み |
| 動画理解 |
現在のモデル入力として明確に文書化されていない |
文書化済み |
| 思考モード |
常時オン |
常時オン |
| 推論レベル |
low、high、xhigh |
low、high、max |
| デフォルトの推論レベル |
xhigh |
max |
| コンテキストウィンドウ |
現在の製品ページでは明確に開示されていない |
1,048,576トークン |
| 構造化出力 |
Previewの機能は継続的な検証が必要 |
JSONモードと厳格なJSON Schemaを文書化 |
| 長いツール履歴 |
Previewにより挙動が変わる可能性がある |
推論内容を含む完全なアシスタントメッセージを保持する必要がある |
Qwenは文書化された視覚サポートを備えているため、スクリーンショットベースのデバッグに適しています。Kimiは動画も受け付けるため、画面録画、アニメーションの参考資料、製品デモなど、フレームごとに説明するのが難しい入力にも対応できます。
Kimiのより豊富に文書化されたインターフェースには、統合作業も増えます。Preserved Thinkingの挙動により、マルチターンアプリケーションでは、表示される回答だけでなく、推論内容やツール呼び出しを含む完全なアシスタントメッセージを返す必要があります。その履歴はコンテキストを消費し、課金対象になります。100万トークンのウィンドウは大容量ですが、無料のストレージではありません。
両モデルとも、デフォルトでは最高の推論設定を使用します。評価時は設定を統一してください。本番環境では、単純なタスクで低い推論強度をテストしましょう。オートコンプリート、分類、短い変換などすべてで最大推論に固定するモデルより、低い推論強度で99%のリクエストを解決するモデルのほうが、安価で高速な場合があります。
どのモデルを選ぶべきか?
| あなたの状況 |
現時点でより適した選択 |
理由 |
| 今すぐ顧客向けアプリケーションを構築する |
Kimi K3 |
従来型APIと予測可能なトークン価格 |
| 画像または動画入力を含む長時間のリポジトリタスクを実行する |
Kimi K3 |
100万トークンのコンテキストと文書化された画像・動画サポート |
| Qwen Code、Qoder、または対応する別のAlibabaツール内でテストする |
Qwen 3.8 Max Preview |
プロモーションCreditsの消費が少ない |
| 安定した再現可能なベンチマークが必要 |
現時点ではKimi K3 |
QwenのPreviewは実行ごとに変化する可能性がある |
| 最も明確なアーキテクチャと再現メタデータが必要 |
Qwenをテスト |
同条件のアーキテクチャレビューで明確な優位性を示した |
| 強力な修正・再生成処理が必要 |
Kimiをテスト |
利用可能な同条件のテストで、より完全な処理を示した |
| 今すぐダウンロード可能な重みが必要 |
Kimi K3 |
完全なチェックポイントが公開済みで、Qwen 3.8 Maxにはまだ公開済みの重みがない |
| 1つのアカウントで複数のモデルファミリーを比較する必要がある |
GPT Proto上のKimi K3 |
1つのキーと残高で、より幅広いモデルカタログにアクセスできる |
今週中に本番稼働するアプリケーションなら、私はKimi K3を選びます。コストを見積もり、統合時の挙動を定義し、安定したモデル名でテストを繰り返すのに十分な公開情報があるためです。
社内向けのコーディング実験なら、Qwenを無視しません。Previewは長時間のリポジトリ分析を失敗したツール呼び出しなしで処理し、同条件のテストではKimiより優れたアーキテクチャ境界を示しました。これは重要な性能のシグナルです。ただし、まだ本番環境での契約とは言えません。
GPT Proto経由でKimi K3を試す方法
Qwen 3.8 MaxはまだGPT Protoで利用できないため、現在の統合例ではKimi K3のみを使用します。GPT ProtoのOpenAI互換Chat Completionsエンドポイントを通じて、kimi-k3というモデル文字列で呼び出せます。
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "この移行計画をレビューしてください。裏付けのない前提、欠落しているロールバック手順、本番環境に移行する前に必要なテストを特定してください。"
}
]
}'
エンドポイントと認証の構造は、GPT Proto APIクイックスタートに従っています。マルチターンのKimiワークフローでは、最終的に表示されるテキストだけを保存するのではなく、推論やツール呼び出しフィールドを含む、APIが返す完全なアシスタントメッセージを保持してください。
Kimi K3 APIを試す、200以上のAIモデルを閲覧する、またはGPT Proto統合AI APIを使って、Kimiを他のテキスト、画像、動画、音声モデルと比較できます。Qwen 3.8 Maxが追加されたら、両方のモデルエンドポイントで同じタスク、プロンプト、ツール権限、採点方法を使うことが有効なテストになります。
最終判定
QwenがPreviewだからという理由だけで、Kimi K3が勝つことはなくなりました。Qwen3.8-Maxには現在、安定したAPI、通常のトークン課金、文書化された仕様、GPT Protoを通じた直接利用が備わっています。
ホスト型モデルを選ぶほとんどのチームにとって、Qwen3.8-Maxはより有力な出発点です。公式の$2/$6という料金はKimi K3の$3/$15を大きく下回り、特に出力の多いエージェントタスクで有利だからです。
ダウンロード可能な重みと導入環境の所有権が譲れない条件なら、Kimi K3のほうが適しています。利用可能な同条件テストで、より優れた修正・再生成処理を示したことから、状態管理の多いクリエイティブおよびエンジニアリングワークフローでも評価する価値があります。
現在の明確な答えは、ホスト型APIのコストと幅広いマルチモーダル性能ならQwen、公開済みの重みとライフサイクル処理が重いタスクならKimiです。