中国語LLMモデルのおすすめランキング
| 順位 |
モデル |
最適な用途 |
独立評価による知能スコア |
コンテキスト |
入力 |
重みの状態 |
GPT Protoの100万トークンあたりの価格 |
| 1 |
Kimi K3 |
総合的な知能、フロントエンド、ビジュアルコーディング |
57 |
100万 |
ホステッドサービス経由のテキスト、画像、動画 |
オープンウェイト、カスタムKimi K3ライセンス、約1.56 TB |
$2.70 入力 / $13.50 出力 |
| 2 |
GLM-5.2 |
長時間稼働するコーディングエージェント、商用セルフホスティング |
51 |
100万 |
テキスト |
オープンウェイト、MIT |
$1.26 / $3.96 |
| 3 |
Qwen3.7 Max |
高速なホステッド推論とコーディング |
46 |
100万 |
テキスト |
プロプライエタリ |
$0.36 / $1.44 |
| 4 |
MiniMax M3 |
低コストのマルチモーダル開発 |
44 |
100万 |
テキスト、画像、動画 |
オープンウェイト、MiniMax Community License |
$0.48 / $0.96 |
| 5 |
DeepSeek V4 Pro |
バックエンド推論、STEM、プライベート展開 |
44 |
100万 |
テキスト |
オープンウェイト、MIT |
$1.39 / $2.78 |
独立スコアは、コーディング、ターミナル操作、知識、数学、推論を対象とする9つの評価を組み合わせた、現在のArtificial Analysis Intelligence Indexに基づいています。これはコーディング専用のランキングより広範な指標であるため、最終的な結論ではなく、1つの判断材料として扱うべきです。Artificial Analysisの評価方法と最新モデル結果を見る.
価格は2026年7月20日に確認したGPT Protoの料金です。変更される場合があります。
中国語LLMモデルのランキング方法
総パラメータ数だけで「最も優れた中国語LLMモデル」を決めるなら、Kimi K3が1位になり、議論は終わります。しかし、それでは開発者がモデルを選ぶ助けにはなりません。
そこで、次の5つの観点を検討しました。
- 開発元のベンチマークだけでなく、独立した評価でどの程度の性能を発揮するか。
- リポジトリ規模のコーディングと、繰り返しのツール利用を継続できるか。
- API経由で利用した場合の速度と費用はどの程度か。
- スクリーンショット、図、その他の視覚入力を受け付けるか。
- 企業が重みをダウンロード、変更し、商用展開できるか。
最後の違いは重要です。「オープン」「オープンウェイト」「オープンソース」は、常に同じ権利を与えるわけではありません。GLM-5.2とDeepSeek V4 Proは、寛容なMITライセンスを採用しています。MiniMax M3はCommunity Licenseの下で重みを公開しています。Qwen3.7 Maxはプロプライエタリです。Kimi K3は現在、カスタムKimi K3 Licenseの下で完全な重みを公開しており、幅広い利用と変更を認めていますが、大規模なModel-as-a-Service事業や非常に大規模な商用製品には条件が追加されます。
1. Kimi K3:中国語LLM総合ベスト
Moonshot AIは、多数のツール呼び出しをまたいで継続する可能性のあるコーディング、知識労働、推論タスク向けにKimi K3を開発しました。注目すべき仕様は、総パラメータ数2.8兆、100万トークンのコンテキストウィンドウ、そしてテキスト・画像・動画をネイティブに理解できる点です。
アーキテクチャは、単純な規模の大きさ以上に興味深いものです。Kimi K3はKimi Delta AttentionとAttention Residualsを採用し、各トークンで896個のエキスパートのうち16個を有効化します。これにより、すべてのステップで2.8兆パラメータの密モデルを稼働させる場合に比べ、完全な計算コストを負担せずにモデルを拡張できます。MoonshotのKimi K3ガイドでアーキテクチャとコンテキストウィンドウを確認できます.
Kimi K3のArtificial Analysis Intelligence Indexスコアは現在57で、このリストの他の4モデルを上回っています。また、このレベルの総合的な推論能力とネイティブな視覚入力を兼ね備えているのは、この中でKimi K3だけです。そのため、次の用途に特に適しています。
- スクリーンショットと実行時ログからのフロントエンドのデバッグ
- 視覚的な参照からのインターフェース再構築
- 長時間のエージェントセッションでの大規模リポジトリの操作
- 技術文書、図、コードの組み合わせ
- アプリケーションの繰り返しテストと修正
大きなトレードオフは3つあります。
1つ目は価格です。GPT Protoでは、出力料金は100万トークンあたり13.50ドルです。これはGLM-5.2の出力料金の3倍以上、MiniMax M3の14倍以上です。長時間稼働するエージェントは、計画、編集、テスト結果の確認、再試行の過程で大量のトークンを生成する可能性があります。
2つ目はインフラです。K3の完全な重みは公開されていますが、リポジトリの容量は約1.56 TBです。Moonshotは64基以上のアクセラレータを備えたスーパーノード構成を推奨しています。これはインフラチーム向けのオープンウェイトモデルであり、ノートパソコンにダウンロードするモデルではありません。
3つ目はライセンスです。Kimi K3はMITではありません。カスタムライセンスは、利用、変更、ファインチューニング、展開を広く認めていますが、大規模なModel-as-a-Service事業や非常に大規模な商用製品には条件が追加されます。法務確認を展開計画に含める必要があります。
結論: API料金の上昇を正当化できるほど難しいタスク、または最先端のオープンウェイトチェックポイントへのアクセスが必要な場合はKimi K3を選びましょう。通常のコーディングエージェントには、よりシンプルなオープンウェイト標準モデルとしてGLM-5.2を使い続けてください。
2. GLM-5.2:長時間稼働するエージェント向けの中国語コーディングモデル
本格的なコーディングエージェントを構築するなら、GLM-5.2から始めます。
Z.aiは、コーディングを単なるチャット機能の一部として扱うのではなく、長時間にわたるタスク向けに特化して訓練しました。これは753BパラメータのMixture-of-Expertsモデルで、トークンごとに約40Bパラメータを有効化し、100万トークンのコンテキストウィンドウ、ネイティブなツール呼び出し、MITライセンスの重みを備えています。Z.aiのGLM-5.2発表で長時間タスク向けの位置づけを確認できます.
Artificial Analysis Intelligence IndexでのGLM-5.2のスコアは51です。インタラクティブな開発にとってさらに重要なのは、独立測定で出力速度が毎秒約200トークンに達していることです。同じデータセットでは、MiniMax M3やDeepSeek V4 Proより大幅に高速です。
この組み合わせは、次のような作業に適しています。
- リポジトリ全体のリファクタリング
- 複数ファイルにまたがるデバッグ
- 長時間のターミナル操作とテストループ
- コード、設定、ドキュメントにまたがる移行作業
- 商用セルフホスティングまたはファインチューニング
MITライセンスは大きな利点です。チームは重みを確認し、自社環境内でモデルをホストし、プロプライエタリなユーザー単位契約を結ぶことなく適応できます。
代わりに、GLM-5.2はテキスト専用です。壊れたレイアウトのスクリーンショットやデザイン参照を直接確認することはできません。独立テストでは、比較的冗長であることも分かっています。生成速度は速いものの、不要な出力は料金を増やします。
GPT Protoでは入力100万トークンあたり1.26ドル、出力100万トークンあたり3.96ドルで、このリスト中で最安ではありません。しかし、コーディングエージェント向けのオープンモデルとして最もバランスが取れています。
結論:大規模なリポジトリでエージェントにタスクを継続させたい場合は、GLM-5.2を標準モデルとして使用してください。視覚入力や可能な限り低いトークンコストがより重要なら、別のモデルを選びましょう。
3. Qwen3.7 Max:高速なホステッドコーディング処理に最適
Qwen3.7 MaxはAlibabaのプロプライエタリなエージェントモデルです。100万トークンのコンテキストウィンドウ、最大65,536個の出力トークン、コーディングと長時間実行向けの拡張推論を提供します。Qwen3.7 Plusとは異なり、Maxはテキスト専用です。AlibabaのQwen3.7発表では、Maxをエージェントの基盤モデルとして位置づけています.
最大の利点は速度です。
Artificial Analysisによる現在の測定では、Qwen3.7 Maxの出力速度は毎秒約204トークンで、DeepSeek V4 Proの約65トークンを上回ります。また、Intelligence Indexでは46を獲得し、MiniMax M3とDeepSeek V4 Proをわずかに上回っています。
GPT Protoの料金もこのモデルを魅力的にしています。入力は100万トークンあたり0.36ドル、出力は1.44ドルです。独立した総合知能の結果がより高い一方で、現実的なコーディングタスクではMiniMax M3に近い料金です。
Qwen3.7 Maxは次の用途に適しています。
- 高速なコードレビュー
- テキストのみの複数ファイルリファクタリング
- 応答時間がユーザー体験に影響するエージェントタスク
- 大量のホステッド処理
- 重みを管理せずに強力なAPIモデルを使いたいチーム
トレードオフは制御性です。Qwen3.7 Maxはクローズドウェイトのため、プライベートクラスターに展開したり、ベース重みを自分でファインチューニングしたりできません。また、Kimi K3やMiniMax M3のような視覚入力にも対応していません。
新しさに関する問題もあります。AlibabaはすでにQwen3.8 Maxを発表しています。新モデルのドキュメント、価格、独立評価が安定するまでは、動作中のQwen3.7統合を置き換えるのは時期尚早です。
結論:セルフホスティングやマルチモーダル入力よりも、ホステッド環境での速度と低いAPIコストを重視するなら、Qwen3.7 Maxが最適です。
4. MiniMax M3:マルチモーダル開発向けの高コスパ中国語LLM
MiniMax M3は、スコアが44という点だけを見ると過小評価されがちです。
このモデルは、総パラメータ数約428B、アクティブパラメータ23Bでありながら、100万トークンのコンテキストと、テキスト・画像・動画のネイティブ入力に対応しています。MiniMax Sparse Attentionにより、最大コンテキスト長でのアテンション計算量は従来世代のおよそ20分の1に削減されています。MiniMaxによれば、100万トークンのコンテキストでM2と比べ、プリフィルは9倍、デコードは15倍高速です。公式MiniMax M3モデルカードにアーキテクチャと速度の数値が掲載されています.
そのため、MiniMax M3は次のような用途に実用的です。
- リポジトリの図やUIスクリーンショットをコードと併せて読む
- 長文ドキュメントとコードの分析
- マルチモーダルなバグのトリアージ
- 大量のコーディングサブタスク
- Kimi K3の出力料金を払わずに長いコンテキストを必要とするエージェント
GPT Protoでは、入力100万トークンあたり0.48ドル、出力100万トークンあたり0.96ドルです。この比較では出力料金が最も安いモデルです。
重みはダウンロードできますが、注意すべき法的な違いがあります。MiniMax M3はMITではなく、MiniMax Community Licenseを使用しています。オープンウェイトだからといって、無制限の商用利用が自動的に認められるわけではありません。再配布、ファインチューニング、セルフホスティングを計画する企業は、「オープン」という言葉だけに頼らず、ライセンスを確認すべきです。
GPT Protoでは、テキストリクエストにメインのMiniMax M3エンドポイントを使用します。画像とファイルの入力は、同じアカウントの専用image-to-textルートから利用できます。
結論:MiniMax M3は、このリストで最も優れたコスト対性能の選択肢です。マルチモーダル入力が必要な場合、または大量のエージェントサブタスクを実行する場合に選びましょう。
5. DeepSeek V4 Pro:バックエンド推論に最適なMITモデル
DeepSeekは、もはや「最も優れた中国語コーディングモデルは?」という問いへの自動的な答えではありません。競争環境は変化しました。
それでもDeepSeek V4 Proは有力な選択肢です。1.6TパラメータのMixture-of-Expertsモデルで、49Bのアクティブパラメータ、100万トークンのコンテキストウィンドウ、MITライセンスの重みを備えています。1つのモデルファミリーで、非思考、高度推論、最大推論モードに対応します。DeepSeekは2026年4月にV4 ProとV4 Flashを発表しました.
Artificial Analysis Intelligence Indexのスコアは44で、MiniMax M3と同水準ですが、Qwen3.7 Max、GLM-5.2、Kimi K3を下回ります。出力速度も毎秒約65トークンと低めです。
それでもトップ5に残す理由は何でしょうか。
DeepSeek V4 Proは、テキスト中心のバックエンド作業に適しています。
- アルゴリズムとデータ構造の問題
- STEM推論
- バックエンドのリグレッション
- テストの生成と修正
- 寛容なライセンスを必要とするプライベート展開
- GLM-5.2より安価な、出力中心のエージェントワークフロー
GPT Protoでは、入力100万トークンあたり約1.39ドル、出力100万トークンあたり2.78ドルです。GLM-5.2は入力が少し安い一方、出力はDeepSeekの方が安価です。
結論:DeepSeek V4 Proは総合的な首位ではなくなりましたが、MITライセンスでの展開と予測しやすい出力コストが重要なバックエンド推論では、依然として有力な選択肢です。
1つの現実的なコーディングタスク、5つの異なる選択肢
各モデルにToDoアプリを作らせるより、現実的なタスクを考えてみましょう。
TypeScript製のSaaSアプリケーションで、認証ライブラリのアップグレード後、OAuthコールバックが断続的に失敗し始めたとします。コーディングエージェントはリポジトリを調査し、コールバックとセッションの流れを追跡し、リグレッションを特定し、実装を変更し、失敗するテストを追加し、テストスイートを実行して、プルリクエストの概要を作成する必要があります。
最初の指示は、次のようになります。
このリポジトリのOAuthコールバックのリグレッションを調査してください。
編集する前に:
1. コールバック、セッション、トークン更新の経路を整理する。
2. 動作を変更したライブラリのアップグレードを特定する。
3. テストで障害を再現する。
4. 最小限で安全なパッチを提案する。
編集した後に:
1. 関連する単体テストと統合テストを実行する。
2. 変更したすべてのファイルを報告する。
3. 残っているリスクを説明する。
4. テストの成功を確認していない限り、成功したと主張しない。
最適なモデルは、証拠と実行環境によって変わります。
| 段階 |
推奨モデル |
理由 |
| 大規模なモノレポを読み込み、長時間のツールループを維持する |
GLM-5.2 |
長時間のコーディングに強く、高速な生成と100万トークンのコンテキストを備える |
| スクリーンショット、ブラウザ状態、コードを同時に確認する |
Kimi K3 |
最高の総合スコアとネイティブな視覚入力 |
| 高速な初回コードレビューを実行する |
Qwen3.7 Max |
高い出力速度と低いホステッド料金 |
| 予算を抑えてスクリーンショットと反復的なサブタスクを処理する |
MiniMax M3 |
ネイティブなマルチモーダル対応と最低水準の出力料金 |
| プライベート環境でバックエンドロジックを分析する |
DeepSeek V4 Pro |
MITライセンスの重み、選択可能な推論、強力なSTEM性能 |
このため、すべてのステップを1つのモデルに割り当てるべきではありません。実用的なエージェントでは、初期トリアージにQwen3.7 MaxまたはMiniMax M3を使い、リポジトリ全体に及ぶ難しい修正はGLM-5.2にエスカレーションし、視覚的推論が必要なタスクにはKimi K3を使うことができます。
同じコーディングタスクの費用は?
OAuthタスクで次のトークンを消費するとします。
- キャッシュされていない入力100,000トークン
- 出力20,000トークン
記載されているGPT Protoの料金を使うと、初回モデルの費用は次のとおりです。
| モデル |
概算費用 |
| Kimi K3 |
$0.54 |
| GLM-5.2 |
$0.21 |
| Qwen3.7 Max |
$0.06 |
| MiniMax M3 |
$0.07 |
| DeepSeek V4 Pro |
$0.19 |
たとえば、Kimi K3の計算は次のとおりです。
(0.1 × $2.70) + (0.02 × $13.50) = $0.54
これは、QwenやMiniMaxが6セントでタスクを解決できるという意味ではありません。初回実行におけるトークン計算です。安価なモデルが誤ったパッチを生成し、3回再試行する必要があれば、実際の費用と完了時間は増加します。キャッシュ、推論モード、ツール出力、エージェントのターン数も最終的な料金に影響します。
有用な指標はトークン単価ではありません。受け入れられた修正1件あたりのコストです。
ベンチマークの勝者が最良のコーディングエージェントとは限らない理由
コーディングモデルは、それだけでファイルを調査したり、コマンドを実行したり、パッチをマージしたりするわけではありません。モデルを取り巻くエージェントが次を制御します。
- どのリポジトリファイルをコンテキストに含めるか
- 検索結果とターミナル出力をどのように提示するか
- 編集に正確なパッチを使うか、ファイルを書き換えるか
- いつテストを実行するか
- コマンドが失敗した後に何をするか
- モデルが自分の作業を検証できるか
- ターン間でどれだけコンテキストを保持するか
同じモデルを2つの異なるエージェントシステムに組み込むと、結果は大きく異なる可能性があります。
5つのモデルすべてが共有する100万トークンのコンテキストにも、別の落とし穴があります。100万トークンは容量であって、すべてのリクエストにリポジトリ全体を貼り付けることを推奨しているわけではありません。無関係な生成ファイル、依存関係のコード、古いログは、遅延とコストを増やしながらモデルの注意をそらします。
より優れたコーディングエージェントは、まず関連ファイルを取得し、安定した指示を冒頭付近に置き、古いツール出力を要約し、調査に必要な場合にのみコンテキストを拡張します。
一言で言えば、モデルとエージェントをセットで選びましょう。
どの中国語コーディングモデルを使うべきか?
現在最高の総合性能を求め、タスクに視覚的な証拠や長時間の推論が含まれ、ホステッドAPIを利用するか、1.56 TBのオープンウェイト展開を支えられるなら、Kimi K3を選びましょう。商用Model-as-a-Service製品を構築する前に、カスタムライセンスを確認してください。
長時間稼働するコーディングエージェントを構築し、性能、速度、コンテキスト、コスト、寛容な展開条件の最適なバランスを求めるなら、GLM-5.2を選びましょう。MITライセンスとより小さなフットプリントにより、今でもセルフホストの標準モデルとして推奨できます。
高速で安価なホステッドモデルを求め、ダウンロード可能な重みや画像入力が不要なら、Qwen3.7 Maxを選びましょう。
コストとマルチモーダル性能を重視するなら、MiniMax M3を選びましょう。スクリーンショット、ファイル、コードを組み合わせる大量開発ワークフローに特に適しています。
バックエンド中心の作業で、自社インフラ上で実行できるMITライセンスモデルを求めるなら、DeepSeek V4 Proを選びましょう。
永久的な勝者はいません。モデルのリリースはあまりにも速く進んでいるためです。構築すべきなのは、アプリケーションを書き換えなくても勝者を入れ替えられるルーティング層です。
これらの中国語LLMモデルを1つのAPIで呼び出す方法
GPT Protoでは、5つのモデルを同じOpenAI互換チャットエンドポイントから利用できます。以下はGLM-5.2を使用したcURLリクエストです。
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: YOUR_GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Separate confirmed evidence from hypotheses and never claim a test passed unless you saw its output."
},
{
"role": "user",
"content": "An OAuth callback began failing after an authentication-library upgrade. Return a JSON object with diagnosis_questions, files_to_inspect, likely_failure_modes, and test_plan."
}
],
"stream": false
}'
別のモデルを試すには、modelの値を変更します。
| モデル |
モデル文字列 |
| Kimi K3 |
kimi-k3 |
| GLM-5.2 |
glm-5.2 |
| Qwen3.7 Max |
qwen3.7-max |
| MiniMax M3 |
MiniMax-M3 |
| DeepSeek V4 Pro |
deepseek-v4-pro |
大文字と小文字はMiniMax-M3では区別されます。
より幅広いGPT Protoモデルコレクションを比較するか、本番トラフィックをルーティングする前に現在の従量課金制の料金を確認できます。