DeepSeek V4 ProとKimi K3の比較は、2026年8月13日に変わりました。DeepSeekは既存のAPIエイリアスの背後にあったV4 ProプレビューをDeepSeek V4 Pro 0813に置き換え、開発者がすでに使用しているモデル名はそのまま維持しています。
短く答えると、総合的な測定知能では依然としてKimi K3が優位で、画像入力にも対応しています。DeepSeek V4 Pro 0813は、テキストベースのコーディングやエージェント処理において、より高速で大幅に低コストです。リポジトリの処理、コードレビューの実行、高ボリュームのエージェント運用を行うほとんどのチームにとって、現在はDeepSeekがより優れたデフォルト選択肢です。マルチモーダル入力や、コストよりも利用可能な最高レベルの推論性能が重要な場合は、Kimiの高い料金を選ぶ価値があります。
見落としやすい実装上のポイントが1つあります。GPTProtoでは、0813サフィックスを付ける必要はありません。引き続きdeepseek-v4-proを呼び出せば、ルートが自動的に最新バージョンを使用します。
DeepSeek V4 Pro 0813とKimi K3の比較概要
| カテゴリー |
DeepSeek V4 Pro 0813 |
Kimi K3 |
より適した選択肢 |
| 現在の独立系Intelligence Index |
53 |
60 |
Kimi K3 |
| 出力速度 |
83.2トークン/秒 |
40.8トークン/秒 |
DeepSeek V4 Pro |
| 最初のトークンまでの時間 |
1.63秒 |
2.97秒 |
DeepSeek V4 Pro |
| コンテキストウィンドウ |
約100万トークン |
約100万トークン |
同等 |
| GPT Protoの入力料金 |
100万トークンあたり$1.044 |
100万トークンあたり$2.70 |
DeepSeek V4 Pro |
| GPT Protoの出力料金 |
100万トークンあたり$2.088 |
100万トークンあたり$13.50 |
DeepSeek V4 Pro |
| GPT Protoで利用可能な入力 |
テキスト |
テキスト、画像、ドキュメント |
Kimi K3 |
| 推論制御 |
非思考、高、最大 |
常時オンの推論と推論負荷の制御 |
ワークフローによる |
| オープンウェイトライセンス |
MIT |
Kimi K3 License |
より簡単な商用セルフホスティングにはDeepSeek |
| 最適な用途 |
高ボリュームのテキストコーディングとエージェント |
高度なマルチモーダルおよび視覚エージェントタスク |
タスクによる |
上記のベンチマーク、速度、レイテンシーの数値は、現在のArtificial Analysisの直接比較評価に基づいています。同社のIntelligence Indexは両モデルに同じ評価フレームワークを使用しているため、2社のベンダーのローンチ時のグラフを並べて比較するよりも有用です。
DeepSeek V4 Pro 0813で何が変わったのか?
DeepSeek V4 Pro 0813はV4 Proの現在の本番バージョンであり、別個のAPI製品ではありません。DeepSeekのドキュメントによると、deepseek-v4-proエイリアスは現在DeepSeek-V4-Pro-0813を指しており、呼び出し方法は変わっていません。同じドキュメントには、100万トークンのコンテキストウィンドウ、最大384Kの出力、思考モードと非思考モード、JSON出力、ツール呼び出しが記載されています。
この命名方針が重要なのは、日付付きのモデル名では、開発者が設定ファイル、ルーティングルール、評価記録を変更しなければならないことが多いためです。今回は、安定したエイリアスの背後でアップグレードが行われます。GPT Protoでも同じ原則が適用されるため、リクエスト内ではdeepseek-v4-proを使い続けてください。
現在の独立評価の結果も、多くの7月の比較記事に見られる数値とは異なります。Artificial Analysisでは現在、0813モデルに最大推論負荷でIntelligence Indexスコア53を与えています。Kimi K3は現在の評価で60を獲得しています。
これを、以前のスコア44から単純に9ポイント向上した結果だとは考えません。モデルが変わっただけでなく、ベンチマークスイートや評価バージョンも変わる可能性があります。確実に言える結論はより限定的です。プレビューに基づく比較は、現在提供されているモデルをもはや説明しておらず、最新の独立評価では、0813はプレビュー時代の報道が示唆していたよりもKimi K3に近い位置にあるということです。
DeepSeekはモデルの基本的な製品構成を変更していません。引き続き、1.6兆パラメーターのMixture-of-Expertsモデルであり、トークンごとに490億パラメーターがアクティブになり、テキスト入力、大容量の出力、選択可能な推論負荷を備えています。したがって0813リリースは、新しいマルチモーダル系統というよりも、本番環境およびポストトレーニングのアップグレードとして理解するのが適切です。
ベンチマーク:Kimi K3が依然として優位、ただしすべてではない
Kimi K3は、独立した総合比較で60対53とリードしています。推論、知識、コーディング、長期的な計画を組み合わせるワークフローでは、この7ポイントの差が重要になります。ただし、すべてのリポジトリやすべてのプロンプトでKimiがより良い結果を出すという意味ではありません。
2つのモデルは異なるトレードオフを選択しています。MoonshotはKimi K3を、長期的なコーディングや知識作業向けに設計された2.8兆パラメーターのネイティブマルチモーダルエージェントモデルと説明しています。その公式モデルカードには、上流モデルにおけるテキスト、画像、動画の理解に加え、100万トークンのコンテキストウィンドウが記載されています。GPT Protoの現在のKimi K3ルートは、テキスト、画像、ドキュメント入力に対応しています。
DeepSeek V4 Pro 0813はテキスト専用ですが、Artificial Analysisのテストでは毎秒83.2トークンを生成します。Kimi K3は毎秒40.8トークンです。DeepSeekは応答開始も速く、最初のトークンまでの時間はKimiの2.97秒に対して1.63秒です。
簡単に言えば、総合的な能力スコアではKimiが上です。一方、DeepSeekはおよそ2倍の速度でテキストを返し、そのコストも大幅に低くなっています。
ここには、もう1つベンチマーク上の落とし穴があります。ベンダーのコーディングスコアでは、異なるエージェント構成、推論設定、リポジトリのスナップショット、合格基準が使われることがよくあります。Kimi Codeで得られたKimiのスコアを、別の評価構成で得られたDeepSeekのスコアと自動的に比較することはできません。モデル選定では、まず独立した同条件評価を共通の基準として使用し、そのうえで製品に影響するタスクをテストしてください。
この記事は、非公開の同一プロンプトによるコーディングテストを主張するものではありません。そのようなテストがない状態で、いずれかのモデルを普遍的なコーディングの勝者と断言するのは、証拠が許す範囲を超えています。
コーディングとエージェントワークフローにはどちらが適しているか?
高ボリュームのテキストベースのコーディングなら、私はDeepSeek V4 Pro 0813から始めます。
その理由は、あらゆる指標でKimiを上回っているからではありません。実際にはそうではありません。理由は、本番環境のコーディングエージェントが、コンテキストを繰り返し消費し、推論、パッチ、テスト計画、ツール命令を生成するためです。出力料金はループのたびに積み重なります。DeepSeekの選択可能な推論モードを使えば、すべてのリクエストで同じ推論動作に料金を支払うのではなく、難しいタスクに最大負荷を割り当てることもできます。
そのため、DeepSeekは次の用途の強力なデフォルトになります。
リポジトリの読み取りとコードベースに関するQ&A
プルリクエストレビュー
バグの特定
リファクタリング計画
テスト生成
テキストベースのツール呼び出し
高ボリュームのバックグラウンドエージェント
構造化JSONレスポンス
一方、失敗した試行のコストがトークン料金を上回る場合、Kimi K3の魅力が増します。独立評価でより高い知能スコアを持つため、DeepSeekが完了できない長く難しいタスク向けのエスカレーションモデルとして合理的です。また、リクエストに視覚情報が含まれる場合は明確な選択肢です。
したがって、実用的な本番パターンは「永久に1つを選ぶ」ことではありません。通常のテキストタスクはDeepSeekにルーティングし、特定の失敗やマルチモーダルタスクはKimiで再試行します。両方とも1つのGPT Proto APIキーと共通残高で利用できるため、変更はmodelフィールドだけに限定できます。
フロントエンドコーディングにおけるDeepSeek V4 ProとKimi K3の比較
「フロントエンドコーディング」には2種類の異なるワークロードが含まれており、1つの結論にまとめるべきではありません。
1つ目はテキストからコードへの変換です。記述された仕様から、Reactコンポーネント、CSS、ページ構造、アクセシビリティ修正、TypeScriptロジックを生成します。このカテゴリーでKimi K3またはDeepSeek V4 Pro 0813が普遍的に勝つと主張できるほど、条件を揃えた公開証拠はまだありません。DeepSeekは低コストで出力も速いため、最初の試行としてより経済的です。
2つ目は視覚的なフロントエンド反復です。モデルにスクリーンショットを見せ、間隔やレイアウトの問題を特定させ、視覚的なフィードバックをもとにインターフェースを修正します。Kimi K3は画像入力を受け付けるため、このワークフローにより適しています。DeepSeek V4 Proはテキスト専用なので、開発者はスクリーンショットをテキストに変換するか、まず別のビジョンモデルを使用する必要があります。
テキストで説明されたUI実装を大規模に行うならDeepSeekを使用してください。モデルにインターフェースを見せる必要がある場合はKimiを使用してください。
API料金:見出しから想像する以上にDeepSeekが優位
GPT Protoでは現在、DeepSeek V4 Proの料金を入力100万トークンあたり$1.044、出力100万トークンあたり$2.088に設定しています。Kimi K3は入力が$2.70、出力が$13.50です.
| GPT Protoの100万トークンあたりの料金 |
DeepSeek V4 Pro |
Kimi K3 |
Kimiの料金倍率 |
| 入力 |
$1.044 |
$2.70 |
2.59倍 |
| 出力 |
$2.088 |
$13.50 |
6.47倍 |
DeepSeekは入力が61.3%、出力が84.5%低コストです。推論負荷の高いエージェントでは内部処理と最終応答が長くなる可能性があるため、出力の差が特に重要です。
トークン価格は依然として抽象的なので、2つの仮想ワークロードを考えてみましょう。
| ワークロード |
トークンの想定 |
DeepSeek V4 Pro |
Kimi K3 |
| 大規模コードレビュー |
入力100K+出力20K |
$0.146 |
$0.540 |
| リポジトリ規模のエージェントタスク |
入力1M+出力250K |
$1.566 |
$6.075 |
リポジトリ規模の例では、Kimiの料金は約3.88倍になります。ただし、それだけでKimiのコストパフォーマンスが低いとは限りません。安価なモデルが何度も再試行し、人による修正も必要になる一方で、Kimiが難しいタスクを1回で完了できるなら、高価な呼び出しのほうが全体として安くなる可能性があります。
本番環境で適切な指標は、トークンコストだけではなく、受け入れられた結果のコストです。タスクカテゴリーごとに、モデル、トークン数、試行回数、レイテンシー、テスト結果、レビュアーによる承認を記録してください。トークン単価の低さは、出力が合格して初めて実際の節約になります。
速度とレイテンシー
Artificial Analysisでは現在、DeepSeek V4 Pro 0813の出力速度を毎秒83.2トークン、Kimi K3を毎秒40.8トークンと測定しています。最初のトークンまでの時間は、DeepSeekが1.63秒、Kimiが2.97秒です。
これらの数値は、インタラクティブなコーディングアシスタントや並列エージェントワーカーではDeepSeekに有利です。最終的に両モデルが許容できる回答に到達するとしても、トークンを2倍速く返すモデルなら、目に見える待ち時間を短縮できます。
ただし、プロバイダーの速度は重みだけで決まる恒久的な特性ではありません。サーバー負荷、量子化、バッチ処理、プロンプトの長さ、推論負荷、リクエストが処理される場所にも左右されます。現在の測定値は比較可能なスナップショットであり、すべての呼び出しに対するレイテンシー保証ではないと考えてください。
コンテキスト、推論、デプロイの違い
両モデルはおよそ100万トークンのコンテキストに対応しているため、コンテキストサイズだけではこの比較は決まりません。そのコンテキストをどのように使うかがより重要です。
DeepSeekは非思考モードと思考モードに対応し、難しいタスク向けに推論負荷を制御できます。また、現在のDeepSeek API仕様によると、最大384Kの出力が可能です。この柔軟性は、単純なタスクには高速な応答を使い、必要な場合にのみ深い推論を行うルーティングシステムに適しています。
Kimi K3は、設定可能な負荷による常時オンの推論を使用します。より大規模な2.8Tアーキテクチャとマルチモーダル設計は、ドキュメント、コード、画像、ツール使用を伴う長期的な作業を対象としています。そのトレードオフは、出力コストが高く、測定上の生成速度が遅いことです。
両モデルともダウンロード可能なウェイトを備えていますが、「オープンウェイト」はライセンスが同一であることを意味しません。DeepSeek V4 ProはMITライセンスを使用します。Kimi K3は独自のKimi K3 Licenseを使用します。商用セルフホスティングを計画しているチームは、MITと同じだと想定せず、Kimiの正確な利用条件を確認してください。
ハードウェア要件も、一般的なローカルワークステーションをはるかに上回ります。ウェイトが利用可能な場合でも、ほとんどの開発チームにとって、ホスト型APIの評価から始めるのが現実的です。
1つのAPIキーでDeepSeek V4 Pro 0813とKimi K3にアクセスする方法
GPT Protoは、OpenAI互換のチャット補完エンドポイントを通じて両モデルを提供しています。まずMODEL_IDをdeepseek-v4-proに設定してDeepSeekを開始します。
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
}
]
}"
同じテキストリクエストをKimi K3に送るには、1行を変更します。
export MODEL_ID="kimi-k3"
その後、同じcurlリクエストを再実行してください。別のMoonshotアカウント、2つ目の残高、DeepSeekのバージョンサフィックスは必要ありません。
比較を管理されたものにするには、プロンプト、コンテキスト、推論設定、出力上限を同じにしてください。レイテンシー、試行回数、テストに合格したかどうかとともに、返された使用量フィールドを記録します。本番環境のルーティングを決定するには、各モデルから得た魅力的な回答を1つずつ比較するだけでは不十分です。
どのモデルを選ぶべきか?
次の場合はDeepSeek V4 Pro 0813を選択してください。
次の場合はKimi K3を選択してください。
モデルがスクリーンショット、画像、ドキュメントを確認する必要がある
価格よりも現在最高の独立系知能スコアが重要である
失敗したタスクのコストがプレミアムAPI呼び出しの料金を上回る
長期的なマルチモーダルエージェントを構築している
安価なモデルが失敗した後、最も難しいリクエストをエスカレーションしたい
ほとんどの開発者にとって、最適なルーティングポリシーは、まずDeepSeekを使い、必要な場合にKimiを使うことです。これにより、DeepSeekのコストと速度の利点を大部分活用しながら、Kimiのマルチモーダル対応とより高い能力上限にもアクセスできます。
最終結論
DeepSeek V4 Pro 0813は、ほとんどのテキストベースのコーディングおよびエージェントワークロードにとって、より優れたデフォルト選択肢です。現在のArtificial Analysis Intelligence IndexではKimi K3に7ポイント遅れていますが、出力速度はおよそ2倍で、GPT Protoでははるかに低コストです。特に、出力の多いエージェントループでその差が際立ちます。
Kimi K3は、より優れた専門モデルです。タスクに視覚入力が含まれる場合、料金よりも可能な限り高度な推論が重要な場合、またはDeepSeekがすでに失敗し、手作業で復旧するよりも再試行のほうが安い場合に選択してください。
0813アップデートによってKimiが時代遅れになったわけではありません。ルーティングの判断が明確になったのです。大量処理、速度、テキストにはDeepSeek、マルチモーダル対応と測定上より高い能力上限にはKimiを使い分けます。