DeepSeek V4 Pro vs Kimi K3:0813アップデート後に何が変わった?

コーディング、速度、マルチモーダル入力、APIコストの観点からDeepSeek V4 Pro 0813とKimi K3を比較し、どちらのモデルがプロジェクトに適しているかを確認します。

DeepSeek V4 Pro vs Kimi K3:0813アップデート後に何が変わった?

DeepSeek V4 ProとKimi K3の比較は、2026年8月13日に変わりました。DeepSeekは既存のAPIエイリアスの背後にあったV4 ProプレビューをDeepSeek V4 Pro 0813に置き換え、開発者がすでに使用しているモデル名はそのまま維持しています。

短く答えると、総合的な測定知能では依然としてKimi K3が優位で、画像入力にも対応しています。DeepSeek V4 Pro 0813は、テキストベースのコーディングやエージェント処理において、より高速で大幅に低コストです。リポジトリの処理、コードレビューの実行、高ボリュームのエージェント運用を行うほとんどのチームにとって、現在はDeepSeekがより優れたデフォルト選択肢です。マルチモーダル入力や、コストよりも利用可能な最高レベルの推論性能が重要な場合は、Kimiの高い料金を選ぶ価値があります。

見落としやすい実装上のポイントが1つあります。GPTProtoでは、0813サフィックスを付ける必要はありません。引き続きdeepseek-v4-proを呼び出せば、ルートが自動的に最新バージョンを使用します。

目次

DeepSeek V4 Pro 0813とKimi K3の比較概要

カテゴリー DeepSeek V4 Pro 0813 Kimi K3 より適した選択肢
現在の独立系Intelligence Index 53 60 Kimi K3
出力速度 83.2トークン/秒 40.8トークン/秒 DeepSeek V4 Pro
最初のトークンまでの時間 1.63秒 2.97秒 DeepSeek V4 Pro
コンテキストウィンドウ 約100万トークン 約100万トークン 同等
GPT Protoの入力料金 100万トークンあたり$1.044 100万トークンあたり$2.70 DeepSeek V4 Pro
GPT Protoの出力料金 100万トークンあたり$2.088 100万トークンあたり$13.50 DeepSeek V4 Pro
GPT Protoで利用可能な入力 テキスト テキスト、画像、ドキュメント Kimi K3
推論制御 非思考、高、最大 常時オンの推論と推論負荷の制御 ワークフローによる
オープンウェイトライセンス MIT Kimi K3 License より簡単な商用セルフホスティングにはDeepSeek
最適な用途 高ボリュームのテキストコーディングとエージェント 高度なマルチモーダルおよび視覚エージェントタスク タスクによる

上記のベンチマーク、速度、レイテンシーの数値は、現在のArtificial Analysisの直接比較評価に基づいています。同社のIntelligence Indexは両モデルに同じ評価フレームワークを使用しているため、2社のベンダーのローンチ時のグラフを並べて比較するよりも有用です。

DeepSeek V4 Pro 0813で何が変わったのか?

DeepSeek V4 Pro 0813はV4 Proの現在の本番バージョンであり、別個のAPI製品ではありません。DeepSeekのドキュメントによると、deepseek-v4-proエイリアスは現在DeepSeek-V4-Pro-0813を指しており、呼び出し方法は変わっていません。同じドキュメントには、100万トークンのコンテキストウィンドウ、最大384Kの出力、思考モードと非思考モード、JSON出力、ツール呼び出しが記載されています。

この命名方針が重要なのは、日付付きのモデル名では、開発者が設定ファイル、ルーティングルール、評価記録を変更しなければならないことが多いためです。今回は、安定したエイリアスの背後でアップグレードが行われます。GPT Protoでも同じ原則が適用されるため、リクエスト内ではdeepseek-v4-proを使い続けてください。

現在の独立評価の結果も、多くの7月の比較記事に見られる数値とは異なります。Artificial Analysisでは現在、0813モデルに最大推論負荷でIntelligence Indexスコア53を与えています。Kimi K3は現在の評価で60を獲得しています。

これを、以前のスコア44から単純に9ポイント向上した結果だとは考えません。モデルが変わっただけでなく、ベンチマークスイートや評価バージョンも変わる可能性があります。確実に言える結論はより限定的です。プレビューに基づく比較は、現在提供されているモデルをもはや説明しておらず、最新の独立評価では、0813はプレビュー時代の報道が示唆していたよりもKimi K3に近い位置にあるということです。

DeepSeekはモデルの基本的な製品構成を変更していません。引き続き、1.6兆パラメーターのMixture-of-Expertsモデルであり、トークンごとに490億パラメーターがアクティブになり、テキスト入力、大容量の出力、選択可能な推論負荷を備えています。したがって0813リリースは、新しいマルチモーダル系統というよりも、本番環境およびポストトレーニングのアップグレードとして理解するのが適切です。

ベンチマーク:Kimi K3が依然として優位、ただしすべてではない

Kimi K3は、独立した総合比較で60対53とリードしています。推論、知識、コーディング、長期的な計画を組み合わせるワークフローでは、この7ポイントの差が重要になります。ただし、すべてのリポジトリやすべてのプロンプトでKimiがより良い結果を出すという意味ではありません。

2つのモデルは異なるトレードオフを選択しています。MoonshotはKimi K3を、長期的なコーディングや知識作業向けに設計された2.8兆パラメーターのネイティブマルチモーダルエージェントモデルと説明しています。その公式モデルカードには、上流モデルにおけるテキスト、画像、動画の理解に加え、100万トークンのコンテキストウィンドウが記載されています。GPT Protoの現在のKimi K3ルートは、テキスト、画像、ドキュメント入力に対応しています。

DeepSeek V4 Pro 0813はテキスト専用ですが、Artificial Analysisのテストでは毎秒83.2トークンを生成します。Kimi K3は毎秒40.8トークンです。DeepSeekは応答開始も速く、最初のトークンまでの時間はKimiの2.97秒に対して1.63秒です。

簡単に言えば、総合的な能力スコアではKimiが上です。一方、DeepSeekはおよそ2倍の速度でテキストを返し、そのコストも大幅に低くなっています。

ここには、もう1つベンチマーク上の落とし穴があります。ベンダーのコーディングスコアでは、異なるエージェント構成、推論設定、リポジトリのスナップショット、合格基準が使われることがよくあります。Kimi Codeで得られたKimiのスコアを、別の評価構成で得られたDeepSeekのスコアと自動的に比較することはできません。モデル選定では、まず独立した同条件評価を共通の基準として使用し、そのうえで製品に影響するタスクをテストしてください。

この記事は、非公開の同一プロンプトによるコーディングテストを主張するものではありません。そのようなテストがない状態で、いずれかのモデルを普遍的なコーディングの勝者と断言するのは、証拠が許す範囲を超えています。

コーディングとエージェントワークフローにはどちらが適しているか?

高ボリュームのテキストベースのコーディングなら、私はDeepSeek V4 Pro 0813から始めます。

その理由は、あらゆる指標でKimiを上回っているからではありません。実際にはそうではありません。理由は、本番環境のコーディングエージェントが、コンテキストを繰り返し消費し、推論、パッチ、テスト計画、ツール命令を生成するためです。出力料金はループのたびに積み重なります。DeepSeekの選択可能な推論モードを使えば、すべてのリクエストで同じ推論動作に料金を支払うのではなく、難しいタスクに最大負荷を割り当てることもできます。

そのため、DeepSeekは次の用途の強力なデフォルトになります。

  • リポジトリの読み取りとコードベースに関するQ&A

  • プルリクエストレビュー

  • バグの特定

  • リファクタリング計画

  • テスト生成

  • テキストベースのツール呼び出し

  • 高ボリュームのバックグラウンドエージェント

  • 構造化JSONレスポンス

一方、失敗した試行のコストがトークン料金を上回る場合、Kimi K3の魅力が増します。独立評価でより高い知能スコアを持つため、DeepSeekが完了できない長く難しいタスク向けのエスカレーションモデルとして合理的です。また、リクエストに視覚情報が含まれる場合は明確な選択肢です。

したがって、実用的な本番パターンは「永久に1つを選ぶ」ことではありません。通常のテキストタスクはDeepSeekにルーティングし、特定の失敗やマルチモーダルタスクはKimiで再試行します。両方とも1つのGPT Proto APIキーと共通残高で利用できるため、変更はmodelフィールドだけに限定できます。

フロントエンドコーディングにおけるDeepSeek V4 ProとKimi K3の比較

「フロントエンドコーディング」には2種類の異なるワークロードが含まれており、1つの結論にまとめるべきではありません。

1つ目はテキストからコードへの変換です。記述された仕様から、Reactコンポーネント、CSS、ページ構造、アクセシビリティ修正、TypeScriptロジックを生成します。このカテゴリーでKimi K3またはDeepSeek V4 Pro 0813が普遍的に勝つと主張できるほど、条件を揃えた公開証拠はまだありません。DeepSeekは低コストで出力も速いため、最初の試行としてより経済的です。

2つ目は視覚的なフロントエンド反復です。モデルにスクリーンショットを見せ、間隔やレイアウトの問題を特定させ、視覚的なフィードバックをもとにインターフェースを修正します。Kimi K3は画像入力を受け付けるため、このワークフローにより適しています。DeepSeek V4 Proはテキスト専用なので、開発者はスクリーンショットをテキストに変換するか、まず別のビジョンモデルを使用する必要があります。

テキストで説明されたUI実装を大規模に行うならDeepSeekを使用してください。モデルにインターフェースを見せる必要がある場合はKimiを使用してください。

API料金:見出しから想像する以上にDeepSeekが優位

GPT Protoでは現在、DeepSeek V4 Proの料金を入力100万トークンあたり$1.044、出力100万トークンあたり$2.088に設定しています。Kimi K3は入力が$2.70、出力が$13.50です.

GPT Protoの100万トークンあたりの料金 DeepSeek V4 Pro Kimi K3 Kimiの料金倍率
入力 $1.044 $2.70 2.59倍
出力 $2.088 $13.50 6.47倍

DeepSeekは入力が61.3%、出力が84.5%低コストです。推論負荷の高いエージェントでは内部処理と最終応答が長くなる可能性があるため、出力の差が特に重要です。

トークン価格は依然として抽象的なので、2つの仮想ワークロードを考えてみましょう。

ワークロード トークンの想定 DeepSeek V4 Pro Kimi K3
大規模コードレビュー 入力100K+出力20K $0.146 $0.540
リポジトリ規模のエージェントタスク 入力1M+出力250K $1.566 $6.075

リポジトリ規模の例では、Kimiの料金は約3.88倍になります。ただし、それだけでKimiのコストパフォーマンスが低いとは限りません。安価なモデルが何度も再試行し、人による修正も必要になる一方で、Kimiが難しいタスクを1回で完了できるなら、高価な呼び出しのほうが全体として安くなる可能性があります。

本番環境で適切な指標は、トークンコストだけではなく、受け入れられた結果のコストです。タスクカテゴリーごとに、モデル、トークン数、試行回数、レイテンシー、テスト結果、レビュアーによる承認を記録してください。トークン単価の低さは、出力が合格して初めて実際の節約になります。

速度とレイテンシー

Artificial Analysisでは現在、DeepSeek V4 Pro 0813の出力速度を毎秒83.2トークン、Kimi K3を毎秒40.8トークンと測定しています。最初のトークンまでの時間は、DeepSeekが1.63秒、Kimiが2.97秒です。

これらの数値は、インタラクティブなコーディングアシスタントや並列エージェントワーカーではDeepSeekに有利です。最終的に両モデルが許容できる回答に到達するとしても、トークンを2倍速く返すモデルなら、目に見える待ち時間を短縮できます。

ただし、プロバイダーの速度は重みだけで決まる恒久的な特性ではありません。サーバー負荷、量子化、バッチ処理、プロンプトの長さ、推論負荷、リクエストが処理される場所にも左右されます。現在の測定値は比較可能なスナップショットであり、すべての呼び出しに対するレイテンシー保証ではないと考えてください。

コンテキスト、推論、デプロイの違い

両モデルはおよそ100万トークンのコンテキストに対応しているため、コンテキストサイズだけではこの比較は決まりません。そのコンテキストをどのように使うかがより重要です。

DeepSeekは非思考モードと思考モードに対応し、難しいタスク向けに推論負荷を制御できます。また、現在のDeepSeek API仕様によると、最大384Kの出力が可能です。この柔軟性は、単純なタスクには高速な応答を使い、必要な場合にのみ深い推論を行うルーティングシステムに適しています。

Kimi K3は、設定可能な負荷による常時オンの推論を使用します。より大規模な2.8Tアーキテクチャとマルチモーダル設計は、ドキュメント、コード、画像、ツール使用を伴う長期的な作業を対象としています。そのトレードオフは、出力コストが高く、測定上の生成速度が遅いことです。

両モデルともダウンロード可能なウェイトを備えていますが、「オープンウェイト」はライセンスが同一であることを意味しません。DeepSeek V4 ProはMITライセンスを使用します。Kimi K3は独自のKimi K3 Licenseを使用します。商用セルフホスティングを計画しているチームは、MITと同じだと想定せず、Kimiの正確な利用条件を確認してください。

ハードウェア要件も、一般的なローカルワークステーションをはるかに上回ります。ウェイトが利用可能な場合でも、ほとんどの開発チームにとって、ホスト型APIの評価から始めるのが現実的です。

1つのAPIキーでDeepSeek V4 Pro 0813とKimi K3にアクセスする方法

GPT Protoは、OpenAI互換のチャット補完エンドポイントを通じて両モデルを提供しています。まずMODEL_IDをdeepseek-v4-proに設定してDeepSeekを開始します。

export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"

curl --request POST "https://gptproto.com/v1/chat/completions" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data "{
    \"model\": \"$MODEL_ID\",
    \"messages\": [
      {
        \"role\": \"user\",
        \"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
      }
    ]
  }"

同じテキストリクエストをKimi K3に送るには、1行を変更します。

export MODEL_ID="kimi-k3"

その後、同じcurlリクエストを再実行してください。別のMoonshotアカウント、2つ目の残高、DeepSeekのバージョンサフィックスは必要ありません。

比較を管理されたものにするには、プロンプト、コンテキスト、推論設定、出力上限を同じにしてください。レイテンシー、試行回数、テストに合格したかどうかとともに、返された使用量フィールドを記録します。本番環境のルーティングを決定するには、各モデルから得た魅力的な回答を1つずつ比較するだけでは不十分です。

どのモデルを選ぶべきか?

次の場合はDeepSeek V4 Pro 0813を選択してください。

  • ワークロードの中心がテキストとコードである

  • 出力量が多く、トークンコストが重要である

  • 低レイテンシーがユーザー体験を向上させる

  • 1つのモデルIDで非思考と深い推論を使いたい

  • MITライセンスのセルフホスティング手段が必要である

  • 高ボリュームのエージェント向けにデフォルトモデルを選定している

次の場合はKimi K3を選択してください。

  • モデルがスクリーンショット、画像、ドキュメントを確認する必要がある

  • 価格よりも現在最高の独立系知能スコアが重要である

  • 失敗したタスクのコストがプレミアムAPI呼び出しの料金を上回る

  • 長期的なマルチモーダルエージェントを構築している

  • 安価なモデルが失敗した後、最も難しいリクエストをエスカレーションしたい

ほとんどの開発者にとって、最適なルーティングポリシーは、まずDeepSeekを使い、必要な場合にKimiを使うことです。これにより、DeepSeekのコストと速度の利点を大部分活用しながら、Kimiのマルチモーダル対応とより高い能力上限にもアクセスできます。

最終結論

DeepSeek V4 Pro 0813は、ほとんどのテキストベースのコーディングおよびエージェントワークロードにとって、より優れたデフォルト選択肢です。現在のArtificial Analysis Intelligence IndexではKimi K3に7ポイント遅れていますが、出力速度はおよそ2倍で、GPT Protoでははるかに低コストです。特に、出力の多いエージェントループでその差が際立ちます。

Kimi K3は、より優れた専門モデルです。タスクに視覚入力が含まれる場合、料金よりも可能な限り高度な推論が重要な場合、またはDeepSeekがすでに失敗し、手作業で復旧するよりも再試行のほうが安い場合に選択してください。

0813アップデートによってKimiが時代遅れになったわけではありません。ルーティングの判断が明確になったのです。大量処理、速度、テキストにはDeepSeek、マルチモーダル対応と測定上より高い能力上限にはKimiを使い分けます。

1つのキーで、より多くのAIモデル

1つのOpenAI互換APIで、主要なAIモデルを手頃な料金で利用できます。

APIモデルを見る
1つのキーで、より多くのAIモデル
関連モデル
すべてのモデル
DeepSeek
15% OFF
MoonshotAI
10% OFF
OpenAI
20% OFF
OpenAI
20% OFF
Grok 4.6 vs DeepSeek V4 Pro:コーディング、料金、そしてどちらが優れているか

Grok 4.6 vs DeepSeek V4 Pro:コーディング、料金、そしてどちらが優れているか

rok 4.6とDeepSeek V4 Proは、どちらも難しい推論やコーディング作業向けに設計されていますが、互換的に使えるわけではありません。スクリーンショット、インターフェースのモックアップ、ビジュアルデバッグ、または非常に難しいエージェント型コーディングの課題では、Grok 4.6の方が優れた選択肢です。コスト、長いコンテキスト、大量のテキストベースのコーディングを重視する場合は、DeepSeek V4 Proの方が魅力的です。 結論はシンプルです。 Grok 4.6は総合的に優れたモデルであり、DeepSeek V4 Proはよりコスト効率の高いコーディングモデルです。 このGrok 4.6とDeepSeek V4 Proの比較では、コーディング、フロントエンド開発、コンテキストウィンドウ、公開ベンチマークの証拠、API料金、そして最新のDeepSeek V4 Proアップグレードを取り上げます。また、さまざまな開発者のワークロードにおいて、どちらのモデルが適しているかも説明します。 簡単な結論: ビジュアルなフロントエンド作業、難しいデバッグ、高い信頼性が求められるコーディング作業にはGrok 4.6を選びましょう。大規模なリポジトリ、テキスト中心のワークフロー、低いAPIコストを重視するならDeepSeek V4 Proがおすすめです。本番環境でのルーティングでは、DeepSeek V4 Proを通常のワークロードに使用し、Grok 4.6をビジュアルタスクや難しい問題へのエスカレーションに使用できます。

Tiffany Layne | 2026-08-13

Grok 4.6 vs Kimi K3:あなたのプロジェクトに合うのはどちら?

Grok 4.6 vs Kimi K3:あなたのプロジェクトに合うのはどちら?

2つの最先端モデルが、4週間以内の間隔で相次いで登場しました。どちらも、チャットボットではなくエージェントを動かす開発者という、同じ購入層を明確に対象としています。Moonshot AIは2026年7月16日にKimi K3をリリースし、xAIは8月12日にGrok 4.6で応じました。現在「Grok 4.6 vs Kimi K3」で検索すると、各陣営のリリース記事と大量の仕様表が表示されます。しかし、開発者の視点で両者を横並びに比較した記事はほとんどありません。この記事は、その空白を埋めるものです。 結論を知りたい方のために、まず短くまとめます。振り返りではなく、判断を求めているはずです。 Grok 4.6は、エージェントのターン効率と、インフラを意識せずに使えるホスティングで優れています。 長時間にわたる複数ステップのタスクを、より少ないループとトークンで完了し、インフラに触れる必要もありません。 Kimi K3は、コンテキスト、ネイティブ動画、制御性で優れています — 100万トークンのコンテキストウィンドウ、画像 と 動画入力、さらにセルフホストやエアギャップ環境で必要な場合に使えるダウンロード可能なオープンウェイトを備えています。誰もが引用する1つの数値では、両者はほぼ互角です。Artificial Analysisによれば、両者のタスクあたりコストはおよそ $0.84 です。つまり、インテリジェンス指数の1ポイント差は、決め手にはなりません。両モデルは同じコストに対して正反対の道を選んでおり、 そこ が、実際に選ぶべき分岐点です。 コスト重視の大規模エージェントワークフローを運用し、マネージドエンドポイントを求めるならGrok 4.6。リポジトリ全体や動画を1つのコンテキストウィンドウに投入したい場合、またはコンプライアンス上の理由でウェイトを自社で保持する必要がある場合はKimi K3です。この記事の残りでは、この判断の根拠を詳しく説明します。

Schuyler Stacy | 2026-08-13

2026年版コーディング向け低価格LLMベスト7:API料金と性能の比較

2026年版コーディング向け低価格LLMベスト7:API料金と性能の比較

最も安価なコーディングモデルが、必ずしも最も安く使えるモデルとは限りません。 $0.14 / 100万入力トークンのモデルは安価に見えます。しかし、リポジトリを誤解し、間違ったファイルを編集し、3回の再試行が必要になるまではそう思えるでしょう。一方、トークン単価が高いモデルでも、同じパッチを1回で完了できる場合があります。 だからこそ、これは入力料金だけでモデルを並べた、よくあるランキングではありません。 まず、ターミナル操作、デバッグ、複数ステップの開発タスクに対応できる十分なコーディング能力を持つモデルを探しました。次に、同じ2種類のシミュレーションワークロードを使って、入力、キャッシュ入力、出力の料金を比較しました。 このランキングでは、コーディングIDEのサブスクリプションではなく、 APIから利用できるLLM を対象にしています。また、GPU、推論インフラ、保守、エンジニアリング時間は無料ではないため、セルフホスト型モデルは除外しています。 料金とベンチマーク結果は 2026年8月12日 時点で確認しました。恒久的な料金表ではなく、その時点のスナップショットとして扱ってください。

Michael Johnson | 2026-08-12

GLM 5.2 vs Claude Opus 5:どちらのコーディングモデルがより費用対効果に優れているか?

GLM 5.2 vs Claude Opus 5:どちらのコーディングモデルがより費用対効果に優れているか?

安価なトークンが、必ずしも安価な結果を意味するわけではありません。GLM 5.2とOpus 5の比較では、この違いが重要です。見出しの数字が正反対の方向を示しているからです。GLM-5.2は低価格で応答も高速ですが、Claude Opus 5は現在の独立した知能比較で首位に立ち、テキストだけでなく画像も検査できます。 結論を先に言うと、シンプルです。開発者またはより強力なレビュー用モデルが結果を確認する、高ボリュームで範囲の明確なコーディング作業にはGLM-5.2を選びましょう。曖昧なリポジトリ変更、視覚的なフロントエンドのデバッグ、そして最初の試行に失敗した場合のコストがモデル呼び出しのコストを上回るタスクにはClaude Opus 5を選びます。 より強い主張には注意が必要です。Z.aiは2026年6月にGLM-5.2をリリースしましたが、AnthropicがOpus 5をリリースしたのは7月24日です。コミュニティでの議論や「実環境」の比較の多くは、現在もGLM-5.2とOpus 4.8を比較しています。これらの結果は有用な背景情報ですが、GLM-5.2がOpus 5に勝つ、あるいは負けることの証拠ではありません。 この記事は、 firsthand benchmarkではなく、証拠に基づく比較です。結論は、現行のモデルドキュメント、GPTProtoの料金、独立したベンチマークデータ、ベンダーの開示情報、そしてコミュニティによる評価手法に基づいています。GLM-5.2とOpus 5を直接比較した証拠がまだない場合は、その制限を明示しています。

Michael Johnson | 2026-08-04