Michael Johnson2026-07-28

Kimi K3とは?GPT-5.6やFable 5に本当に近いのか?

Kimi K3はオープンソースで、GPT-5.6やFable 5に本当に近いのでしょうか?100万トークンのコンテキスト、API料金、独立ベンチマーク、Redditでの反応を詳しく解説します。

Kimi K3とは?GPT-5.6やFable 5に本当に近いのか?

TL;DR

Kimi K3は、長時間にわたるコーディング、ナレッジワーク、推論、エージェントワークフロー向けにMoonshot AIが開発した、2.8兆パラメータのマルチモーダルモデルです。独立したテストでは、総合的にClaude Opus 4.8やGPT-5.5に近い位置にありますが、GPT-5.6 SolとClaude Fable 5には依然として及びません。K3はエージェントベンチマークで差を縮め、一部の自動化テストではトップに立っていますが、測定されたハルシネーション率はK2.6から上昇しています。
 Kimi K3は現在、オープンウェイトとして公開されています。Moonshot AIは完全なチェックポイント、モデルカード、技術レポート、独自のKimi K3 Licenseを公開しました。公式Hugging Faceリポジトリは96個のsafetensorsシャードで約1.56 TBあり、Moonshotは64基以上のアクセラレータを備えたスーパーノード構成を推奨しています。オープンウェイト化によって、所有権に関する疑問は解消されました。ただし、K3が一般的なローカルモデルになったわけではありません。
ほとんどの開発者にとって、ホステッドAPIが現実的な出発点です。GPTProtoのKimi K3 APIは現在、入力トークン100万個あたり2.70ドル、出力トークン100万個あたり13.50ドルと表示されています。データ管理、カスタム推論、モデル変更に、インフラ構築やライセンス確認のコストをかける価値がある場合はウェイトを選びましょう。
要するに、Kimi K3はGPT-5.6やFable 5と同じ土俵で語れるほど近い性能を持ち、オープンウェイトでのリリースによって、どちらのクローズドモデルにもないデプロイメントの選択肢を開発者に提供しています。

目次

Kimi K3とは?

Kimi K3は、Moonshot AIの新しいフラッグシップ・マルチモーダル推論モデルです。単一のチャットプロンプトに答えるだけでなく、数時間に及ぶコーディング、調査、ツール利用、修正を伴う可能性のある作業のために設計されています。

このモデルは2026年7月16日に、Kimi.com、Kimi Work、Kimi Code、Kimi APIで提供開始されました。総パラメータ数は2.8兆、コンテキストウィンドウは100万トークンで、テキスト、画像、動画の入力をネイティブにサポートします。出力はテキストのみです。

内部では、K3は896個のエキスパートを持つMixture-of-Expertsアーキテクチャを使用し、そのうち16個を一度に有効化します。Moonshotはさらに、長いシーケンスや深いモデル層を通じた情報伝達を改善するため、Kimi Delta Attention、Attention Residuals、Stable LatentMoEを導入しました。Moonshotによれば、これらの変更によりKimi K2の約2.5倍のスケーリング効率を実現していますが、この数値は独立テストではなく開発元によるものです。MoonshotのKimi K3技術ブログでは、現在のアーキテクチャの詳細が説明されています。より完全な技術レポートはまだ公開待ちです。

で公開
仕様 Kimi K3
開発元 Moonshot AI
公開日 2026年7月16日
総パラメータ数 / 有効パラメータ数 2.8T / 104B
アーキテクチャ Mixture-of-Experts
エキスパート 合計896個、アクティブ16個
コンテキストウィンドウ 100万トークン
入力 テキスト、画像、動画
出力 テキスト
APIモデル文字列 kimi-k3
思考モード 常時有効
ウェイトの提供状況 完全なウェイトを`moonshotai/Kimi-K3

これにより、K3は現在までに発表されたAIモデルの中でも最大級のモデルの一つとなりました。しかし、サイズそのものが有用性を決めるわけではありません。本当の問題は、Moonshotがそのパラメータをより優れたタスク完了能力へと変えられたかどうかです。

今回のリリースにより、当初のローンチ報道に残っていた不確実性も一つ解消されました。技術レポートが公開されたためです。ただし、独立評価の必要性がなくなったわけではなく、2.8Tモデルが簡単に自社ホスティングできるプロジェクトになったわけでもありません。

Kimi K3は本当にGPT-5.6やClaude Fable 5に近いのか?

総合的な知能では、まだ完全には近くありません。一方、複数のエージェント型タスクや長時間タスクでは、近いと言えます。

Moonshot自身の発表は、そこから生まれた多くの見出しよりも慎重な内容です。同社は、K3の総合性能はClaude Fable 5とGPT-5.6 Solに依然として及ばないと説明しています。それでも、コーディング、ナレッジワーク、推論全体でフロンティア級の結果を報告しています。

一例がGPUカーネル最適化です。Moonshotは各モデルを同一のサンドボックスに置き、4つのGPUタスクを最適化するために最大24時間を与えました。このテストでK3はFable 5と競争力のある結果を出し、GPT-5.6 Sol、GPT-5.5、Opus 4.8を上回りました。これは低レベルの性能エンジニアリングにおける大きな成果です。しかし、K3があらゆる面で普遍的に賢いことを示す証拠ではありません。

独立テストは、より広い視点を与えてくれます。Artificial AnalysisはKimi K3のIntelligence Indexを57と評価し、GPT-5.5やClaude Opus 4.8付近に位置づけましたが、Fable 5とGPT-5.6 Solの後塵を拝しています。最も強い結果が見られたのは、知能のすべてのカテゴリーではなく、エージェント実行や自動化でした。Artificial Analysisは7月16日にK3の調査結果を公開しました.

評価 Kimi K3の結果 そこから分かること
AA Intelligence Index 57 GPT-5.5およびOpus 4.8に近い。GPT-5.6 SolとFable 5には及ばない
GDPval-AA v2 1,668 Elo 実世界のエージェントタスクで高い実行力
AutomationBench-AA 53%、1位 SaaSワークフローの自動化に特に有効
AA-Briefcase 1,547 Elo、2位 長時間にわたるナレッジワークに強い
Omniscienceの正確性 46% K2.6の33%から上昇
ハルシネーション率 51% K2.6の39%より悪化

最後の行が私の目を引きました。K3はより高性能になりましたが、Artificial Analysisの測定ではハルシネーションも増えています。より多くの質問に正しく答える一方で、裏付けのない主張の割合も高くなりました。

このトレードオフは本番環境で重要です。長いエージェントワークフローを完了できても、誤った前提を気づかないうちに導入するモデルは、事実性が安定した低速のモデルより検証コストが高くなる可能性があります。

一つのリーダーボードで比較を決められない理由

K3はすでに、少なくとも一つのフロントエンド生成リーダーボードでトップに到達しています。GPU最適化、SaaS自動化、長時間のナレッジワークでも優れた性能を示します。しかし、これらは同じ能力を測定しているわけではありません。

フロントエンドアリーナは、生成されたインターフェースをユーザーがどちらを好むかを測定します。AutomationBenchは、エージェントがソフトウェアワークフローを操作できるかを測定します。GPUカーネル最適化は、低レベルのシステムエンジニアリングをテストします。いずれも、K3が調査、事実想起、デバッグ、プレゼンテーション設計、一般的な推論のどれにおいて優れているかを単独で答えることはできません。

堅実な結論は、より限定的なものです。Kimi K3はエージェント型作業におけるフロンティアグループに加わりましたが、より広範な比較ではGPT-5.6 SolとFable 5が依然としてリードしています。現在のクローズドモデルの最高水準を求める開発者はGPT-5.6 Sol APIを検討できます。一方、Claude Opus 4.8は、複雑なコーディングや調査ワークフローでより確立された選択肢です。

オープンウェイトの問題は解決した。デプロイメントの問題はまだ残っている

ローンチ週に問われていたのは、Moonshotが本当にウェイトを公開するかどうかでした。答えは「公開した」です。公式の moonshotai/Kimi-K3リポジトリには、完全なチェックポイント、モデルカード、技術レポート、推論コード、Kimi K3 Licenseが含まれています。

正確な表現は依然として重要です。Kimi K3はオープンウェイトであり、無条件の「完全なオープンソース」リリースではありません。独自ライセンスは、広範な利用、変更、ファインチューニング、デプロイメント、再配布を認めていますが、大規模なModel-as-a-Service事業や非常に大規模な商用製品には条件が追加されます。トレーニングデータは公開されていません。

利用可能であることと、使いやすいことも別問題です。リポジトリの容量は約1.56 TBで、Moonshotは64基以上のアクセラレータを備えたスーパーノード構成を推奨しています。つまりK3はクラウドやエンタープライズのインフラチームにとって重要ですが、一般的なワークステーションにダウンロードして使うモデルではありません。

それでも、このリリースは重要です。組織は今や、チェックポイントを検査し、推論をカスタマイズし、派生モデルをファインチューニングし、一つのホステッドエンドポイントだけに完全に依存せずモデルを運用する現実的な道を手にしました。その代償は、ハードウェア、サービングエンジニアリング、ライセンス確認です。

Kimi K2.7からKimi K3で何が変わったのか?

K3は、単にバージョン番号を大きくしたKimi K2.7ではありません。

Kimi K2.7 Codeは、K2.6をベースにしたコーディング特化型のエージェントモデルです。モデルカードでは、実世界のソフトウェアエンジニアリング、長時間のコーディングセッション、ツール利用、推論トークン消費の削減が重視されています。K3はその役割を一般的なフラッグシップへと拡張し、コーディング、視覚的推論、調査、エンドツーエンドのナレッジワークをカバーします。

コンテキストウィンドウは256Kから100万トークンへ拡大しました。総パラメータ数は1兆から2.8兆へ増え、エキスパート数も384から896へ増加しています。それに伴い価格も上昇しています。

機能 Kimi K3 Kimi K2.7 Code
位置づけ 総合フラッグシップ コーディング特化モデル
総パラメータ数 2.8T 1T
エキスパート 896、アクティブ16 384、アクティブ8
コンテキストウィンドウ 1M 256K
標準入力 $3.00/MTok $0.95/MTok
出力 $15.00/MTok $4.00/MTok
キャッシュ済み入力 $0.30/MTok $0.19/MTok
ウェイト Kimi K3 Licenseのもとで利用可能 利用可能

したがってK3の価値提案は、「ほとんど無料でフロンティア級の知能」というものではありません。インフラを自ら所有する準備があるチーム向けに、すぐ使える従量制APIと、公開されたウェイトという2つのデプロイメント経路を備えた、フロンティアに近いエージェント性能です。

公式のK2.7 Codeモデルカードには、そのアーキテクチャ、ベンチマーク手法、デプロイメントの指針が記載されています。

Kimi K3は100万トークンのコンテキストをどのように扱うのか

100万トークンのコンテキストウィンドウにより、K3は大規模なコードベース、技術文書の集合、長時間にわたるエージェント履歴、中間的なツール結果を1回のリクエストで受け取れます。

これは長時間稼働するエージェントに特に関係します。コーディングモデルは、初期仕様、リポジトリ構造、ターミナル出力、テスト失敗、過去の編集、レビュアーのフィードバックを数十ステップにわたって保持する必要があります。タスクの途中で制約の一つを失うと、エージェントが生産的に見えても完了できないという事態がよく起こります。

K3はコンテキストの自動キャッシュにも対応しています。開発者がキャッシュIDを作成したり、個別の有効期限を設定したりする必要はありません。リクエスト間で長いプレフィックスが変わらなければ、システムが自動的にキャッシュヒットを試みます。キャッシュ済み入力の料金は、100万トークンあたり3.00ドルではなく0.30ドルです。

しかし、コンテキスト容量とコンテキストを完璧に活用できることは同じではありません。100万トークンをモデルに入力しても、すべての行に正しい重要度を割り当てる保証はありません。入力が長くなるほど、コスト、処理時間、無関係な情報による注意散漫も増える可能性があります。

依然として妥当な方法は、まず最も関連性の高いファイルを取得し、キャッシュのために安定した参照コンテンツを先頭に置き、上限が許すからといってナレッジベース全体を送信しないことです。KimiのAPIガイドでは、100万トークンのコンテキストと自動キャッシュの動作が説明されています。

Kimi K3 APIの料金はもはや格安ではない

Moonshotの公式Kimi K3 APIは、固定の従量課金制を採用しています。リクエストがより大きなコンテキスト階層を超えても、料金は変わりません。

トークン種別 100万トークンあたりの価格
キャッシュ済み入力 $0.30
標準入力 $3.00
出力 $15.00

10万個のキャッシュされていない入力トークンを使用し、2万個の出力トークンを生成する短いエージェントタスクでは、モデル料金の見積もりは次のとおりです。

(0.1 × $3) + (0.02 × $15) = $0.60

次に、80万個のキャッシュ済みトークン、5万個の新規入力トークン、5万個の出力トークンを使う、繰り返し型の長文脈ワークフローを考えてみましょう。

(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14

キャッシュにより2つ目の例は扱いやすい価格になりますが、K3が従来の「中国モデル=非常に安いAPI」という公式に従っていないことは明らかです。

Artificial Analysisが測定したK3のIntelligence Indexタスクの平均コストは0.94ドルで、GPT-5.6 Solの1.04ドルに近く、Opus 4.8の1.80ドルのおよそ半分でした。GLM-5.2は同じ評価ワークロードを大幅に低い料金で完了しました。

モデルにアクセスする場所によっても比較結果は変わります。GPT ProtoのKimi K3 APIの現在の料金は、入力トークン100万個あたり2.70ドル、出力トークン100万個あたり13.50ドルで、Moonshotの3ドル/15ドルという表示価格より10%安く設定されています。GPT ProtoではGPT-5.6 SolGLM-5.2も同じAPIキーと共有残高で利用できるため、プロバイダーごとに別のアカウントを作らず、タスク単位で比較しやすくなります。

したがってK3の価値提案は、「ほとんど無料でフロンティア級の知能」ではありません。すぐ使える従量制APIと、インフラを自社で管理する準備があるチーム向けの公開ウェイトという、2つのデプロイメント経路を備えた、フロンティアに近いエージェント性能です。

Kimi K3 APIとオープンウェイト:どちらを使うべきか?

 Kimi K3によって、開発者は現実的なデプロイメントの選択肢を得ました。どちらの経路でもモデル性能が魅力ですが、運用モデルはまったく異なります。

ホステッドKimi K3 API Kimi K3オープンウェイト
トークン単位で支払う アクセラレータ容量を購入またはレンタルする
プロバイダーがスケーリング、キャッシュ、更新、障害対応を管理 自社チームがサービング、スケーリング、監視、アップグレード、障害対応を管理
評価と本番導入への最短ルート データ、推論、モデル変更を最大限に管理
ホステッドサービスはテキスト、画像、動画の入力に対応 現在公開されているリポジトリのメタデータはテキストと画像が中心です。動画経路の互換性を確認してから対応を約束してください
1.56 TBのダウンロードは不要 96個のウェイトシャードで約1.56 TB
クラスターデプロイメントのプロジェクトは不要 Moonshotは64基以上のアクセラレータを推奨

プロダクトマーケットフィットの検証中、トラフィックが変動する、またはチームが大規模モデルのインフラをまだ運用していない場合は、まずAPIを使いましょう。GPT Proto Kimi K3 APIを使えば、GPT-5.6 Sol、GLM-5.2などのモデルを一つのキーと残高で比較しやすくなります。

プライベートデプロイメント、ファインチューニング、カスタム推論、プロバイダーからの独立に、クラスターを正当化できるだけの事業価値がある場合はウェイトを使いましょう。本番環境へ導入する前に、「オープン」とはMITを意味すると決めつけず、Kimi K3 Licenseを確認してください。

Kimi K3とGLM-5.2、GPT-5.6、Opus 4.8の比較

ベンチマークの勝者が、必ずしも本番環境に適したモデルとは限りません。何が失敗し得るのか、ワークフローがどのくらい続くのか、ウェイトを所有することが重要かによって、適切な選択は変わります。

モデル 次のような場合に選ぶ
Kimi K3 長時間のマルチモーダルエージェントワークフローが必要で、今すぐホステッドAPIを使うか、Kimi K3 Licenseのもとでオープンウェイトをデプロイしたい
GPT-5.6 Sol 所有権よりも総合的な推論品質と信頼できる本番性能が重要
Claude Fable 5 測定されたエージェント型ナレッジワークの最高水準を求め、利用できる環境がある
Claude Opus 4.8 複雑なコーディング、調査、慎重な指示追従で、すでにClaudeのワークフローに依存している
GLM-5.2 すでにウェイトが利用できる、低コストのエージェント型コーディングが必要
Kimi K2.7 Code ワークロードの中心がコーディングで、K3の高い価格を正当化しにくい

K3が最も明確に適するのは、長時間のタスク、マルチモーダル入力、モデルのデプロイメントを管理する理由という3つの条件が重なる場合です。これらの要件がなければ、その規模は小さな問題に対する高価な解決策になり得ます。

幅広い知能と信頼性を最優先するなら、GPT-5.6 Solがより強力な選択肢です。Opus 4.8は、成熟したClaudeベースのコーディングまたは調査ワークフローを持つチームに適しています。GLM-5.2は、100万トークンのコンテキストとオープンウェイトをより低いタスクコストですでに提供しているため、経済性の面で手強い競合です。

私の現在の経験則はシンプルです。オープンウェイトと長時間のマルチモーダルエージェントが重要ならK3を選びます。モデルの所有権より信頼性が重要ならGPT-5.6またはOpusを選びます。コストが譲れない制約ならGLM-5.2を選びます。

Kimi K3はもうGPT Protoで使える?

はい。Kimi K3は現在、GPT Proto Kimi K3 APIから利用できます。

現在のGPT Proto料金は、入力トークン100万個あたり2.70ドル、出力トークン100万個あたり13.50ドルで、Moonshotの現在の表示価格3ドル/15ドルより10%安くなっています。GPT Proto APIキーでモデル文字列kimi-k3を使用すると、K3の長文脈コーディング、マルチモーダル分析、ツール呼び出し、構造化出力の機能にアクセスできます。

同じキーと共有残高で、GPT-5.6 SolGLM-5.2Claude Opus 4.8、さらにテキスト、画像、動画、音声に対応する200以上のモデルも利用できます。これにより、本番トラフィックを変更する前に、同じリポジトリやエージェントワークフロー上でK3と代替モデルを実際に比較できます。

GPT ProtoでKimi K3を試すか、GPT Proto AIモデルギャラリー全体を閲覧できます。モデルのウェイトと技術レポートは公開されましたが、独立したデプロイメントテスト、量子化、スループットデータ、フレームワーク対応が成熟するにつれて、この記事は改めて見直す必要があります。

最終結論:近いが、ベンチマークは依然として重要

Kimi K3は、パラメータ数だけを理由に注目を集めている巨大な中国製モデルに過ぎません。独立テストは、より重要な結論を裏付けています。K3は、自動化、長時間のナレッジワーク、エージェント実行において、フロンティアシステムと競争力があります。

しかし、それによって総合的にGPT-5.6 SolやClaude Fable 5を上回るわけではありません。測定されたハルシネーションの増加も消えません。7月28日に変わったのはデプロイメントです。約束されていたウェイト、ライセンス、モデルカード、技術レポートが公開されました。
したがってK3は、このクラスで最も高性能なオープンウェイトモデルの一つですが、この表現には2つの注記が必要です。ライセンスはMITではなく独自仕様であり、1.56 TBのリポジトリと64基以上のアクセラレータ推奨によって、セルフホスティングは一般的な開発チームの手に余る規模です。
私の結論はこうです。K3が実際に自分のタスクを改善するかどうかを確かめるには、まずAPIを使いましょう。管理性、カスタマイズ性、データ境界を理由に、自らインフラプロバイダーになる価値がある場合にのみ、ウェイトへ移行してください。

クリエイティブスタジオ

本番環境向けAPIを使用して、画像や動画などを生成します。

作成を開始する
クリエイティブスタジオ
関連モデル
すべてのモデル
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
20% OFF
Z-AI
by Z-AI
10% OFF

よくある質問

Kimi K3とは?

Kimi K3は、Moonshot AIが開発した2.8兆パラメータのマルチモーダルAIモデルです。長時間にわたるコーディング、ナレッジワーク、推論、視覚理解、エージェントワークフロー向けに設計されています。

Kimi K3のリリース日は?

Kimi K3は2026年7月16日に提供開始されました。Moonshotは、完全なモデルウェイトを2026年7月27日までに公開すると説明しています。

Kimi K3はオープンソースですか?

Kimi K3はオープンウェイトです。Moonshot AIは、独自のKimi K3 Licenseのもとで完全なチェックポイント、モデルカード、推論コード、技術レポートを公開しました。トレーニングデータは公開されておらず、ライセンスには大規模なModel-as-a-Service事業や非常に大規模な商用製品に関する条件が含まれるため、「完全なオープンソース」という表現は広すぎます。

Kimi K3のコンテキストウィンドウは?

Kimi K3は100万トークンのコンテキストウィンドウに対応しています。また、繰り返し使用する長いプレフィックスの自動コンテキストキャッシュにも対応しています。

Kimi K3 APIの料金はいくらですか?

公式Kimi K3 APIの料金は、標準入力トークン100万個あたり3ドル、出力トークン100万個あたり15ドル、キャッシュ済み入力トークン100万個あたり0.30ドルです。

Kimi K3はGPT-5.6 Solより優れていますか?

総合的には、そうではありません。Kimi K3は一部のエージェント型・専門的なテストでGPT-5.6 Solをリードまたは追随していますが、Moonshotと独立テストの両方で、より広範な知能ではGPT-5.6 Solが上位に位置づけられています。

Kimi K3はClaude Fable 5より優れていますか?

現在の証拠では、優れているとは言えません。K3は複数の長時間タスクやエージェント型タスクでFable 5に近づいていますが、ローンチ時点で利用できるより広範な独立評価では、Fable 5が依然として上位です。

Kimi K3はGLM-5.2より優れていますか?

Kimi K3は、測定された知能とエージェント性能の上限がより高くなっています。GLM-5.2はより安価で小規模であり、すでにオープンウェイトモデルとして利用できるため、より実用的な選択肢になる可能性があります。v

Kimi K3はローカルで実行できますか?

ウェイトはダウンロードできますが、実用的なデプロイメントは通常の意味でのローカル利用ではありません。公式リポジトリは約1.56 TBあり、Moonshotは64基以上のアクセラレータを備えたスーパーノード構成を推奨しています。

Kimi K3 APIとオープンウェイトのどちらを使うべきですか?

評価、変動するトラフィック、マネージド運用にはAPIから始めましょう。プライベートデプロイメント、ファインチューニング、カスタム推論、プロバイダーからの独立に、ハードウェア、サービング作業、ライセンス確認を正当化できる価値がある場合はウェイトを使いましょう。
2026年開発者向け最適なAI API:10のプラットフォームを比較

2026年開発者向け最適なAI API:10のプラットフォームを比較

要約 最適な直接API: OpenAIは汎用用途における最も安全なデフォルトです。Anthropic Claudeはコーディングと長時間稼働するエージェントに最適で、Geminiは低コストなマルチモーダルプロトタイピングに適しています。テキストトークン単価ではDeepSeekがリードしています。 最適なマルチモデルオプション: 多数のLLMをテストするならOpenRouterが最も分かりやすい選択肢です。1つの製品でテキスト、画像、動画モデルを1つのAPIキーと共通残高で利用したい場合は、GPTProtoがより適しています。 最適なインフラストラクチャ: Amazon BedrockはAWSのガバナンス下にあるエンタープライズ導入に適しています。一方、Replicate、fal.ai、Together AIはオープンモデルや生成メディアの推論に適しています。 すべての用途に共通する勝者は存在しません。ワークロードとの適合性、モデルの対応範囲、実際の課金単位、本番環境向けの管理機能、切り替えコストを比較してください。価格と提供状況は2026年7月14日時点で確認しています。導入前に各プロバイダーの最新情報を確認してください。

Tiffany Layne | 2026-07-15

GPT-5.6 Sol vs Claude Fable 5:トークン単価が安いのはどちらか、それとも信頼コストが安いのはどちらか?(2026年)

GPT-5.6 Sol vs Claude Fable 5:トークン単価が安いのはどちらか、それとも信頼コストが安いのはどちらか?(2026年)

2週間前、この比較の答えは退屈なものでした。GPT-5.6 Solは入手できなかったため、Claude Fable 5を選べばよかったのです。Solは、約20の組織を対象とした政府審査済みのプレビューに閉じ込められていました。その制約はなくなりました。OpenAIはGPT-5.6ファミリー(Sol、Terra、Luna)を、 7月9日に一般提供 へ移行し、Fable 5も、提供を停止させていた米国商務省の輸出規制が解除された後、7月1日から世界中で利用可能になっています。つまり、この問いが再び有効になったのです。そして今や問題はアクセスではありません。どちらのモデルの失敗モードなら、見張り続けるコストを負担できるかということです。 先に結論を述べ、その後で根拠を示します。 要約 Solは、財務チームが気にするあらゆる基準で安価です。GPTProtoでは、入力/出力100万トークンあたり4ドル/24ドルで、Fable 5の8ドル/40ドルを下回ります。トークン単位ではなく、完了したタスク単位で測ると差はさらに広がります。一方、Fable 5の設計思想は、予測可能な動作です。フラグが立ったプロンプトはより安全なモデルにフォールバックし、Solを監視なしのパイプラインに組み込む人なら誰もが懸念すべきある習性も、まだ身につけていません。独立評価機関METRは、公開モデルの中でSolの報酬ハッキング率が最も高いと指摘しました。したがって、「トークン単位で安い」のは明確にSolです。「誰も見ていないときに信頼するコストが安い」のはFableです。この記事の大部分では、この2つの文がなぜ相殺されないのかを説明します。 両モデルは1つのGPTProtoキーと1つの残高で利用できるため、スタック全体を単一の回答に委ねるのではなく、タスクごとに使い分けられます。詳しくは最後に説明します。

Michael Johnson | 2026-07-10

コーディング向けMiniMax M3:ベンチマーク、実際の料金、API経由での呼び出し方(2026年)

コーディング向けMiniMax M3:ベンチマーク、実際の料金、API経由での呼び出し方(2026年)

MiniMax M3はコーディングに適していますか?短く答えるなら、エージェント型の作業や複数ファイルにまたがる作業には適しています。ただし、この記事を読み進める前に、2つ注意点を率直にお伝えします。主なコーディングスコアの多くは、MiniMaxが自社のインフラ上で実施したものです。また、「100万トークンのコンテキスト」には512Kで料金が急増する境界があり、特にコーディングエージェントに影響します。これらの点を把握していれば、どちらも対処可能です。いずれも、ローンチ時の報道では明確に説明されていません。 M3をめぐるコーディングの売り文句が、59%という1つの数字――SWE-Bench Proのスコア――に集約され、その数字が十分に検証されないまま多くの役割を担っているため、この記事を書いています。ここでは、モデルの実態、独立した測定結果、実際のコーディング作業でかかる費用、そしてGPTProto API経由での呼び出し方を説明します。結論だけ知りたい場合は、主要なモデルすべてに同じテストセットを実行している独立レビューアーによれば、M3は「実際のコーディングではGPTやOpusに近いが、まだ完全には上回っていない」とのことです。中立的なベンチマークの結果も、同じ位置付けを示しています。

Schuyler Stacy | 2026-07-02

コーディングにおけるGLM-5.2 vs Kimi K3:2026年、開発者にとって優れているのはどちら?

コーディングにおけるGLM-5.2 vs Kimi K3:2026年、開発者にとって優れているのはどちら?

TL;DR: 難しいタスク、長時間にわたるタスク、またはビジュアル要素を含むタスクでは、Kimi K3のほうが優れたコーディングモデルです。Moonshotが公開したコーディング比較ではGLM-5.2を上回り、ホスト型サービスを通じて画像と動画も扱えます。一方、日常的なリポジトリ作業のデフォルトとしては、GLM-5.2のほうが適しています。コストが大幅に安く、運用するモデルも小さく、寛容なMITライセンスを採用しているためです。Kimi K3も現在は重みが公開されていますが、1.56 TBのリポジトリ、64基以上のアクセラレータを推奨する構成、独自ライセンスにより、セルフホスティングへの取り組みは大幅に大きくなります。ボトルネックが能力ならKimiを、毎日のコストと運用の簡便さを重視するならGLMを選びましょう。 GLM-5.2とKimi K3 Codeの比較で興味深いのは、どちらもReactコンポーネントを作成したり、短いアルゴリズムを解いたりできることではありません。このレベルのモデルなら、その基準はすでにクリアしています。重要なのは、課題が複雑になったときにどうなるかです。リポジトリの監査、複数ファイルにまたがる移行、スクリーンショットでしか現れないバグ、あるいは複数のシステムの整合性を保つ必要がある、プレイ可能なThree.jsプロトタイプなどです。 価格差が重要になり始めるのも、まさにこの領域です。最も難しい公開テストではKimi K3のほうが優れていますが、公式の出力価格はGLM-5.2の3倍以上です。日常的なレビューを何千件も処理するチームなら、1ドルあたりの処理量ではGLMのほうが多くなる可能性があります。難しいビジュアルプロジェクトを1件救いたい開発者なら、K3のために喜んで料金を支払うでしょう。

Tiffany Layne | 2026-07-28