要約:
GPT-5.4は、推論、コーディング、デスクトップ操作を1つに統合したOpenAIの最新モデルです。ほとんどのベンチマークでGPT-5.2を上回り、100万トークンのコンテキストウィンドウに対応しています。現在はGPT Protoなどのプラットフォームを通じて、より低いAPI料金で利用できます。
GPT-5.4は、最先端の推論、コーディング、組み込みのComputer Useを1つに統合したOpenAIの最新AIモデルです。新機能、GPT-5.2との比較、GPT Protoを通じて低コストで利用する方法を解説します。

GPT-5.4は、推論、コーディング、デスクトップ操作を1つに統合したOpenAIの最新モデルです。ほとんどのベンチマークでGPT-5.2を上回り、100万トークンのコンテキストウィンドウに対応しています。現在はGPT Protoなどのプラットフォームを通じて、より低いAPI料金で利用できます。
OpenAIは、これまでで最も高性能なモデルとなるGPT-5.4を、最も難しいタスク向けに構築されたPro版とともに発表しました。ChatGPTではPlus、Team、Proユーザー向けに、APIでもすでに利用可能です。今回のリリースは、日常的な専門業務におけるAIにとって重要な前進となります。GPT-5.4は、ネイティブのComputer Useを搭載したOpenAI初の汎用モデルです。つまり、単にテキストを生成するだけでなく、実際のユーザーのようにデスクトップを操作できます。

このガイドでは、以下の内容を説明します:
GPT-5.4の実体と、GPT-5.2との違い
文章作成、コーディング、推論における主な性能向上
新しいComputer Use機能と視覚理解機能
GPT-5.4による長文書や大規模コードベースの処理方法
ChatGPTおよびAPIにおけるGPT-5.4とGPT-5.4 Proの料金
GPT Protoを通じてGPT-5.4を低コストで利用する方法
GPT-5.4は、前バージョンへの小さなアップデートにとどまりません。これまで別々のモデルに存在していた、汎用推論、コーディング能力、Computer Useという3つの機能を統合しています。これまでは、3つすべてを必要とする開発者は、複数の専門モデル間でリクエストを振り分ける必要がありました。現在は、1つの統合された選択肢を利用できます。
このモデルは100万トークンのコンテキストウィンドウをサポートし、1回の応答で最大128,000トークンを出力できます。知識カットオフは2025年8月31日です。
これまで、これらは別々のツールまたはモデルバリアントでした。GPT-5.4では、1つのAPIエンドポイントに統合されています:
汎用推論と文章作成 — 文書の作成、分析、Q&Aなど
コード生成とデバッグ — GPT-5.3-Codexの技術を継承
Computer Use — スクリーンショットとマウス・キーボード入力によるデスクトップ環境の直接操作
この統合により、AI搭載アプリケーションの構築が大幅に容易になります。特に、GPT Protoのような単一の統合ポイントを通じて、柔軟で多目的なモデルアクセスを必要とする開発者にとって有用です。
| ベンチマーク | GPT-5.2 | GPT-5.4 | GPT-5.4 Pro |
| ARC-AGI-2 | 52.90% | 73.30% | 83.30% |
| GPQA Diamond | — | 92.80% | — |
| FrontierMath Tier 4 | 18.80% | 27.10% | 38.00% |
| Humanity's Last Exam(ツールなし) | — | 39.80% | — |
| BrowseComp | 65.80% | 82.70% | 89.30% |
| OSWorld-Verified | 47.30% | 75.00% | — |
ARC-AGI-2では、すべてのベンチマークの中で最大の伸びが見られ、標準モデルは52.9%から73.3%に、Proは83.3%に向上しました。このテストは、これまで言語モデルにとって難しい課題だった抽象的なパターン認識能力を測定します。
注目すべき低下も1つあります。GPT-5.4のHealthBenchスコアはGPT-5.2をわずかに下回り、62.6%対63.3%となりました。OpenAIはこの点を軽視せず、システムカードで公表しています。これは注目に値します。
GPT-5.4 Thinkingは現在、Plus、Team、Proのサブスクライバー向けに順次提供されており、デフォルトモデルとしてGPT-5.2 Thinkingに置き換わります。GPT-5.2 Thinkingは、2026年6月5日までLegacyセクションで引き続き利用できます。無料ユーザーは自動ルーティングによってGPT-5.4を利用する場合がありますが、手動で選択することはできません。
API料金をバージョン間で比較すると、以下のようになります:
| モデル | 入力(100万トークンあたり) | 出力(100万トークンあたり) |
| gpt-5.2 | $1.75 | $14.00 |
| gpt-5.4 | $2.50 | $15.00 |
| gpt-5.2 Pro | $21.00 | $168.00 |
| gpt-5.4 Pro | $30.00 | $180.00 |
これらの数値について、いくつか知っておくべき点があります:
BatchおよびFlex処理は半額で利用できます
優先処理は標準料金の2倍です
1回のセッションで272Kトークンを超えるリクエストには、そのセッション全体について入力が2倍、出力が1.5倍の料金が適用されます
リージョン別データレジデンシー処理には10%が加算されます
GPT-5.4 Proは標準版の12倍の価格です。ただし、ベンチマークからは両者の強みが異なることが分かります。標準版はGDPvalで実際にはわずかに高いスコア(83.0%対82.0%)を記録した一方、Pro版は深いウェブ調査や複雑なエージェントタスクで優れています。
GPT-5.4はGPT-5.3-Codexのプログラミング能力を継承しながら、長時間にわたる複数ステップのコーディングセッションで作業を維持する能力を向上させています。
実際のGitHub課題を基にしたベンチマークであるSWE-Bench Proでは、GPT-5.4が57.7%、GPT-5.2が55.6%でした。コマンドライン操作をテストするTerminal-Bench 2.0では、GPT-5.4が75.1%を記録しました(GPT-5.3-Codexはこの特定のテストで77.3%とわずかに高く、注目すべき小幅な低下となっています)。
Codexの新機能として、/fastモードが追加されました。基盤モデルを変更せずに、トークン生成速度を最大1.5倍に高められます。また、実験的なPlaywright Interactiveモードもあり、Codexがライブブラウザウィンドウを起動し、Webアプリやデスクトップアプリを作成しながらリアルタイムの視覚テストを行えます。
CodexやClaude Codeなどのツールを通じてコーディングプロジェクトにGPT-5.4を利用したい場合、GPT Protoは直接API統合に対応し、OpenAIの定価と比べて大幅な割引を提供しています。
OpenAIは、GDPvalと呼ぶテストでGPT-5.4を評価しました。これは、米国の9つの主要経済分野における44の職種で、実際の業務をシミュレートするために設計された社内ベンチマークです。タスクには、スプレッドシートの作成、プレゼンテーションの作成、スケジュール管理、グラフ作成などが含まれます。

GPT-5.4はGDPvalで83.0%を記録しました。GPT-5.2は70.9%でした。これは、専門家が実際の職場で行う業務に近いタスクで12ポイント向上したことを意味します。
OpenAIは、オフィスの生産性タスクについて追加のテストを実施しました:
投資銀行の分析業務を再現するよう設計されたスプレッドシートモデリングテストで、GPT-5.4は87.3%を記録し、GPT-5.2の68.4%に対して19ポイント向上しました。
プレゼンテーションを盲検比較したところ、人間の評価者は68%の割合でGPT-5.4の出力を好みました。画像の使い方が優れ、視覚的なレイアウトもより多様であることが理由として挙げられています。
このモデルと同時にChatGPT for Excelプラグインもリリースされ、CodexとAPIではスプレッドシートおよびプレゼンテーション生成用のスキルパッケージが更新されました。

GPT-5.4は現在、OpenAIで最も事実に基づいた正確なモデルです。過去に実際のユーザーが誤りを含むと報告したプロンプト群を使ったところ、GPT-5.4が個々の誤った主張を生成する頻度はGPT-5.2より33%低く、少なくとも1つの誤りを含む完全な回答の頻度は18%低いことがOpenAIによって確認されました。
これは今回のリリースにおける最大の追加機能の1つです。GPT-5.4は、スクリーンショットを通じて実際のデスクトップ環境をどの程度操作できるかを測定するベンチマーク、OSWorld-Verifiedで75.0%を記録しました。同じテストにおける人間の基準値は72.4%です。GPT-5.4はこのタスクで人間レベルの性能を超えました。

開発者はこの機能を2つの方法で利用できます:
スクリーンショットベースの操作 — モデルがスクリーンショットを受け取り、マウス座標とキーボードコマンドを出力してインターフェースを操作します
コードによるブラウザ自動化 — モデルがPlaywrightスクリプトを作成してブラウザをプログラムで制御します。フォーム入力、データ入力、Webテストなどに便利です
この機能は、組み込みのcomputerツールを使用して標準APIから直接利用できます。特別なモデルルーティングは必要ありません。また、モデルが重要度の高い操作を行う前に人間の承認を必須にする確認ポリシーも設定できます。
エージェントワークフローや自動化ツールを構築するチームにとって、GPT Protoのようなプラットフォームを使えば、競争力のある料金で統合APIを通じてGPT-5.4のComputer Use機能に簡単にアクセスできます。
GPT-5.4では、大規模なツールライブラリをよりスマートに扱えるようになりました。これまでは、利用可能なすべてのツールの完全な定義をAPI呼び出しごとに含める必要があり、多数のツールを設定している場合はコストが高くなっていました。現在、モデルは検索方式を使用します。利用可能なツールの短いリストを確認し、実際に使う必要があるツールの完全な定義だけを取得します。
この変更だけで、MCP Atlasベンチマークのツール集約型タスクにおけるトークン使用量が、精度を低下させることなく47%削減されました。GPT-5.4はこのベンチマークで67.2%を記録し、GPT-5.2の60.6%から向上しています。
Web調査と複数ページからの情報取得をテストするBrowseCompでは、GPT-5.4が82.7%、Pro版が89.3%を記録し、いずれもGPT-5.2の65.8%を大きく上回りました。
GPT-5.4のWeb検索・調査機能は、GPT ProtoのWeb検索インターフェースから直接試すことができます。また、ファイルベースのクエリにも対応したGPT Protoのファイル分析ページも利用できます。
OpenAIの直接API料金が高いと感じる場合、特に大量利用を行うチームや本番アプリケーションを構築する場合には、GPT Proto AI API Platformが実用的な選択肢となります。GPT Protoは、GPT-5.4を含む主要モデルへのアクセスを割引料金でまとめて提供する統合AI APIプラットフォームで、通常はGPTモデルを市場価格より30〜40%低い料金で利用できます。

プロバイダーごとに個別のAPIキーを管理する代わりに、開発者はGPT Protoに一度接続するだけで、単一の標準化されたAPIエンドポイントを通じてGPT-5.4と数百の他のモデルにアクセスできます。プラットフォームはインテリジェントルーティングと自動フェイルオーバーを使用するため、プロバイダーに障害が発生してもリクエストは中断なく別の経路へリダイレクトされます。
GPT ProtoはGPT-5.4のマルチモーダル機能にも対応しています。GPT Protoの画像テキスト変換ページでは、画像からテキストへの処理を試すことができます。文書分析、高解像度スクリーンショット処理、視覚理解が重要となるComputer Useワークフローに特に役立ちます。
複数のAIツールをすでに使い分けている個人やチーム、または現在のプロバイダーの料金や信頼性が予測しにくいと感じている方にとって、GPT Protoはロックインや長期契約なしでGPT-5.4を活用できる、安定した費用対効果の高い方法を提供します。
GPT-5.4は、GPT-5.2のアップグレードとしてリリースされたOpenAIの最新モデルです。主な違いは、GPT-5.4がネイティブのComputer Use機能(スクリーンショットを通じてデスクトップソフトウェアを操作する能力)を備えていること、ほとんどの専門・推論ベンチマークでより高いスコアを記録していること、そしてコーディング、推論、視覚操作をそれぞれ別のツールに分けるのではなく、1つのモデルに統合していることです。
モデルがコンピューター画面のスクリーンショットを確認し、マウスクリックやキーボード入力を送信してソフトウェアを操作できるようになります。Webブラウザ、デスクトップアプリケーション、フォームベースのワークフローで利用できます。開発者は、別の専門モデルを必要とせず、標準APIを通じてこの機能を利用できます。
標準のGPT-5.4モデルは、入力100万トークンあたり$2.50、出力100万トークンあたり$15.00です。GPT-5.4 Proは、入力100万トークンあたり$30.00、出力100万トークンあたり$180.00と大幅に高額です。GPT Protoのようなプラットフォームでは、統合APIを通じてGPT-5.4を割引料金で利用できます。
GPT-5.4 Thinkingは、ChatGPT Plus、Team、Proのサブスクライバーが利用できます。EnterpriseおよびEducationユーザーは、管理者が有効化できます。無料ユーザーは自動ルーティングを通じてモデルを利用する場合がありますが、手動で選択することはできません。GPT-5.4 ProはProおよびEnterpriseアカウントに限定されています。
GPT-5.4は、特に1つのワークフローで推論、コーディング、ソフトウェア操作を行えるモデルを必要とする人にとって、大きなアップグレードです。OSWorldでComputer Use機能が人間の基準値を超えたことは、真に重要なマイルストーンです。スプレッドシート処理、コード生成、長大なコンテキストの処理における改善は、実用的で十分に裏付けられています。
料金はGPT-5.2より高くなっていますが、ほとんどの専門的な用途では性能向上がコストを正当化します。モデルへのアクセスを維持しながらコストを管理したい場合、GPT ProtoはGPT-5.4エコシステムへのより手頃な入口として検討する価値があります。

はじめに 2026年2月26日、Google DeepMindはひっそりとNano Banana 2をリリースしました — そしてAIコミュニティはすぐにその存在に気づきました。リリースから数時間以内に、Arenaのテキスト画像変換ランキングでGPT-image-1とNano Banana Proの両方を上回り、スコア1,279で首位に立ちました。正式な技術名称は Gemini 3.1 Flash Image (Gemini 3.1 Flash Image Previewとも呼ばれます)。 大規模に高速かつ高品質な画像生成を必要とする開発者、デザイナー、コンテンツ制作者にとって、Nano Banana 2は、しばらく問われ続けてきた疑問に答えを出します。Proレベルの速度制限やコストなしに、Proレベルの画質を得られるのか。答えは、どうやら「はい」です。
Tiffany Layne | 2026-03-05

要約 Seedance 2.0は、ネイティブ音声付きの映画のような映像を生成する、ByteDanceの強力な新しいAI動画モデルです。そのリリースを受け、著作権上の懸念からDisneyをはじめとするハリウッドの映画会社が使用停止要求書を送りました。開発者は現在、GPT Protoなどのプラットフォームを通じて以前のSeedanceバージョンにアクセスでき、Seedance 2.0 APIへの対応も近日中に予定されています。
Tiffany Layne | 2026-02-26

AI動画の新たなスタンダード ByteDanceは、 Seedance 2.0 のリリースにより、生成メディアの世界を一新しました。従来モデルの能力をはるかに超え、映画のような15秒の動画、ネイティブ2K解像度、複雑なマルチモーダル入力を実現したこのモデルには、クリエイターや開発者がアクセスを求めて殺到しています。複雑な格闘シーンの絵コンテを作りたい映像制作者にも、GPT Proto経由で堅牢な Seedance 2.0 APIソリューションを求める開発者にも、このガイドでは業界の新たな強者について知っておくべきことをすべて解説します。
Tiffany Layne | 2026-02-25