100万トークンのコンテキストウィンドウ
最大1,048,576個の入力トークンを処理し、最大65,536個の出力トークンを生成できます。この容量により、大規模なドキュメントセット、長時間の文字起こし、レポート、リポジトリ、詳細なサブエージェント間の引き継ぎに対応できます。
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
Google · ≈ 148M tokens/mo (48M cached)
OpenRouter costs include its ~5.5% credit purchase fee. GPTProto applies a per-model discount (10–30% off) and your bonus credits are also spent at discounted rates — savings compound. Estimates assume a 60% cache hit rate.
Googleの最速かつ最もコスト効率に優れたGemini 3.5モデルにGPTProtoでアクセスできます。料金は入力100万トークンあたり$0.18、出力100万トークンあたり$1.50で、Googleの標準API料金より40%低く設定されています。GPTProtoのキー1つで、テキスト、画像、動画、音声の200以上のモデルを利用し、残高を一元管理できます。
最大1,048,576個の入力トークンを処理し、最大65,536個の出力トークンを生成できます。この容量により、大規模なドキュメントセット、長時間の文字起こし、レポート、リポジトリ、詳細なサブエージェント間の引き継ぎに対応できます。
Artificial Analysisのテストに基づくと、Googleは毎秒およそ350個の出力トークンを報告しています。Flash-Liteは、最大限の推論の深さよりもスループットと応答時間が重視されるワークロード向けに設計されています。
テキスト、画像、動画、音声、PDFファイルを送信できます。モデルはテキストを返すため、ドキュメント解析、メディア理解、文字起こし分析、要約、マルチモーダルデータ抽出に適しています。
スキーマで制約された出力と関数呼び出しを、抽出、ルーティング、ツールベースのエージェントに活用できます。デプロイ前に、コード実行、ファイル検索、URLコンテキスト、検索グラウンディングがルートごとに利用可能か確認してください。
Gemini 3.5 Flash-Liteは、高ボリュームのエージェントタスク、翻訳、ドキュメント処理、分類、構造化抽出向けにGoogleが一般提供する効率性重視のモデルです。2026年7月21日にリリースされ、Gemini 3.5シリーズで最速のモデルであり、最大限の推論深度よりもレイテンシー、スループット、APIコストが厳しい制約となるアプリケーション向けに位置付けられています。
Google Gemini 3.5 Flash-Lite APIは、1,048,576トークンの入力ウィンドウで、テキスト、画像、動画、音声、PDFファイルを受け付けます。最大65,536トークンのテキストレスポンスを生成し、GoogleのネイティブAPIで、思考、構造化出力、関数呼び出し、キャッシュ、コード実行、ファイル検索、URLコンテキスト、検索グラウンディングをサポートします。画像や音声の生成には対応しておらず、Live APIもサポートしていません。OpenAI互換ゲートウェイ経由では、プロバイダー固有のツールの利用可否が異なる場合があるため、Googleネイティブの拡張機能を利用する前にGPTProtoのドキュメントを確認してください。
| 仕様 | Gemini 3.5 Flash-Lite |
| プロバイダー | |
| 安定版モデルID | gemini-3.5-flash-lite |
| リリース段階 | 一般提供 |
| リリース日 | 2026年7月21日 |
| 入力上限 | 1,048,576トークン |
| 最大出力 | 65,536トークン |
| 対応入力 | テキスト、画像、動画、音声、PDF |
| 出力 | テキスト |
| 中核機能 | 思考、構造化出力、関数呼び出し、キャッシュ |
| 非対応 | 画像生成、音声生成、Live API、チューニング |
Flash-Liteは、アプリケーションが対象を絞ったタスクを大量に繰り返す場合に最も役立ちます。より高性能なオーケストレーターの下で低コストのワーカーモデルとして機能させたり、判断範囲が狭く検証しやすいワークフロー全体を処理させたりできます。
分類とルーティング: サポートチケットへのラベル付け、意図の検出、ドキュメントの割り当て、次に使用するツールの選択を行い、すべてのリクエストで最先端モデルを利用するコストを抑えられます。
ドキュメント解析とJSON抽出: PDF、請求書、領収書、レポート、商品情報を読み取り、定義済みのスキーマに一致するフィールドを返します。
翻訳と要約: 多言語テキスト、会議の議事録、レビュー、カタログコンテンツの大量キューを処理します。単価が総運用費に影響する場合に適しています。
マルチモーダルレビュー: 画像、録音音声、動画、PDFからテキストと事実情報を抽出し、下流のワークフローではテキストベースの出力を維持します。
専門サブエージェント: 検索、取得、コード編集、検証、ツール呼び出しを専門ワーカーに委任し、計画や最終レビューにはより強力なモデルを確保します。
このモデルは、1つの難しいリクエストで最高水準のコーディング精度、長期的な計画、またはツールエラーからの繰り返しの復旧が必要な場合には、あまり適していません。そのようなワークロードでは、トークン価格だけで判断する前に、同じ評価セットを使ってGemini 3.5 FlashまたはGemini 3.6 Flashをテストしてください。
Gemini 3.5 Flash-Liteは、GoogleのネイティブAPIで設定可能な思考機能をサポートしています。Googleは、レイテンシーが重視される分類、ルーティング、JSON抽出にはMINIMALを推奨しています。この設定がデフォルトであり、予測しやすいタスクで不要な推論トークンを制限します。
コードの作成、ターミナルコマンドの実行、複数のAPIの呼び出し、中間エラーからの復旧が必要なサブエージェントには、MEDIUMまたはHIGHを使用してください。思考を増やすと複数ステップの実行が改善される場合がありますが、出力トークンの使用量と応答時間も増加します。GPTProtoのOpenAI互換エンドポイント経由でモデルを呼び出す場合は、プロバイダー固有のフィールドを送信する前に、マッピングされた思考パラメータについて最新のドキュメントを確認してください。
Gemini 3.5 Flash-LiteとGemini 3.5 Flashは、1,048,576トークンのコンテキストウィンドウと65,536トークンの最大出力を共有していますが、異なるワークロードのコスト構造を想定して設計されています。Flash-Liteはスループットと低い単価を優先し、Flashはより複雑なコーディング、エージェント計画、知識集約型の作業を対象としています。
| 比較 | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| 最適な用途 | 大量処理のサブエージェント、抽出、翻訳、ドキュメント解析 | 複雑なコーディング、エージェント計画、より深い知識集約型作業 |
| モデルの位置付け | 3.5シリーズで最速かつ最低コストのモデル | より高性能なFlashティアモデル |
| 入力コンテキスト | 1,048,576トークン | 1,048,576トークン |
| 最大出力 | 65,536トークン | 65,536トークン |
| Google標準入力価格 | $0.30 / 100万トークン | $1.50 / 100万トークン |
| Google標準出力価格 | $2.50 / 100万トークン | $9.00 / 100万トークン |
| GPTProto Flash-Lite価格 | 入力$0.18 / 出力$1.50(100万トークンあたり) | Gemini 3.5 Flashモデルページを参照 |
Googleの標準料金では、Flash-Liteの入力料金はGemini 3.5 Flashより80%安く、出力料金は約72%安くなります。リクエスト量と応答時間が、時折発生するリトライのコストを上回る場合に選択してください。より難しいタスクの数が少なく、最低トークン単価よりも初回の品質が重要な場合は、Flashを選択してください。
GPTProto では、200を超える200モデルに使用するものと同じアカウント、APIキー、残高でGemini 3.5 Flash-Lite APIにアクセスできます。これにより、アプリケーションが単純な抽出をFlash-Liteに、複雑な推論をGemini 3.5 FlashまたはGemini 3.6 Flashに、メディア処理を別の画像・動画・音声モデルにルーティングする際の、アカウントと請求の分断を軽減できます。
既存のOpenAI互換アプリケーションでは、周辺のクライアント構造を維持し、GPTProtoのドキュメントに記載されたエンドポイント、認証方式、モデル文字列を使用してください。すべてのGoogleネイティブフィールドが1対1で対応すると想定しないでください。本番トラフィックを移行する前に、思考制御、キャッシュ、グラウンディング、ファイル処理、ツールスキーマ、ストリーミング動作をテストしてください。
Googleは、古いGeminiモデルからの移行に影響する可能性がある、いくつかの互換性上の違いを文書化しています。カスタムのtemperature、top-K、top-Pの値は無視される場合があります。カスタムの頻度ペナルティと存在ペナルティを指定すると、エラーが返される可能性があります。最終ターンの会話でmodelロールを持つリクエストもサポートされていません。
大量処理のワークフローを切り替える前に、代表的なテストセットを再実行し、JSONスキーマへの準拠、ツール呼び出しの完了、トークン使用量、レイテンシー、リトライ頻度を確認してください。費用対効果の高いGemini 3.5 Flash-Lite APIのデプロイメントは、トークンあたりのコストだけでなく、成功したタスクあたりのコストで評価すべきです。これは、思考レベルが低すぎるとツールシーケンスが早期に停止する可能性があるマルチステップエージェントで特に重要です。
このモデルに関連するガイド、比較、最新情報。
すべての記事
安全性の制限に悩まされていませんか?創造性を取り戻せる、最適な制限なしAI画像生成ツールを見つけましょう。人気ツールを比較して、今すぐ作成を始められます。

Gemini 3.6 FlashとGemini 3.5 Flash-Liteの料金、速度、ベンチマーク、用途を比較します。新しいGoogleモデルのどちらがあなたのAIワークロードに適しているかを確認しましょう。

コーディング、APIアクセス、コンテキスト、料金、オープンウェイトの観点からQwen 3.8 MaxとGLM 5.2を比較します。2026年の本番環境に適した、より安全なモデルを確認しましょう。

Kimi K3はオープンソースなのでしょうか?そして本当にGPT-5.6やFable 5に近いのでしょうか?100万トークンのコンテキスト、API料金、独立系ベンチマーク、Redditでの反応を詳しく見ていきます。