Gemini 3.5 Flash-Liteは、高ボリュームのエージェントタスク、翻訳、ドキュメント処理、分類、構造化抽出向けにGoogleが一般提供する効率性重視のモデルです。2026年7月21日にリリースされ、Gemini 3.5シリーズで最速のモデルであり、最大限の推論深度よりもレイテンシー、スループット、APIコストが厳しい制約となるアプリケーション向けに位置付けられています。
Google Gemini 3.5 Flash-Lite APIは、1,048,576トークンの入力ウィンドウで、テキスト、画像、動画、音声、PDFファイルを受け付けます。最大65,536トークンのテキストレスポンスを生成し、GoogleのネイティブAPIで、思考、構造化出力、関数呼び出し、キャッシュ、コード実行、ファイル検索、URLコンテキスト、検索グラウンディングをサポートします。画像や音声の生成には対応しておらず、Live APIもサポートしていません。OpenAI互換ゲートウェイ経由では、プロバイダー固有のツールの利用可否が異なる場合があるため、Googleネイティブの拡張機能を利用する前にGPTProtoのドキュメントを確認してください。
| 仕様 | Gemini 3.5 Flash-Lite |
| プロバイダー | |
| 安定版モデルID | gemini-3.5-flash-lite |
| リリース段階 | 一般提供 |
| リリース日 | 2026年7月21日 |
| 入力上限 | 1,048,576トークン |
| 最大出力 | 65,536トークン |
| 対応入力 | テキスト、画像、動画、音声、PDF |
| 出力 | テキスト |
| 中核機能 | 思考、構造化出力、関数呼び出し、キャッシュ |
| 非対応 | 画像生成、音声生成、Live API、チューニング |
Gemini 3.5 Flash-Liteの最適な用途
Flash-Liteは、アプリケーションが対象を絞ったタスクを大量に繰り返す場合に最も役立ちます。より高性能なオーケストレーターの下で低コストのワーカーモデルとして機能させたり、判断範囲が狭く検証しやすいワークフロー全体を処理させたりできます。
-
分類とルーティング: サポートチケットへのラベル付け、意図の検出、ドキュメントの割り当て、次に使用するツールの選択を行い、すべてのリクエストで最先端モデルを利用するコストを抑えられます。
-
ドキュメント解析とJSON抽出: PDF、請求書、領収書、レポート、商品情報を読み取り、定義済みのスキーマに一致するフィールドを返します。
-
翻訳と要約: 多言語テキスト、会議の議事録、レビュー、カタログコンテンツの大量キューを処理します。単価が総運用費に影響する場合に適しています。
-
マルチモーダルレビュー: 画像、録音音声、動画、PDFからテキストと事実情報を抽出し、下流のワークフローではテキストベースの出力を維持します。
-
専門サブエージェント: 検索、取得、コード編集、検証、ツール呼び出しを専門ワーカーに委任し、計画や最終レビューにはより強力なモデルを確保します。
このモデルは、1つの難しいリクエストで最高水準のコーディング精度、長期的な計画、またはツールエラーからの繰り返しの復旧が必要な場合には、あまり適していません。そのようなワークロードでは、トークン価格だけで判断する前に、同じ評価セットを使ってGemini 3.5 FlashまたはGemini 3.6 Flashをテストしてください。
タスクの複雑さに応じて思考レベルを選択
Gemini 3.5 Flash-Liteは、GoogleのネイティブAPIで設定可能な思考機能をサポートしています。Googleは、レイテンシーが重視される分類、ルーティング、JSON抽出にはMINIMALを推奨しています。この設定がデフォルトであり、予測しやすいタスクで不要な推論トークンを制限します。
コードの作成、ターミナルコマンドの実行、複数のAPIの呼び出し、中間エラーからの復旧が必要なサブエージェントには、MEDIUMまたはHIGHを使用してください。思考を増やすと複数ステップの実行が改善される場合がありますが、出力トークンの使用量と応答時間も増加します。GPTProtoのOpenAI互換エンドポイント経由でモデルを呼び出す場合は、プロバイダー固有のフィールドを送信する前に、マッピングされた思考パラメータについて最新のドキュメントを確認してください。
Gemini 3.5 Flash-LiteとGemini 3.5 Flashの比較
Gemini 3.5 Flash-LiteとGemini 3.5 Flashは、1,048,576トークンのコンテキストウィンドウと65,536トークンの最大出力を共有していますが、異なるワークロードのコスト構造を想定して設計されています。Flash-Liteはスループットと低い単価を優先し、Flashはより複雑なコーディング、エージェント計画、知識集約型の作業を対象としています。
| 比較 | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| 最適な用途 | 大量処理のサブエージェント、抽出、翻訳、ドキュメント解析 | 複雑なコーディング、エージェント計画、より深い知識集約型作業 |
| モデルの位置付け | 3.5シリーズで最速かつ最低コストのモデル | より高性能なFlashティアモデル |
| 入力コンテキスト | 1,048,576トークン | 1,048,576トークン |
| 最大出力 | 65,536トークン | 65,536トークン |
| Google標準入力価格 | $0.30 / 100万トークン | $1.50 / 100万トークン |
| Google標準出力価格 | $2.50 / 100万トークン | $9.00 / 100万トークン |
| GPTProto Flash-Lite価格 | 入力$0.18 / 出力$1.50(100万トークンあたり) | Gemini 3.5 Flashモデルページを参照 |
Googleの標準料金では、Flash-Liteの入力料金はGemini 3.5 Flashより80%安く、出力料金は約72%安くなります。リクエスト量と応答時間が、時折発生するリトライのコストを上回る場合に選択してください。より難しいタスクの数が少なく、最低トークン単価よりも初回の品質が重要な場合は、Flashを選択してください。
GPTProto経由でGemini 3.5 Flash-Liteを利用する
GPTProto では、200を超える200モデルに使用するものと同じアカウント、APIキー、残高でGemini 3.5 Flash-Lite APIにアクセスできます。これにより、アプリケーションが単純な抽出をFlash-Liteに、複雑な推論をGemini 3.5 FlashまたはGemini 3.6 Flashに、メディア処理を別の画像・動画・音声モデルにルーティングする際の、アカウントと請求の分断を軽減できます。
既存のOpenAI互換アプリケーションでは、周辺のクライアント構造を維持し、GPTProtoのドキュメントに記載されたエンドポイント、認証方式、モデル文字列を使用してください。すべてのGoogleネイティブフィールドが1対1で対応すると想定しないでください。本番トラフィックを移行する前に、思考制御、キャッシュ、グラウンディング、ファイル処理、ツールスキーマ、ストリーミング動作をテストしてください。
既存のGeminiワークロードからの移行に関する注意事項
Googleは、古いGeminiモデルからの移行に影響する可能性がある、いくつかの互換性上の違いを文書化しています。カスタムのtemperature、top-K、top-Pの値は無視される場合があります。カスタムの頻度ペナルティと存在ペナルティを指定すると、エラーが返される可能性があります。最終ターンの会話でmodelロールを持つリクエストもサポートされていません。
大量処理のワークフローを切り替える前に、代表的なテストセットを再実行し、JSONスキーマへの準拠、ツール呼び出しの完了、トークン使用量、レイテンシー、リトライ頻度を確認してください。費用対効果の高いGemini 3.5 Flash-Lite APIのデプロイメントは、トークンあたりのコストだけでなく、成功したタスクあたりのコストで評価すべきです。これは、思考レベルが低すぎるとツールシーケンスが早期に停止する可能性があるマルチステップエージェントで特に重要です。











