Gemini 3.5 Flash-Lite 是 Google’ 針對高流量代理任務、翻譯、文件處理、分類和結構化擷取推出的正式商用效率模型。它於 2026 年 7 月 21 日發布,是 Gemini 3.5 系列中速度最快的模型,定位適用於延遲、吞吐量和 API 成本比最高推理深度更受限制的應用程式。
Google Gemini 3.5 Flash-Lite API 可在 1,048,576 個 token 的輸入視窗內接受文字、圖片、影片、音訊和 PDF 檔案。它可產生最多 65,536 個 token 的文字回應,並在 Google’ 的原生 API 中支援思考、結構化輸出、函式呼叫、快取、程式碼執行、檔案搜尋、URL 內容和搜尋 grounding。它不會產生圖片或音訊,也不支援 Live API。透過 OpenAI 相容閘道使用時,供應商特定工具的可用性可能有所不同,因此在依賴 Google 原生擴充功能前,請先查閱 GPTProto 文件。
| 規格 | Gemini 3.5 Flash-Lite |
| 供應商 | |
| 穩定模型 ID | gemini-3.5-flash-lite |
| 發布階段 | 正式商用 |
| 發布日期 | 2026 年 7 月 21 日 |
| 輸入限制 | 1,048,576 個 token |
| 最大輸出 | 65,536 個 token |
| 接受的輸入 | 文字、圖片、影片、音訊、PDF |
| 輸出 | 文字 |
| 核心功能 | 思考、結構化輸出、函式呼叫、快取 |
| 不支援 | 圖片生成、音訊生成、Live API、調校 |
Gemini 3.5 Flash-Lite 的最佳用途
當應用程式以高流量重複執行聚焦任務時,Flash-Lite 最能發揮效用。它可以作為功能更強大的協調器底下的低成本工作模型,也可以處理決策範圍狹窄且容易驗證的完整工作流程。
-
分類與路由:為支援工單加上標籤、偵測意圖、指派文件,或選擇下一個工具,無需每次請求都支付前沿模型的成本。
-
文件解析與 JSON 擷取:讀取 PDF、發票、收據、報告和產品記錄,然後回傳符合既定結構描述的欄位。
-
翻譯與摘要:處理大量多語言文字、會議逐字稿、評論或目錄內容,適用於單位成本會影響整體營運支出的情境。
-
多模態審查:從圖片、錄音、影片和 PDF 中擷取文字與事實,同時讓輸出維持在文字型下游工作流程中。
-
聚焦型子代理:將搜尋、擷取、程式碼編輯、驗證和工具呼叫委派給專門工作模型,同時保留更強大的模型負責規劃或最終審查。
當單一困難請求需要最高程度的程式碼準確性、長期規劃,或從工具錯誤中反覆復原時,這個模型就不太適合。對於這類工作負載,請先使用相同的評估資料集測試 Gemini 3.5 Flash 或 Gemini 3.6 Flash,再決定是否只依據 token 價格進行選擇。
依任務複雜度選擇思考層級
Gemini 3.5 Flash-Lite 在 Google’ 的原生 API 中支援可設定的思考功能。Google 建議對延遲敏感的分類、路由和 JSON 擷取使用 MINIMAL。這是預設設定,可限制可預測任務中不必要的推理 token。
對於需要撰寫程式碼、執行終端機命令、呼叫多個 API 或從中間錯誤中復原的子代理,請使用 MEDIUM 或 HIGH。更多思考可以改善多步驟執行,但也會增加輸出 token 用量和回應時間。如果透過 GPTProto’ 的 OpenAI 相容端點呼叫模型,請在傳送供應商特定欄位前,查閱目前文件以確認對應的思考參數。
Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash
Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash 共用 1,048,576 個 token 的上下文視窗和 65,536 個 token 的最大輸出,但兩者針對不同的工作負載經濟性而設計。Flash-Lite 優先考量吞吐量和低單位成本;Flash 則針對更複雜的程式碼開發、代理規劃和知識工作。
| 比較 | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| 最適合 | 高流量子代理、擷取、翻譯、文件解析 | 複雜程式碼開發、代理規劃、更深入的知識工作 |
| 模型定位 | 3.5 系列中速度最快、成本最低的模型 | 功能更強大的 Flash 系列模型 |
| 輸入上下文 | 1,048,576 個 token | 1,048,576 個 token |
| 最大輸出 | 65,536 個 token | 65,536 個 token |
| Google 標準輸入價格 | $0.30/每 1M token | $1.50/每 1M token |
| Google 標準輸出價格 | $2.50/每 1M token | $9.00/每 1M token |
| GPTProto Flash-Lite 價格 | 每 1M token 的輸入 $0.18/輸出 $1.50 | 請參閱 Gemini 3.5 Flash 模型頁面 |
按照 Google’ 的標準費率,Flash-Lite 的輸入成本比 Gemini 3.5 Flash 低 80%,輸出成本低約 72%。當請求量和回應時間比偶爾重試的成本更重要時,請選擇 Flash-Lite。當少量較困難的任務使首次執行品質比最低 token 費率更重要時,請選擇 Flash。
透過 GPTProto 使用 Gemini 3.5 Flash-Lite
GPTProto 透過同一個帳戶、API 金鑰和餘額提供 Gemini 3.5 Flash-Lite API 存取權,這些資源也可用於超過 200 個模型。當應用程式將簡單擷取路由至 Flash-Lite、複雜推理路由至 Gemini 3.5 Flash 或 Gemini 3.6 Flash,並將媒體工作路由至獨立的圖片、影片或音訊模型時,這可減少帳戶和計費的分散情況。
對於現有的 OpenAI 相容應用程式,請保留周邊的用戶端結構,並使用 GPTProto 文件中所示的端點、驗證方法和模型字串。不要假設每個 Google 原生欄位都能一對一對應。將正式環境流量遷移前,請先測試思考控制、快取、grounding、檔案處理、工具結構描述和串流行為。
現有 Gemini 工作負載的遷移注意事項
Google 記錄了幾項可能影響從舊版 Gemini 模型遷移的相容性差異。自訂的 temperature、top-K 和 top-P 值可能會被忽略。自訂的頻率和存在懲罰可能會導致錯誤。最終對話回合具有 model 角色的請求同樣不受支援。
在切換高流量工作流程前,請重播具代表性的測試集,並檢查 JSON 結構描述相容性、工具呼叫完成情況、token 用量、延遲和重試頻率。具成本效益的 Gemini 3.5 Flash-Lite API 部署,應以每項成功任務的成本評估,而不只是每個 token 的成本。這對多步驟代理尤其重要,因為過低的思考設定可能會使工具序列過早停止。











