Gemini 3.6 Flash API 讓開發者能以程式方式存取 Google’的正式發布 Flash 模型,適用於編碼代理、多模態分析、長上下文知識工作,以及工具驅動的自動化。Google 於 2026 年 7 月 21 日發布穩定版 gemini-3.6-flash 模型。不同於較早的 gemini-3-flash-preview,這是供應用程式持續使用的穩定模型 ID。
Gemini 3.6 Flash 接受文字、圖片、影片、音訊和 PDF 檔案,但只會回傳文字。其 1,048,576 個 token 的輸入視窗可容納大型程式碼庫、長篇文件集合或延伸媒體輸入,而 65,536 個 token 的輸出上限則支援詳細報告、程式碼和結構化回應。Google 列出的底層模型功能包括快取、結構化輸出、函式呼叫、程式碼執行、檔案搜尋、URL 內容、Search grounding、Maps grounding,以及可設定的思考功能。
功能界線相當重要。Gemini 3.6 Flash 不會生成圖片或音訊,也不支援 Live API。電腦操作目前以預覽功能提供,而非完全穩定的能力。當整合依賴 Google 原生工具時,請在遷移前確認 GPTProto 相容層是否公開該工具。如果產品需要語音轉語音互動、原生圖片生成,或桌面自動化的嚴格穩定性,請將該部分工作負載導向其他模型。
| 規格 | Gemini 3.6 Flash |
|---|---|
| 供應商 | |
| 狀態 | 正式發布 |
| 穩定模型 ID | gemini-3.6-flash |
| 輸入類型 | 文字、圖片、影片、音訊、PDF |
| 輸出類型 | 文字 |
| 輸入 token 上限 | 1,048,576 |
| 輸出 token 上限 | 65,536 |
| 思考層級 | minimal、low、medium、high |
| 預設思考層級 | medium |
| Google 列出的工具 | 函式呼叫、程式碼執行、檔案搜尋、Search、Maps、URL 內容 |
| 電腦操作 | 預覽版支援 |
| 不支援 | 圖片生成、音訊生成、Live API |
Gemini 3.6 Flash 最適合的使用情境
Gemini 3.6 Flash 最適合需要大型工作上下文和反覆工具呼叫的任務。對於每個簡短提示,它不一定都是最便宜的選擇;其預設的 medium 思考層級在簡單分類上可能比非推理模型消耗更多 token。請根據實際工作內容,匹配思考層級和模型路由。
| 工作負載 | 適用原因 | 實作備註 |
|---|---|---|
| 程式碼庫編碼代理 | 在 Google’的測試中,比 Gemini 3.5 Flash 產生較少不必要的修改和執行迴圈 | 使用 medium 或 high 思考層級,並透過測試驗證變更 |
| 多模態文件分析 | 在同一個請求中讀取 PDF、圖片、圖表、音訊和影片 | 當下游系統需要穩定欄位時,要求結構化輸出 |
| 長上下文研究 | 100 萬個輸入 token 和支援的上下文快取 | 快取重複使用的語料庫,而不是重新傳送未變更的檔案 |
| 瀏覽器或桌面自動化 | 原生電腦操作工具,以及在 Google’的評估中獲得 83.0% 的 OSWorld-Verified 成績 | 將電腦操作視為預覽功能,並為具重大影響的行動保留核准關卡 |
| 具 grounding 能力的助理 | 底層模型支援 Search、Maps、檔案搜尋和 URL 內容 | 只啟用每個請求所需的工具,並追蹤因此產生的 token 使用量 |
Gemini 3.6 Flash 與 Gemini 3.5 Flash 比較
Gemini 3.6 Flash 是 Gemini 3.5 Flash 的直接效率升級,而非更大上下文的替代品。兩個模型都維持相同的 1M 上下文級別和 medium 預設思考層級。差異在於任務效率:Google 報告指出,在 Artificial Analysis 工作負載中,輸出 token 減少 17%,推理回合和工具呼叫更少,並且在程式碼、機器學習工程、電腦操作和長上下文檢索方面有更強的成果。
官方輸入價格仍為每 1M token 1.50 美元,而官方輸出價格則從 9.00 美元降至 7.50 美元。在 GPTProto 上,Gemini 3.6 Flash 每 1M 個輸入 token 的費用為 0.90 美元,每 1M 個輸出 token 的費用為 4.50 美元;Gemini 3.5 Flash 目前則為 0.90 美元和 5.40 美元。對於新的代理型或多模態系統,3.6 Flash 是更好的預設選擇。只有在你已驗證 3.5 Flash 的行為,且需要時間進行遷移回歸測試時,才保留 3.5 Flash。
| 指標 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 上下文視窗 | 1,048,576 | 1,048,576 |
| 最大輸出 | 65,536 | 65,536 |
| 預設思考 | Medium | Medium |
| Google 每 1M 個 token 的標準輸入/輸出價格 | $1.50 / $7.50 | $1.50 / $9.00 |
| GPTProto 每 1M 個 token 的輸入/輸出價格 | $0.90 / $4.50 | $0.90 / $5.40 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDM-MRCR v2(1M) | 54.0% | 26.6% |
以上基準測試數據由供應商提供。請使用這些數據選擇候選模型,然後在將正式流量移轉前,使用你自己的提示、工具和成功標準對兩個模型進行測試。
遷移前需確認的 API 變更
如果應用程式使用 Google’的原生 Interactions API,請勿將遷移至 3.6 Flash 視為只需替換模型名稱。Google 為最新模型變更了數個生成和對話欄位:
- 將模型 ID 變更為
gemini-3.6-flash。 - 從生成設定中移除
temperature、top_p和top_k。 - 將
thinking_budget替換為thinking_level;支援的值為minimal、low、medium和high。 - 移除
candidate_count,Gemini 3.x 不支援此欄位。 - 不要傳送預先填入的模型回合。對於多回合 Interactions API 工作階段,請使用伺服器端的
previous_interaction_id。 - 在切換所有流量前,對工具結構描述、結構化輸出和檔案處理進行回歸測試。
如果使用 GPTProto’s OpenAI 相容請求格式,請遵循本頁的 Quick Start 和 GPTProto 文件,而不要直接複製 Google 原生欄位。實際優勢在於,使用一組 GPTProto API 金鑰和餘額,也能呼叫 Gemini 3.5 Flash、GPT-5.6 Luna、Claude Opus 4.8、Kimi K3,以及 200+ 個其他模型,因此你可以在不開設獨立供應商帳戶的情況下,使用同一組評估資料集。







