1M Token 多模態上下文
可在單一請求中處理文字、圖片、影片、音訊和 PDF。1,048,576 個 Token 的輸入視窗可支援大型程式碼庫、長篇報告、會議錄製,以及多檔案分析,不需將所有內容縮減為簡短摘錄。
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.7-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
| 場景 | Google 牌價 | OpenRouter | GPTProto | 每月節省 |
|---|---|---|---|---|
| Personal10M tokens / 月(4.8M 快取) | $20.52 | $21.65 | $12.31 | −$8.21≈ $98.50 / 年 |
| Team100M tokens / 月(48M 快取) | $205.20 | $216.49 | $123.12 | −$82.08≈ $984.96 / 年 |
| Business500M tokens / 月(240M 快取) | $1026.00 | $1082.43 | $615.60 | −$410.40≈ $4924.80 / 年 |
透過 GPTProto 執行 Google 最新的 Flash 模型,支援多模態輸入、1,048,576 個 Token 的上下文視窗、可設定的推理強度,以及與 OpenAI 相容的呼叫,適用於程式開發、工具使用、結構化輸出與長文件工作流程。
1M Token 多模態上下文
可在單一請求中處理文字、圖片、影片、音訊和 PDF。1,048,576 個 Token 的輸入視窗可支援大型程式碼庫、長篇報告、會議錄製,以及多檔案分析,不需將所有內容縮減為簡短摘錄。
程式開發與 UI 實作
以螢幕截圖或設計參考資料作為上下文,生成、偵錯並重構程式碼。根據 Google 公布的評測結果,Gemini 3.7 Flash 與 Gemini 3.6 Flash 相比,在初次生成的程式碼準確度與設計遵循度上都有所提升。
Agent 工具與結構化輸出
在所選 API 路由支援這些功能的情況下,可使用函式呼叫、結構化輸出、程式碼執行、檔案搜尋、URL 上下文和搜尋 grounding。因此,此模型非常適合需要檢查資訊、執行操作,並回傳驗證後資料的多步驟 Agent。
低、中或高推理
選擇「低」可加快例行工作,「中」可在程式開發與 Agent 之間取得平衡,「高」則適合困難的推理和工具使用。Gemini 3.7 Flash 不支援最低思考等級。
Gemini 3.7 Flash API 讓開發者可透過程式化方式存取 Google 最新正式推出的 Flash 模型。此模型於 2026 年 8 月 13 日發布,專為軟體工程、網頁開發、多模態文件處理,以及需要比前一版 Flash 更強之指令遵循與更可靠工具使用的多步驟代理(multi-step agents)而設計。
Gemini 3.7 Flash 接受文字、圖片、影片、音訊和 PDF 輸入,但僅回傳文字。因此適合用於理解產品截圖、檢視錄製的工作流程、從報告中擷取證據,或在儲存庫中進行推理。它不是原生影像、影片或音訊生成模型。
在 GPTProto 上,開發者無需為每個供應商分別維持餘額即可使用此模型。同一個金鑰可將請求路由至 200+ 個受支援模型,方便比較 Gemini 與其他替代方案,或在不必另外開啟供應商帳戶的情況下加入備援。即時定價面板是 Gemini 3.7 Flash API 目前定價及所顯示 40% 折扣的權威依據。
| 規格 | Gemini 3.7 Flash |
|---|---|
| 供應商 | |
| 發布狀態 | 正式推出(GA) |
| 發布日期 | 2026 年 8 月 13 日 |
| 官方模型 ID | gemini-3.7-flash |
| 輸入模態 | 文字、圖片、影片、音訊和 PDF |
| 輸出模態 | 文字 |
| 輸入 Token 上限 | 1,048,576 個 Token |
| 最大輸出 | 65,536 個 Token |
| 思考等級 | low、medium(預設)、high |
| 支援的上游功能 | 快取、函式呼叫、結構化輸出、程式碼執行、檔案搜尋、URL 上下文、搜尋與 Maps Grounding、Computer Use(預覽) |
| 上游不支援 | minimal思考、原生影像生成、音訊生成和 Live API |
| 上游使用選項 | Standard、Batch、Flex 和 Priority |
Gemini 3.7 Flash API 最適合需要結合多個步驟、而非要求單一簡短答案的工作負載。在程式開發方面,它可以檢視儲存庫上下文、追蹤跨檔案的議題、提出最小修補程式,並解釋變更內容。在前端工作方面,可將截圖或設計參考一併放入請求,讓模型比較預期版面與實際實作。
對於代理(agent)工作流程,模型可以決定何時呼叫函式、解讀工具結果,並回傳符合 JSON schema 的回應。實際應用包括支援工單分類、文件轉資料庫擷取、合規審查、內部研究與工作流程自動化。開發者可以針對時間敏感的分類任務降低推理等級,或在困難的除錯與規劃任務中提高推理等級。
其多模態輸入也對知識工作很有用。單一工作流程即可結合 PDF、圖表、截圖、會議錄影與書面指示。由於輸出仍是文字,若最終交付物必須是圖片、影片或音訊檔案,請使用專門的生成模型。
Gemini 3.7 Flash 維持與 Gemini 3.6 Flash 相同的 1,048,576 個 Token 輸入上限、65,536 個 Token 輸出上限,以及廣泛的輸入模態。升級的原因不是更大的上下文視窗,而是在程式開發、網頁開發、文件理解、指令遵循和代理執行方面的改進。
Google 的發布評測報告了下列變更。這些是供應商回報的基準測試結果,並非獨立的 GPTProto 測試。
| 評測 | Gemini 3.7 Flash | Gemini 3.6 Flash | 回報的變更 |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2 個百分點 |
| DeepSWE v1.1 | 65.3% | 49.0% | +16.3 個百分點 |
| WebDev Arena | 1588 Elo | 1538 Elo | +50 Elo |
| GDP.pdf | 34.0% | 22.0% | +12.0 個百分點 |
| AutomationBench | 30.4% | 17.0% | +13.4 個百分點 |
有一個相容性取捨:Gemini 3.6 Flash 接受 minimal、low、medium 和 high 思考等級,而 3.7 僅支援 low、medium 和 high。如果現有工作流程依賴接近零思考來處理簡單、高量請求,請在遷移所有流量前,先將 3.6 保留在 A/B 測試中,或將其與 Flash-Lite 模型進行比較。
變更模型名稱只是第一步。在現有應用程式中取代 Gemini 3.6 Flash、Gemini 3.5 Flash、Gemini 3 Flash Preview 或 Gemini 3.1 Pro 之前,請先使用以下檢查清單:
請使用 GPTProto 文件中顯示的確切模型字串。Google 的官方穩定 ID 為 gemini-3.7-flash;發布或部署前,請確認 GPTProto 路由使用相同的字串。
請勿傳送 thinking_level: "minimal"。Google 將 medium 記載為預設值,並在選取 minimal 時回傳驗證錯誤。
針對原生 Gemini Interactions API 遷移,請移除已棄用的 temperature、top_p、top_k 和 candidate_count 設定,將 thinking_budget 取代為 thinking_level,並移除預先填入的模型回合。
請精確掌握多模態的預期:圖片、音訊、影片和 PDF 都是輸入格式,而回應是文字。
請勿假設所有上游 Google 工具都可透過 OpenAI 相容路由自動使用。請查閱 GPTProto 即時 API 文件,了解支援的參數、工具、檔案處理與回應欄位。
在遷移所有請求之前,請使用你自己的程式開發任務、schema、工具呼叫、延遲目標和 Token 預算執行 Canary 測試。
這份遷移指南是基本模型列表與實用 Gemini 3.7 Flash API 存取頁面之間的主要差異:它告訴開發者,即使新模型 ID 正確,哪些既有請求仍可能失敗。
當工作負載需要長上下文視窗、多種輸入格式、更強的首輪程式開發,或以比大型旗艦模型更低的 Token 價格進行多步驟工具編排時,請選擇 Gemini 3.7 Flash。當 minimal 思考很重要,或現有應用程式尚未通過回歸測試時,請繼續使用 Gemini 3.6 Flash。
在 Grok 4.6 與 Gemini 3.7 Flash 之間做選擇,考量更為具體。Gemini 接受音訊、影片和 PDF 輸入,並提供超過 Grok 兩倍的上下文視窗。Grok 4.6 新增 xhigh 推理選項,且 SpaceXAI 並未記載固定的文字輸出上限。兩者並非全面優劣之分,因此在選定預設模型前,請先讓代表性任務分別通過兩者進行測試。
| 決策因素 | Gemini 3.7 Flash | Gemini 3.6 Flash | Grok 4.6 |
|---|---|---|---|
| 最佳適用情境 | 程式開發、設計遵循、多模態文件、多步驟代理 | 既有 Flash 工作流程與 minimal 思考流量 | 需要 xhigh 推理或極長文字輸出的程式開發與代理 |
| 上下文視窗 | 1,048,576 個 Token | 1,048,576 個 Token | 500,000 個 Token |
| 原生輸入 | 文字、圖片、影片、音訊、PDF | 文字、圖片、影片、音訊、PDF | 文字、圖片 |
| 文字輸出上限 | 65,536 個 Token | 65,536 個 Token | SpaceXAI 未記載固定上限 |
| 推理控制 | Low、medium、high | Minimal、low、medium、high | Low、medium、high、xhigh |
| 官方短上下文 Token 價格* | $0.75 輸入 / $3.75 輸出,至 2026 年 12 月 31 日止 | $0.75 輸入 / $3.75 輸出,至 2026 年 12 月 31 日止 | 200K 以下輸入 Token:$2 輸入 / $6 輸出 |
*官方供應商定價僅供模型選擇參考。透過 GPTProto 計費的費率,請使用 GPTProto 的即時定價面板。