如果你只讀一段:對大多數工作而言,選擇 **Nano Banana 2**(Gemini 3.1 Flash Image)。它每張圖片的成本只有 Nano Banana Pro 的一半,在一般使用情境下執行速度更快,而且在獨立的 Artificial Analysis Image Arena 上,目前得分*高於* Pro — 而不是更低。當工作需要印刷解析度、大量文字排版,或複雜的多元素構圖,而你寧可多付費也不想反覆重試時,再選擇 **Nano Banana Pro**(Gemini 3 Pro Image)。決策就是這麼簡單。接下來的內容是我展示實際依據的部分,因為這些名稱實在混亂,而大多數比較都把品質排名弄反了。
我是在看著三個不同團隊因為下意識選擇「Pro 那個」,認為名字叫*Pro*的模型一定在所有方面都會勝出後,寫下這篇文章的。但事實並非如此。Google 為不同工作打造了這兩個模型,而較便宜的那個已悄悄追上了。
Nano Banana Pro 與 Nano Banana 2:2026 年該使用哪個 Gemini 圖像模型?
Nano Banana 2 的成本只有 Nano Banana Pro 的一半,且在 Image Arena 上得分更高。了解每個 Gemini 圖像模型各自勝出的情境,以及使用單一 API 執行兩者的程式碼。

首先,先釐清名稱
Google 在大約六個月內推出了三個圖像模型,還給它們取了彼此重疊的暱稱。以下是直接整理自 Google 官方開發者文件的清楚對照:
- Nano Banana =
gemini-2.5-flash-image— 最初的模型,於 2025 年 8 月推出。 - Nano Banana Pro =
gemini-3-pro-image-preview— 建立於 Gemini 3 Pro,於 2025 年 11 月 20 日推出。 - Nano Banana 2 =
gemini-3.1-flash-image-preview— 建立於 Gemini 3.1 Flash,於 2026 年 2 月推出。
所以,「Pro」和「2」並不是同一項升級的兩種名稱。Pro 是高推理能力的高階方案;「2」則是較新的 Flash 模型,將 Pro 的大部分品質帶到 Flash 的速度與價格。如果某篇教學把「Nano Banana Pro」和「Nano Banana 2」視為可互換,請停止閱讀 — 作者根本不知道自己叫的是哪個模型。
在 GPT Proto 上,它們使用清楚的模型 ID:gemini-3-pro-image-preview、gemini-3.1-flash-image-preview,以及最初的 gemini-2.5-flash-image。
並列比較:規格與價格
| Nano Banana 2(3.1 Flash Image) | Nano Banana Pro(3 Pro Image) | |
|---|---|---|
| 基於 | Gemini 3.1 Flash | Gemini 3 Pro |
| 定位 | 速度、大量使用 | 專業資產製作 |
| 輸出尺寸 | 0.5K、1K、2K、4K | 1K、2K、4K |
| 最多參考圖片數 | 14 | 14 |
| 最多物件圖片數 | 10 | 6 |
| 最多肖像(臉部)圖片數 | 4 | 5 |
| 額外超寬/超高比例(1:4、4:1、1:8、8:1) | 是 | 否 |
| Google 圖像搜尋 grounding | 是 | 否 |
| Google 列表價格(1K 圖片) | $0.067 | $0.134 |
| GPT Proto 價格(1K 圖片) | $0.0402 | $0.0804 |
價格差距是這項比較中最明確的事實。Google 對 3.1 Flash 的圖像輸出收取每百萬 token 60 美元,對 3 Pro 則收取 120 美元 — 正好是 2 倍。這個比例在所有解析度都成立:在 Google API 上,1K-2K 約為 $0.067 對 $0.134;在極端情況下則為 $0.045 對 $0.24(Flash 0.5K 對 Pro 4K)。在 GPT Proto 上,加上服務費後仍維持相同的 2:1 比例:依目前費率,Nano Banana 2 為 $0.0402,Pro 為 $0.0804,而最初的 Nano Banana 更便宜,只要 $0.0234。(這些是 GPT Proto 目前 1K 圖片的促銷費率,並會隨解析度提高;請查看即時模型頁面,以確認你閱讀當天適用的數字。)
重點是:從 Pro 切換到 Nano Banana 2,不是讓帳單降低幾個百分點,而是將每張圖片的成本減半。每天處理 10,000 張圖片時,這是完全不同的預算項目,而不是四捨五入的差異。
品質:中立競技場實際說了什麼
這正是直覺容易誤導的地方。想知道「哪個看起來更好」時,誠實的來源不是供應商部落格 — 而是 Artificial Analysis 的 Image Arena。它根據數百萬次人類盲測投票,以 Elo 為模型排名。截至 2026 年 4 月下旬,Nano Banana 2 在文字生成圖像排行榜上的 Elo 約為 1254,比 Nano Banana Pro 高一個檔次。在圖像編輯排行榜上也是相同順序:Nano Banana 2 為 1249,Pro 則以 1247 緊隨其後。
這點值得仔細思考。較便宜、速度更快的 Flash 模型,在中立且由投票驅動的基準測試中,評分高於高階模型。事情並非一直如此。Nano Banana Pro 於 2025 年 11 月推出時,曾在文字生成圖像和圖像編輯競技場中都排名第一 — 短暫成為當時測得最好的圖像模型。接著 Nano Banana 2 推出、GPT Image 2 推出,排行榜便重新洗牌。因此,準確的說法不是「Flash 永遠勝過 Pro」,而是:Pro 推出時位居榜首,競爭環境持續變化,而到了 2026 年春季,較便宜的兄弟模型在整體人類偏好上已追平甚至超越。
我的看法是 — 我會特別標明這是判斷,而不是基準測試結果 — 差距小到對大多數提示詞而言,你無法可靠地分辨哪個模型生成了哪張圖片。社群測試者不斷以不同措辭說出同一件事:輸出幾乎難以區分,而在密集、空間關係複雜的場景中,Flash 模型有時能更 妥善地處理版面。Elo 分數每週都會變動,因此應將確切數字視為快照,而不是固定值。重要的是方向,而方向顯示:不要因為假設 Pro 只是更銳利,就付出兩倍價格。
實際速度與成本(以及沒人提到的部分)
Nano Banana 2 的宣傳說法是「Flash 的速度、Pro 的品質」,而在一般使用情境下確實如此。社群測量顯示,它每張標準圖片約需 4-8 秒,而 Pro 約需 10-20 秒。當你要在 50 次迭代中調整提示詞時,這代表從四分鐘的循環縮短到十二分鐘的循環。對批次處理流程而言,差距會快速累積。但我不會告訴你速度優勢是百分之百保證的,因為事實並非如此。Google 的
js-genai GitHub 儲存庫中,有一個 2026 年 5 月的公開問題:某位開發者測得 gemini-3.1-flash-image-preview 在 Node 中對最小的 1K 請求回應得比 gemini-3-pro-image-preview 更慢 — 與名稱所暗示的情況完全相反。預覽模型的延遲取決於路由、預熱與容量,而目前這兩個都是預覽模型。因此,平均而言速度更快,是;每次呼叫都更快,不是。如果延遲對你的產品至關重要,請在承諾採用前,先以自己的流量進行測量。這正是行銷頁面會略過的提醒。
各自真正勝出的地方
這部分打破了「Pro 只是更好」的說法,因為功能差異是雙向的。
Nano Banana 2 不只是更便宜 — 它還能做出幾件 Pro 做不到的事。它提供 0.5K(512px)輸出尺寸,適合製作低成本縮圖與預覽。它支援 Pro 沒有提供的超寬與超高長寬比(1:4、4:1、1:8、8:1),這對橫幅、側欄和垂直媒體條很重要。它最多可接受 10 張物件參考圖片,而 Pro 只有 6 張。此外,它具備 Google Image Search grounding,因此能在生成時擷取即時視覺參考,更準確地呈現特定地標、品牌物件或近期的現實世界主體。如果你的工作涉及時事或小眾的現實世界主體,這項 grounding 就是真正的優勢。
Nano Banana Pro 的高階價值集中在更狹窄的範圍。它會為每張圖片分配更多推理資源,在最終渲染前最多生成兩次中間「思考」階段,以改善構圖與邏輯 — 這會體現在包含許多物件、嚴格空間關係和分層光線的提示詞中,帶來更乾淨的配置。它比 Nano Banana 2 多處理一張肖像(臉部)參考圖,五張對四張;對必須讓每個人都維持角色一致性的團體照而言,這很重要。而根據 Google 自己的人類評估與社群共識,Pro 在最困難的文字排版上仍略勝一籌:長篇多行段落、精細字距,以及包裝級文字,因為一個變形的字母就可能讓整個資產報廢。
簡單說:Nano Banana 2 是更廣泛、更靈活的工具。Pro 則是當失敗成本高於模型成本時,你會找上的專家。
範例輸出
這三張圖片都是在 GPT Proto playground 中生成的,使用的就是你透過 API 呼叫時會使用的同一個平台,因此你可以看到它們各自的特性,而不必只相信我的說法。
Nano Banana 2(gemini-3.1-flash-image-preview):一張時尚海報,乾淨、大尺寸的文字正確呈現 — Flash 現在已足以勝任這類文字與版面工作。

Nano Banana Pro(gemini-3-pro-image-preview):一張 8K 風格的特寫,肌膚紋理、髮絲和水面光影細節展現了高階推理能力的優勢。

最初的 Nano Banana(gemini-2.5-flash-image):以三者中最低的價格,依然能勝任風格化、插畫風格的場景。
如果你要大量生成、快速迭代、打造使用者端工具(此時延遲和每張圖片的成本會累積)、使用不尋常的長寬比,或渲染受益於網路 grounding 準確度的主體,請預設選擇
Nano Banana 2。對 2026 年絕大多數的生產級圖像工作而言,這是正確的起點 — 而且你的帳單會是 Pro 收費的一半。
當交付成果需要印刷解析度或大尺寸格式、文字排版至關重要(包裝、海報、密集資訊圖表),且一個錯誤字元就必須重做;當構圖真的很複雜,包含許多受嚴格空間限制的主體;或當你需要團體照中第五張符合角色設定的臉孔時,請升級到Nano Banana Pro。我會寫在牆上的規則是:當圖片品質失誤的成本高於模型本身的成本時,選擇 Pro;當速度、迭代和大量使用的成本高於最後幾個百分點的保真度時,留在 Nano Banana 2。
此外,對於風格化、插畫風格或低風險的工作,也請記得最初的Nano Banana(2.5 Flash Image):它的價格只要 $0.0234,如果你完全不需要 Gemini 3 的推理能力,便能以最低成本勝出。
如何使用一個 GPT Proto 金鑰呼叫兩者你不必只選定一個模型的原因,是 GPT Proto 讓兩者共用相同的金鑰與端點格式 — 只要替換一個字串即可切換。這裡有個細節容易讓人困惑:統一的
/api/v3/ 端點會在 Authorization 標頭中接收你的原始 API 金鑰,且不需要 Bearer 前綴。(相容 OpenAI 的介面才會使用 Bearer;不要混用。)
請求預設採非同步方式:你提交請求後會收到一個 id 和一個已準備好的結果 URL,接著輪詢該 URL。或者將 enable_sync_mode 設為 true,以等待圖片直接回傳。
import requests, time
API_KEY = "YOUR_GPTPROTO_API_KEY" # raw key, no "Bearer"
BASE = "https://gptproto.com/api/v3"
def generate(model, prompt, size="1K", aspect_ratio="1:1"):
submit = requests.post(
f"{BASE}/google/{model}/text-to-image",
headers={"Authorization": API_KEY, "Content-Type": "application/json"},
json={
"prompt": prompt,
"size": size,
"aspect_ratio": aspect_ratio,
"output_format": "png",
"enable_sync_mode": False,
},
)
submit.raise_for_status()
poll_url = submit.json()["data"]["urls"]["get"] # already embeds the prediction id
while True:
data = requests.get(poll_url, headers={"Authorization": API_KEY}).json()["data"]
if data["status"] == "completed":
return data["outputs"]
if data["status"] == "failed" or data.get("error"):
raise RuntimeError(data.get("error"))
time.sleep(2)
# Same key, same call — switch models by changing one string.
flash = generate("gemini-3.1-flash-image-preview", "a neon ramen stall in the rain, cinematic")
pro = generate("gemini-3-pro-image-preview", "product packaging mockup with a legible 12-word tagline")
print(flash, pro)
提交步驟的 cURL 等效寫法:
curl --location 'https://gptproto.com/api/v3/google/gemini-3.1-flash-image-preview/text-to-image' \
--header 'Authorization: YOUR_GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "a neon ramen stall in the rain, cinematic",
"size": "1K",
"aspect_ratio": "1:1",
"output_format": "png",
"enable_sync_mode": false
}'
# The response carries data.id and data.urls.get — call that GET URL to fetch the result:
# curl "https://gptproto.com/api/v3/predictions/<id>/result" \
# --header 'Authorization: YOUR_GPTPROTO_API_KEY'
若要切換至 Pro,將 gemini-3.1-flash-image-preview 改為 gemini-3-pro-image-preview,其他部分完全不變。這就是透過單一平台運行兩個模型的實際優勢:你可以針對自己的提示詞,讓較便宜的模型與高階模型進行 A/B 測試,並讓結果 — 而不是名稱 — 做出決定。請在 Nano Banana 2 和 Nano Banana Pro 模型頁面取得金鑰及目前的每張圖片費率。
常見問題
Nano Banana 2 和 Nano Banana Pro 是同一個模型嗎?
哪一個比較好?
Nano Banana 2 便宜多少?
Nano Banana 2 有哪些 Pro 做不到的事?
相關文章
更多部落格
GPT-4o 與 GPT-4:2026 完整比較指南(1 月更新)
重點摘要 GPT-4 已於 2025 年 4 月 30 日正式從 ChatGPT 退役,並由 GPT-4o 完全取代(「o」代表「全方位」)。雖然仍可透過 API 使用 GPT-4,但 GPT-4o 提供更優異的多模態能力、低 50% 的成本,以及更快的處理速度。對大多數使用者與開發者而言,GPT-4o 憑藉對文字、影像和音訊在單一神經網路中原生處理的支援,是明確的首選。
Schuyler Stacy | 2026-02-03

Gemini 3 影像生成器:AI 藝術的未來
重點摘要: 人工智慧領域正迅速從新奇實驗轉向專業應用。隨著創作者要求更高的影像保真度與更深入的情境理解,備受期待的 Gemini 3 影像生成器 將有望重新定義整個產業。這個新一代模型預計能解決 AI 長期存在的挑戰,提供超寫實視覺效果、完美的文字排版,以及直覺式的多模態協作。透過建立在前代模型穩健架構之上,Gemini 3 影像生成器很可能改變我們進行數位設計、行銷與內容創作的方式,讓每個人都能接觸進階藝術創作。
Michael Johnson | 2026-03-02

使用 Gemini 2.5 Flash Image 即時建立與編輯圖片
重點摘要 Gemini 2.5 Flash Image,暱稱為「nano-banana」,是 Google 最新、顛覆性的 AI 圖像工具。它不僅能從零開始建立圖片,還能以驚人的理解力編輯現有圖片。透過深度的「視覺推理」能力,這項工具支援對話式編輯,克服過往 AI 模型在角色一致性方面的挑戰,讓複雜的照片編輯變得人人都能輕鬆上手。
Tiffany Layne | 2026-02-03

Seedance 2.0 指南:運用進階多模態 AI 控制功能改造您的影片內容
重點摘要 Seedance 2.0 已正式推出,成為生成式影片領域的一項重大升級,導入先進的多模態輸入功能,讓使用者能結合圖片、影片與音訊,實現精準的創意控制。此版本消除了高端電影製作的傳統門檻,提供動作複製、影片延伸與無縫編輯等功能。透過將這些工作流程與 GPTProto 等具成本效益的解決方案整合,創作者現在能以前所未有的效率與技術精緻度,製作出具備工作室品質的廣告與敘事影片。
Tiffany Layne | 2026-03-12
