原生圖片理解能力
可連同文字指令一起送出螢幕截圖、圖表、介面草圖或其他圖片。模型會回傳文字,並能在決定下一個要呼叫的工具時,運用視覺上的發現。
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'聊天、程式開發代理與文件處理。以每 1M Token 計價 — 輸入、快取輸入與輸出分開計費。
| 場景 | DeepSeek 牌價 | OpenRouter | GPTProto | 每月節省 |
|---|---|---|---|---|
| Personal10M tokens / 月(4.8M 快取) | $3.39 | $3.58 | $3.39 | −$0.00≈ $0.00 / 年 |
| Team100M tokens / 月(48M 快取) | $33.89 | $35.75 | $33.89 | −$0.00≈ $0.00 / 年 |
| Business500M tokens / 月(240M 快取) | $169.44 | $178.76 | $169.44 | −$0.00≈ $0.00 / 年 |
運用 DeepSeek V4 Flash Vision Exp API,在同一個工作流程中結合圖片、文字、推理與工具呼叫。模型能檢視螢幕截圖、讀取畫面上的文字、解讀圖表,並在處理程式碼或多步驟任務時運用視覺證據。它保留了 V4 Flash 的文字能力,同時加入了原生的圖片輸入。
原生圖片理解能力
可連同文字指令一起送出螢幕截圖、圖表、介面草圖或其他圖片。模型會回傳文字,並能在決定下一個要呼叫的工具時,運用視覺上的發現。
1M 脈絡與 384K 輸出
把大型儲存庫、冗長的對話、工具結果與視覺證據都放進同一次請求中。文件記載的模型上限為 1M token 脈絡窗口,以及最高 384K 輸出 token。
三種 API 格式
DeepSeek 文件記載這個視覺模型支援 Chat Completions、Messages 與 Responses,讓你更容易串接既有的代理框架,不必重新設計整個請求流程。
可預期的圖片 token 用量
圖片會被轉換成輸入 token,並與文字一併計費。DeepSeek 將每張圖片的上限設為 384 個 token,有助於團隊估算重複截圖與多圖工作流程的成本。
DeepSeek V4 Flash Vision Exp 是 V4 Flash 模型的實驗性多模態版本,於 2026 年 8 月 21 日透過 DeepSeek API 發布。它接受文字與圖片輸入,並產生文字輸出。DeepSeek 表示,它在純文字代理、推理與世界知識方面的能力可與標準版 V4 Flash 相提並論,同時回報在需要視覺理解的代理基準測試上有大幅進步。
主要的差異並不只是圖片描述而已。一個由工具驅動的代理,可以從瀏覽器或測試工具取得螢幕截圖,找出版面或內容的問題,修改檔案,再次請求新的截圖,並重新評估結果。這讓該模型在前端程式設計、視覺回歸分診、圖表分析、文件影像審查,以及關鍵證據無法以純文字取得的工作流程中,都相當實用。
| 規格 | DeepSeek V4 Flash Vision Exp |
|---|---|
| 供應商 | DeepSeek |
| 發布狀態 | 實驗性 API 模型,2026 年 8 月 21 日發布 |
| 官方模型 ID | deepseek-v4-flash-vision-exp |
| 輸入 / 輸出 | 文字與圖片 / 文字 |
| 脈絡窗口 | 1M token |
| 最大輸出 | 384K token |
| 思考模式 | 思考與非思考模式;文件記載預設為思考模式 |
| API 格式 | Chat Completions、Messages 與 Responses |
| 圖片傳遞方式 | 外部網址、base64 資料網址,或 DeepSeek 官方 API 的 Files API |
| 支援的圖片格式 | JPEG、PNG、GIF、WebP |
| 圖片 token 用量 | 每張圖片最多 384 個輸入 token |
| 工具呼叫與 JSON 輸出 | 支援 |
| FIM 補全 | 視覺模型不支援 |
| 開放權重狀態 | 截至 2026 年 8 月 25 日,尚未發布獨立的官方 Vision Exp 權重 |
以螢幕截圖驅動的前端程式設計:給代理目標設計稿、目前的瀏覽器渲染結果與編輯工具。它能找出肉眼可見的差異、修補實作,並檢視下一張截圖。視覺檢查應作為 DOM 檢查與自動化測試的補充,而不是取代它們。
視覺錯誤分診:把錯誤截圖與記錄檔及相關的原始檔結合在一起。模型能將使用者看到的畫面,與程式碼庫中的文字證據連結起來,進而提出範圍明確的修正,或呼叫診斷工具。
圖表與儀表板分析:請模型解讀趨勢、標籤與肉眼可見的異常。擷取出的數字仍須與底層資料集核對,因為視覺判讀無法取代結構化的資料存取。
簡報與多圖審查:在代理草擬或檢查簡報時,把頁面圖片當作參考;或是以一致的評量標準,批次處理大量截圖。在依賴自動核准之前,請先測試小字級文字、密集表格與細微的視覺細節。
擷取證據:由瀏覽器、測試工具或使用者,連同任務與相關的文字脈絡一併提供螢幕截圖。
檢視與規畫:模型辨識出可見的元素,與需求進行比對,並選擇下一個要使用的程式碼、瀏覽器或分析工具。
修改與驗證:代理編輯檔案或設定,執行確定性的檢查,並擷取新的渲染畫面。
再次比對:模型檢視新的圖片,只有在視覺結果與非視覺的驗收檢查彼此一致時,才繼續往下走。
模型並不會因為支援圖片,就自動取得瀏覽器的控制權。你的應用程式仍然需要提供工具、權限、逾時設定與驗收標準。模型存取只是其中一層;外層的代理框架才掌管執行與安全。
DeepSeek 目前的官方 schema 接受 JPEG、PNG、GIF 與 WebP。在 Responses 格式中,detail: low 會將圖片降取樣為 512 × 512,而 high、original 與 auto 則保留原始圖片。供應商文件記載每次請求最多 600 張圖片,內嵌圖片上限為 32 MiB,透過 file_id 參照的圖片則為 64 MiB。
在 Responses 格式中,圖片可放在 user 或 developer 訊息,以及工具呼叫的輸出中;放在 system 或 assistant 訊息中的圖片會回傳錯誤。在把批次工作流程搬進正式環境之前,請以 GPTProto 線上的「API 使用方式」範例為準,確認支援的請求形式與任何閘道特有的限制。
| 決策因素 | Vision Exp | V4 Flash |
|---|---|---|
| 發布狀態 | 實驗性多模態端點 | 穩定的文字模型 |
| 原生輸入 | 文字與圖片 | 僅文字 |
| 文字能力 | DeepSeek 定位為與 V4 Flash 相當 | V4 Flash 的基準能力 |
| 仰賴視覺的代理 | 設計上可運用螢幕截圖、圖表與工具回傳的圖片 | 會忽略或無法直接處理原生圖片內容 |
| 脈絡 / 最大輸出 | 1M / 384K | 1M / 384K |
| 圖片 token 計費 | 每張圖片最多 384 個輸入 token | 不適用 |
| FIM 補全 | 不支援 | 在非思考模式下支援 |
| 最適合 | 視覺程式設計、UI 檢查、圖表分析、多模態工具迴圈 | 純文字程式設計、記錄檔、結構化擷取,以及大量的代理子任務 |
當圖片中帶有代理採取行動所需的資訊時,就選擇 Vision Exp。當工作負載完全是文字、穩定端點比視覺輸入更重要,或應用程式已經把圖片轉換成經過驗證的結構化資料時,請選擇DeepSeek V4 Flash。DeepSeek 公布的比較指出,兩個版本在文字任務上表現相當,因此沒有理由把每一個純文字請求都導向這個實驗性模型。
當代理迴圈中反覆出現螢幕截圖或視覺素材時,就選擇它:前端實作、以瀏覽器為基礎的 QA、圖表審查、簡報產生,或是可見狀態至關重要的客服案件。它的 1M 脈絡與 384K 輸出,也很適合長時間的儲存庫工作階段。
當圖片無關緊要時,請使用穩定的純文字模型。對於風險較高的多模態程式設計,請用相同的任務,將 Vision Exp 與GPT-5.6 Sol、Claude Opus 5、Kimi K3進行比較。DeepSeek 並未提供與這三個模型對等的公開結果。在決定預設路由之前,請先衡量任務完成率、重試次數、無效的工具呼叫、視覺準確度、延遲,以及每一個被接受結果的成本。