500K 文字與視覺上下文
在 500,000 個 token 的上下文視窗內傳送程式碼、文件、對話記錄和圖像。使用此模型進行儲存庫分析、以截圖為基礎的除錯,以及需要保留大量工作上下文的研究任務。
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
Grok · ≈ 148M tokens/mo(48M 快取)
OpenRouter 成本含約 5.5% 儲值手續費。GPTProto 在官方價上另有模型折扣(10–30% off),贈送額度也按折扣價消耗——節省會疊加。預估假設 60% 快取命中率。
透過 GPTProto 使用 Grok 4.6,適用於多步驟軟體工程、工具驅動的代理程式、視覺化除錯和知識工作。此模型結合 500,000 個 token 的上下文視窗、文字與圖像輸入、結構化輸出、函式呼叫,以及四個可設定的推理等級。
在 500,000 個 token 的上下文視窗內傳送程式碼、文件、對話記錄和圖像。使用此模型進行儲存庫分析、以截圖為基礎的除錯,以及需要保留大量工作上下文的研究任務。
Grok 4.6 專為多步驟編碼和知識工作流程而訓練。SpaceXAI 回報,在更長的代理程式軌跡中,其自我測試、驗證和任務持續性均優於 Grok 4.5。
透過 GPTProto 文件記載的端點,使用熟悉的 Responses API 或 Chat Completions 請求格式。透過函式呼叫連結應用程式工具,並透過結構化輸出回傳可預期的資料。
選擇 low、medium、high 或 xhigh 的推理強度。預設為 high,推理無法停用;更深的設定會以額外的延遲和 token 來換取解決更困難問題的能力。
Grok 4.6 是 SpaceXAI(前身為 xAI)於 2026 年 8 月 12 日發布的文字輸出推理模型。它在 Grok 4.5 的基礎上增加了針對長時間執行代理、軟體工程、技術研究、互動式應用程式開發、電腦輔助設計與更廣泛知識工作的額外訓練。
該模型接受文字與圖片輸入。開發者可以在單一請求中結合原始碼、文件、螢幕截圖、圖表、圖形與書面指示。圖片支援旨在提供視覺理解;Grok 4.6 不會直接取代用於影像或影片生成的獨立 Grok Imagine 模型。
其 500,000 個 token 的上下文視窗適合大型儲存庫、長時間對話、多文件研究,以及必須保留大量任務歷史的代理。SpaceXAI 沒有發布獨立的最大文字輸出上限,但請求仍受模型的總上下文與 API 操作限制約束。
Grok 4.6 也支援函式呼叫與結構化輸出。開發者可以將它連接到資料庫、內部 API、搜尋系統、程式碼執行環境及其他應用程式工具,然後要求它回傳符合定義架構的 JSON。
| 規格 | Grok 4.6 |
|---|---|
| 供應商 | SpaceXAI / xAI |
| 發布日期 | 2026 年 8 月 12 日 |
| 供應商模型名稱 | grok-4.6 |
| 輸入模態 | 文字與圖片 |
| 輸出模態 | 文字 |
| 上下文視窗 | 500,000 個 token |
| 已發布的文字輸出上限 | 未發布獨立上限 |
| 知識截止日期 | 2026 年 2 月 1 日 |
| 推理強度 | low、medium、high(預設)或 xhigh |
| 推理行為 | 一律啟用 |
| API 格式 | Responses API 與 Chat Completions |
| 核心能力 | 函式呼叫、結構化輸出與推理 |
| 最適合用於 | 程式碼代理、視覺化應用程式工作、研究與多步驟知識任務 |
在 SpaceXAI 發布的評測中,Grok 4.6 High 在 Artificial Analysis Intelligence Index 上獲得 61 分,而 Grok 4.5 High 為 56 分。它在 DeepSWE v1.1 上也從 54% 提升至 65.9%,在 APEX-Agents 上從 47.1% 提升至 57.5%。這些結果顯示代理型工作有明顯升級,不過基準分數仍應針對你自己的儲存庫與工具設定進行驗證。
當任務需要的不只是一個答案時,Grok 4.6 最有用。它的主要優勢是在研究、規劃、工具呼叫、實作、測試與修訂等過程中持續工作。
儲存庫規模的程式碼撰寫:將原始碼檔案、問題描述、日誌、螢幕截圖與架構筆記提供給模型。它可以跨元件追蹤行為、提出修改建議、解釋相依性,並協助驗證修正是否解決了原本的失敗。
長時間執行的程式碼代理:使用函式呼叫連接終端工具、測試執行器、檔案系統、資料庫或部署檢查。較低的推理強度足以處理例行工具選擇,而 high 或 xhigh 強度則更適合留給困難的除錯與架構決策。
互動式應用程式原型開發:Grok 4.6 的設計目標是將廣泛的產品想法轉化為可觀的第一版。它特別適合儀表板、模擬、瀏覽器型工具,以及需要同時處理版面配置、互動邏輯與迭代精修的介面。
視覺化除錯與 QA:在提供程式碼與實作需求時,一併附上介面螢幕截圖。模型可以辨識轉譯後的介面與預期設計之間的差異,然後回傳文字指示、程式碼變更或結構化的缺陷報告。
研究與知識工作:在同一個工作上下文中,結合長篇報告、PDF、表格、圖片與書面問題。具備工具能力的代理可以收集資訊、比較來源、整理發現,並以下游系統可處理的架構回傳結果。
對於簡短、高量的請求,如果較低成本的模型已能達到驗收門檻,這個模型的吸引力就較低。對於這些工作負載,請將簡單的分類、抽取或改寫任務導向較小的模型,並將 Grok 4.6 保留給需要持續推理的案例。
Grok 4.6 支援熟悉的 OpenAI 風格請求模式,但若不檢視請求行為就直接更換模型名稱,仍可能產生錯誤。
首先,推理無法停用。預設設定為 high,這可能會使用更多推理 token,並產生比預期更高的延遲。請使用 low 來處理直接了當的工具選擇或對時間敏感的代理,medium 來進行分析,而 xhigh 則只有在額外的推理深度值得付出成本與等待時間時才使用。
其次,推理模型不接受所有標準取樣參數。SpaceXAI 的文件指出,presence_penalty、frequency_penalty 與 stop 無法與 Grok 4.6 一起使用。包含這些參數的請求會回傳錯誤,因此在切換流量前,請先將它們從共用的模型設定中移除。
第三,不要僅依短上下文的標題價格來估算 500K token 請求的費用。當提示達到 200,000 個 token 時,SpaceXAI 會套用較高的直接費率。在執行大型上下文任務前,請查看 GPTProto 的即時定價面板,尤其是當代理重複傳送完整對話或儲存庫歷史時。
第四,影像輸入不等於影像輸出。Grok 4.6 可以檢查螢幕截圖、圖表、圖形與其他視覺參考資料,但影像與影片生成需要使用獨立的 Grok Imagine 模型。
最後,請確認你所選路徑開放哪些供應商託管工具。標準的函式呼叫與結構化輸出是可移植的應用程式模式,而內建網頁搜尋、X 搜尋或程式碼執行則可能依賴端點支援。
Grok 4.6 不是上下文視窗的擴充,也不是 Grok 4.5 的低價替代品。兩個模型都有 500K 的上下文視窗,以及相同的標準直接輸入與輸出價格。這次升級主要關於代理效能、更長久的任務持續能力、視覺化與互動式工作,以及新增的 xhigh 推理選項。
| 決策因素 | Grok 4.6 | Grok 4.5 | 實際差異 |
|---|---|---|---|
| 上下文視窗 | 500K | 500K | 容量未增加 |
| 輸入與輸出 | 文字/圖片 → 文字 | 文字/圖片 → 文字 | 模態配置相同 |
| 推理等級 | low、medium、high、xhigh | low、medium、high | Grok 4.6 新增真正的 xhigh 推理 |
| 標準直接價格 | $2 輸入 / $6 輸出(每 1M) | $2 輸入 / $6 輸出(每 1M) | 標準價格未調降 |
| 200K 以下的快取輸入 | $0.50 每 1M | $0.30 每 1M | Grok 4.5 在快取密集型工作負載上更便宜 |
| AA Intelligence Index | 61 | 56 | Grok 4.6 進步 5 分 |
| CursorBench v3.2 | 69.9% | 66.7% | 報告的程式碼代理效能較佳 |
| DeepSWE v1.1 | 65.9% | 54.0% | 在軟體工程任務上提升幅度更大 |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 報告的長篇程式碼撰寫結果較佳 |
| APEX-Agents | 57.5% | 47.1% | 報告的代理效能更強 |
| 最佳適用情境 | 長期代理、互動式應用程式與困難的程式碼任務 | 既有程式碼管線與快取密集型任務 | 應依工作負載決定是否升級,而非只看模型編號 |
上述基準數據來自 SpaceXAI 的 Grok 4.6 發布評測,並使用 High 推理設定。這些數據是有用的方向性證據,而非對每個程式碼庫的保證。
當代理必須在許多步驟中保持高效、檢視自身工作、解讀視覺參考,或根據廣泛的規格產出可觀的互動式應用程式時,請選擇 Grok 4.6。
當你目前的評測已通過、快取提示佔用顯著的使用比例,或切換後在接受率上沒有可衡量的改善時,請繼續使用 Grok 4.5。在轉移所有流量之前,請先對相同的儲存庫任務執行兩個模型。
當不完整或錯誤結果的成本高於額外的推理延遲時,請選擇這個模型。適合的案例包括儲存庫層級的除錯、功能實作、工具驅動研究、視覺化介面工作,以及必須測試並修正自身輸出的代理。
在程式碼工作上,當任務結合多種活動時,Grok 4.6 特別相關:閱讀不熟悉的程式碼、決定要修改哪些檔案、呼叫工具、解讀測試失敗,並持續直到結果符合定義的驗收條件。
對於簡單的摘要、分類、翻譯或簡短 JSON 抽取,較便宜的模型可能在每個被接受的結果上提供更佳成本。GPTProto 的共用 API 金鑰讓這種路由策略更容易,因為應用程式可以在不維護個別供應商餘額的情況下,與其他受支援的模型一起測試 Grok 4.6。
與本模型相關的指南、對比與更新。
所有文章
比較 GLM-5.2 與 Kimi K3 在程式碼撰寫、程式碼審查、遊戲開發、基準測試與 API 成本上的表現,找出 2026 年更適合開發者的模型。

比較 DeepSeek V4 Pro 0813 與 Kimi K3 在程式碼撰寫、速度、多模態輸入與 API 成本上的表現,看看哪個模型更適合你的專案。

比較 Grok 4.6 與 DeepSeek V4 Pro 在程式碼撰寫、前端開發、基準測試、上下文與 API 定價上的表現,看看哪個模型對開發者來說更具價值。

Grok 4.6 與 Kimi K3 每次任務的成本幾乎相同,但走的是截然不同的路線。本文從開發者角度並排比較定價、程式碼能力、上下文與選擇建議。