Grok 4.6 正式推出:長任務、AI Coding 與視覺開發升級,API 價格一次看

Grok 4.6 聚焦長時間 Agent、AI Coding 與視覺互動專案。本文整理官方評測、訓練方式、API 價格、適合族群與目前限制。

Share
Grok 4.6 正式推出:長任務、AI Coding 與視覺開發升級,API 價格一次看

xAI 在 2026 年 8 月 12 日正式推出 Grok 4.6。這次更新延續 Grok 4.5 的程式開發與知識工作能力,重點則轉向更長的多步驟任務,以及更完整的互動式、視覺化成果。

如果只看版本號,Grok 4.6 很像一次小幅升級。但官方公布的評測顯示,它相較 Grok 4.5 在程式開發、Agent 任務、專業知識工作與長時間操作都有進步。它也已在 Cursor、Grok Build、xAI API(讓開發者從程式呼叫模型的介面)、OpenRouter、Vercel 與 Cloudflare 提供。

我的判斷是中性偏多。Grok 4.6 的進步不只集中在單一排行榜,對需要 AI 持續讀專案、修改程式並反覆驗證的人更有吸引力。不過,多項細分評測的第一名仍由其他模型拿下,官方也沒有公布真實專案的任務成功率。現階段適合先用同一批工作與 Grok 4.5 或既有模型對照,不必因新品發布就全面遷移。

Grok 4.6 是什麼?

Grok 4.6 是 xAI 面向 AI Coding、AI Agent 與知識工作的最新模型。AI Agent 可以理解成不只回答問題,還會使用工具、讀取資料、執行步驟並檢查成果的 AI 系統。

xAI 表示,Grok 4.6 更能在長時間任務中維持工作方向,包括研究陌生主題、分析資訊、理解大型程式庫,以及把產品構想做成可操作的應用程式或工作文件。官方內部測試也觀察到,模型在較長的執行過程中,會更常主動測試與驗證自己的成果。

這項改變比「回答更聰明」更具體。短問答只要一兩個回合就能看出結果;真正的軟體開發與研究工作,往往要經過讀資料、建立架構、修改、測試、發現問題再重做。Grok 4.6 想改善的正是這段容易失焦或提早停止的過程。

但官方目前沒有公布長任務成功率、平均人工接手次數或失敗復原率。「會自行驗證」是 xAI 在測試中觀察到的行為,不代表模型產出的程式、研究結論或視覺成品可以省略人工驗收。

從想法做到可用版本,視覺與互動成果是另一個重點

xAI 表示,Grok 4.6 尤其擅長把較寬泛的產品想法,轉成可以操作的第一版。模型會先研究陌生領域,再規劃應用程式結構、實作核心互動,並根據後續回饋繼續修改。

相較 Grok 4.5,官方認為 Grok 4.6 在視覺與互動專案的第一版更完整,能在一次執行中先建立資訊結構與視覺語言。對 PM、設計師與前端工程師來說,這可能縮短從文字需求到可點擊的最小可行產品(MVP)之間的距離,讓團隊先看到具體成果,再進入迭代。

0:00
/0:00

Grok 4.6 官方展示影片,呈現長任務、程式庫理解與工作工具整合。影片來源:xAI 官方發布頁面

這類能力最適合用在需求方向已經明確,但版面與互動仍可調整的專案,例如內部工具、活動頁、資料儀表板或產品原型。如果是金流、權限、醫療、法律或正式資料流程,第一版做得完整反而更容易讓人放下戒心,仍應保留測試、權限檢查與人工 review。

Grok 4.6 評測表現如何?

xAI 公布的 Artificial Analysis Intelligence Index 中,Grok 4.6 得到 61 分,與 GPT-5.6 Sol Max 相同,高於 Grok 4.5 High 的 56 分,但低於 Fable 5 Max 的 62 分。這個指標綜合 9 項測試,用來觀察模型整體能力,不代表每一種工作都會得到相同排序。

Grok 4.6 在 AA Intelligence Index 得到 61 分,與 GPT-5.6 Sol Max 同分
Grok 4.6 在 AA Intelligence Index 得到 61 分,與 GPT-5.6 Sol Max 相同。競品數字由 xAI 整理自各開發者的 system card 或公開排行榜。 圖片來源:xAI 官方發布頁面

從細分成績來看,Grok 4.6 的優勢是相較前代進步範圍廣,而不是每項都拿第一:

評測 Grok 4.6 High Grok 4.5 High 這個結果代表什麼
AA Intelligence Index 61 56 綜合能力明顯提升,但仍不是單獨第一
GDPVal-AA v2 1,753 1,526 專業知識工作成績高於表中其他模型
CursorBench v3.2 69.9% 66.7% AI Coding 有進步,Fable 5 Max 仍較高
DeepSWE v1.1 65.9% 54% 軟體工程提升明顯,GPT-5.6 Sol Max 仍領先
FrontierCode v1.1 Extended 61.3% 56.6% 長程式任務進步,但 Fable 5 Max 較高
APEX-Agents 57.5% 47.1% Agent 任務提升約 10.4 個百分點
Terminal-Bench v3.0 26% 15.7% 終端機任務進步,但與前兩名仍有差距
Grok 4.6 與 Grok 4.5、GPT-5.6 Sol、Fable 5 的完整評測比較表
Grok 4.6 在 xAI 公布的 10 項評測中全部高於 Grok 4.5,但多數項目的最高分仍由其他模型取得。 圖片來源:xAI 官方發布頁面

這組結果支持「Grok 4.6 是一次全面升級」,卻不支持「Grok 4.6 全面擊敗其他模型」。例如它在 GDPVal-AA v2、AA-Briefcase 與 Harvey LAB 表現突出,但 DeepSWE、Terminal-Bench 與多項程式評測仍由其他模型領先。

另一個限制是,這張比較表由 xAI 整理。官方註明第三方模型成績採各家公司自行公布的 system card 或公開結果中的最佳值。System card 是記錄模型能力、測試與安全資訊的官方說明文件。不同模型的推理設定、工具、Agent Harness 與運算量不一定完全一致。Agent Harness 是包在模型外圍、負責工具、記憶與執行流程的工作框架。選型時仍要用相同任務、成本與驗收標準自行比較。

Grok 4.6 怎麼訓練?為什麼長任務會進步?

xAI 表示,Grok 4.6 比 Grok 4.5 進行更長的補充訓練,資料包含模型生成的推理與進階技術內容、高品質工程資料,以及改良後的 optimizer 與訓練方法。Optimizer 是訓練模型時調整參數的方法,會影響模型如何從資料中學習。

接著,團隊使用 Grok 4.5 重新產生不同推理強度、Agent Harness 與專業領域的 SFT 軌跡。SFT 是監督式微調,白話來說,就是讓模型從一批較理想的解題與工作步驟中學習。xAI 再用模型檢查方式過濾有問題的紀錄。

最後,Grok 4.6 接受多種 Agent 任務的 RL 訓練。RL 是強化學習,模型會依照任務結果得到回饋,再調整後續策略。訓練環境包含一般程式開發、知識工作、核心運算最佳化、網頁開發與電腦輔助設計。

這套流程能解釋為什麼 Grok 4.6 的提升同時出現在程式、Agent 與專業工作,而不只是一項考試。不過,xAI 沒有公開資料規模、完整訓練配方或第三方重現結果,因此目前只能確認官方描述,不能把訓練方法直接等同於實際專案可靠度。

Grok 4.6 在哪裡可以使用?API 價格多少?

截至 2026 年 8 月 13 日,xAI 公布的 Grok 4.6 使用入口包括:

  • Grok Build:xAI 的 AI Coding 工具。
  • Cursor:可在程式編輯流程中選用 Grok 4.6。
  • xAI API Console:讓開發者從自己的產品呼叫模型。
  • 合作平台:OpenRouter、Vercel 與 Cloudflare。

API 基本價格從每 100 萬個輸入 token 2 美元、每 100 萬個輸出 token 6 美元起。Token 是模型處理文字時的計價單位。官方另提供速度較快的版本,價格為基本版本的 2 倍,也就是輸入 4 美元、輸出 12 美元。

xAI 同時提供 Grok Build 與 Cursor 首週 2 倍內含用量。這是限時額度,不應當成長期成本。長時間 Agent 會反覆讀取上下文、呼叫工具並產生測試結果,實際費用不只取決於單價,也取決於完成一項任務需要多少步驟。

官方發布頁沒有列出 Grok 4.6 的 context window、快取價格、長上下文加價門檻與完整 API model ID。Context window 是模型單次能處理的文字與資料上限,model ID 則是程式呼叫特定模型時使用的名稱代碼。開發者在正式串接前,仍應以 xAI Console 與模型文件中實際顯示的設定為準。

Grok 4.6 適合誰?

現階段最值得測試的使用者有三類:

  1. 需要 AI 持續理解大型程式庫、修改多個檔案並執行測試的開發者。
  2. 想把產品需求快速做成互動式 MVP 的 PM、設計師與前端團隊。
  3. 需要跨多步驟整理資料、分析文件並產出工作成果的研究或知識工作者。

如果工作只有短問答、簡單改寫或一次性程式片段,Grok 4.6 的長任務能力未必會帶來明顯差異。若流程涉及正式資料寫入、帳號權限、付款或對外發布,則應先限制工具權限,並在不可逆操作前保留人工確認。

最實際的評估方法,是挑選 10 至 20 個真實任務,同時記錄完成率、人工介入次數、總 token、執行時間與錯誤修復成本。若 Grok 4.6 只是分數較高,卻沒有降低總工作成本,就沒有遷移價值。

Grok 4.6 常見問題

Grok 4.6 比 Grok 4.5 強多少?

依 xAI 公布的表格,Grok 4.6 在列出的 10 項評測都高於 Grok 4.5。提升較明顯的項目包括 APEX-Agents、DeepSWE 與 Terminal-Bench,但評測進步不等於每個真實專案都會得到相同比例的改善。

Grok 4.6 是目前最強的 AI 模型嗎?

不能只靠這份資料下結論。Grok 4.6 在 AA Intelligence Index 與 GPT-5.6 Sol Max 同分,也在部分專業工作測試拿到最高分;但 Fable 5 Max 與 GPT-5.6 Sol Max 仍分別領先多項程式與 Agent 評測。

Grok 4.6 可以在一般 Grok App 使用嗎?

xAI 這次公告明確列出的入口是 Cursor、Grok Build、xAI API,以及 OpenRouter、Vercel、Cloudflare 等合作平台,沒有在同一篇公告中宣布一般 Grok 聊天介面的開放範圍。若只是想直接試用,可先從公告提供的 Grok Build 入口開始。

Grok 4.6 API 價格多少?

基本版本從每 100 萬輸入 token 2 美元、每 100 萬輸出 token 6 美元起。速度較快的版本價格為 2 倍。大量長任務還要計算反覆讀取上下文、工具呼叫與輸出內容帶來的總用量。

Grok 4.6 可以完全自動完成長任務嗎?

它的訓練與產品定位確實更重視長時間執行與自我驗證,但官方沒有公布無人監督成功率。程式上線、資料寫入、付款、權限修改與對外發布等高風險工作,仍需要人工確認。

結論:Grok 4.6 的價值,在於把「做得更久」變成可用能力

Grok 4.6 最值得注意的地方,不是單一評測第一,而是相較 Grok 4.5 在程式、Agent、知識工作與互動式專案都出現進步。它的產品方向很清楚:讓 AI 不只回答下一步,而是能在長任務中持續推進、測試與修正。

目前證據足以支持開發者與產品團隊開始測試,還不足以支持全面遷移。評測主要來自官方整理,真實任務成功率、人工接手次數、context window 與完整成本細節也沒有在公告中一次說清楚。

因此,我會把 Grok 4.6 視為值得放進模型評選清單的實用升級。真正決定它是否勝出的,不是版本號或排行榜,而是同一項工作能否用更少步驟、更低總成本,交付更可靠的結果。

資料來源