Claude Opus 5 正式發布:價格不變、Agent 更強,值得從 Opus 4.8 升級嗎?

Anthropic 推出 Claude Opus 5,價格與 Opus 4.8 相同。本文整理 API、benchmark、Agent 能力、安全限制與模型升級建議。

Share
Anthropic 發布 Claude Opus 5 的官方主視覺
Anthropic 於 2026 年 7 月 24 日正式發布 Claude Opus 5。圖片來源:Anthropic。

Anthropic 在 2026 年 7 月 24 日正式推出 Claude Opus 5。它不是用更高價格換來小幅升級,而是維持 Opus 4.8 的 API 單價,把程式開發、知識工作、電腦操作與多步驟 Agent 任務往前推。

先講結論:如果工作是大型程式庫、複雜除錯、跨工具研究或需要長時間自主執行的流程,Opus 5 值得優先測試。但如果只是大量摘要、分類、客服或一般內容生成,不必因為版本號全面切換;Sonnet 5 的成本仍比較容易控制。

我對 Opus 5 的評價是中性偏多。理由不是它在每一項 benchmark 都拿第一,而是它以 Opus 4.8 相同單價,提高了多種真實工作型任務的完成率。這項判斷若要成立,最後仍要通過自己的任務評測,不能只看 Anthropic 的發表數字。

Claude Opus 5 重點規格

項目 Claude Opus 5
發布日期 2026 年 7 月 24 日
API ID claude-opus-5
輸入價格 每百萬 token 5 美元
輸出價格 每百萬 token 25 美元
上下文視窗 100 萬 token
最大輸出 128K token
可靠知識截止日 2026 年 5 月
Fast mode 約為預設速度 2.5 倍,Claude Platform 價格為基礎價格 2 倍
Claude 方案 Claude Max 預設模型;Claude Pro 可用的最強模型

Token 是模型讀取與產生文字時使用的計費單位;上下文視窗則是一次對話可容納的文字、程式碼與工具結果總量。100 萬 token 適合大型程式庫與長文件,但容量大不代表應該把所有資料一次塞進去,過多無關內容仍會增加成本與干擾。

真正值得注意的是價格沒有變。Opus 5 與 Opus 4.8 都是每百萬 token 輸入 5 美元、輸出 25 美元,因此升級判斷可以直接回到「相同預算是否完成更多工作」,不需要先接受單價上漲。

Opus 5 benchmark:多項工作領先,但不是全能冠軍

Claude Opus 5 與 Fable 5、Opus 4.8、GPT-5.6 Sol 的官方 benchmark 比較表
Opus 5 在多項工作型評測領先,但不是每一項都拿第一。圖片來源:Anthropic。

Anthropic 公布的整體比較中,Opus 5 在 Frontier-Bench v0.1 得到 43.3%,高於 Fable 5 的 33.7%、Opus 4.8 的 21.1% 與 GPT-5.6 Sol 的 34.4%。在電腦操作評測 OSWorld 2.0,Opus 5 為 70.6%,也高於另外三款模型。

知識工作同樣有進步。GDPval-AA v2 以 Elo 分數比較專業任務表現,Opus 5 得到 1861 分,高於 Fable 5 的 1747 分、Opus 4.8 的 1593 分與 GPT-5.6 Sol 的 1736 分。AutomationBench 測試模型能否完成跨工具商業流程,Opus 5 通過率為 26.0%,約為其他受測模型的 1.4 至 1.5 倍。

不過,Opus 5 並非每一項都第一。DeepSWE v1.1 由 GPT-5.6 Sol 以 72.7% 領先,Opus 5 為 68.8%;法律 Agent 評測則是 Fable 5 的 13.3% 高於 Opus 5 的 11.7%。這反而是比較健康的閱讀方式:新模型的優勢集中在廣泛且長流程的工作,不代表任何專業領域都能取代較強或更專門的模型。

Benchmark 是在固定題目與條件下比較模型的評測。這些數字主要來自 Anthropic 公告,部分測試也是內部執行,不能直接當成自家產品的成功率。真正會改變採用判斷的,仍是模型在你的文件、程式庫、工具權限與驗收標準下能否一次完成。

Claude Opus 5 vs Opus 4.8:真正的升級是完成一件事

Claude Opus 5 在 Frontier-Bench v0.1 不同 effort 設定下的分數與每次任務成本
同一模型會因 effort 設定產生不同成本與表現,不能只比較最高分。圖片來源:Anthropic。

Opus 5 的重點不是把每一個回答寫得更長,而是更願意驗證、修正並持續做到成功。Anthropic 提供的案例中,模型收到一張無法直接檢視的機械零件圖,先自行建立電腦視覺流程取出幾何資訊,再重建 FreeCAD 3D 模型。另一個開源套件錯誤案例中,它不只修掉表面症狀,也找到社群修補遺漏的根本原因。

這種能力對產品團隊很重要,因為 AI Agent 的成本不只來自 token 單價。第一次回答失敗、重跑三次、人工補救半小時,通常比模型本身的費用更貴。若 Opus 5 能降低重試與人工 Review,維持相同單價就可能帶來更低的「每項合格任務成本」。

但這也是最需要實測的部分。發表會案例通常挑選模型做得好的任務,不能保證它在所有程式庫都會主動建立測試、找到根因或知道何時停下。團隊應記錄一次完成率、總 token、工具呼叫次數、總時間與人工修正時間,而不是只比較第一輪回答看起來多聰明。

延伸閱讀:Claude Code × Codex 交叉 review 工作流:讓兩個 AI 互相挑錯,不懂程式也能安心上線

Effort 設定讓成本與品質可以分級

Opus 5 支援調整 effort,也就是讓模型依任務難度投入不同程度的推理與工作量。低 effort 適合快速處理,高 effort 與 max effort 則會使用更多 token 和工具操作,換取較高的完成率。

這個設計比「所有任務都跑最強設定」更實際。客服分類、固定格式整理與簡單查詢可以用較低 effort;大型重構、跨系統除錯或高風險研究才提高 effort。從官方成本曲線可以看到,Opus 5 在 Frontier-Bench 的多個設定都比 Opus 4.8 有更高分數,但越往高 effort,單次任務成本仍會上升。

對產品經理來說,最合理的 MVP 不是立即替換全站模型,而是先做任務分流:簡單工作留給 Sonnet 5,複雜工作交給 Opus 5,少數極高難度工作再考慮 Fable 5。這比把昂貴模型套在每個請求上更容易維護,也能保留升級空間。

從寫程式擴大到知識工作與商業流程

Claude Opus 5 在 AutomationBench 不同 effort 設定下的商業工作流通過率
Opus 5 的優勢不只在寫程式,也出現在需要多工具接力的商業流程。圖片來源:Anthropic。

Opus 系列常被視為 Claude Code 的高階模型,但這次升級明顯不只服務工程師。GDPval-AA、AutomationBench、OSWorld 2.0 與 DeepSearchQA 分別涵蓋專業知識工作、商業自動化、電腦操作與 Agent 搜尋,Opus 5 都呈現較好的成本/表現曲線。

這代表它更適合處理「把一份原始試算表讀完,找出高風險客戶,通知負責人,再整理給營運團隊」這類流程。單一步驟都不困難,真正容易失敗的是跨工具後漏掉條件、傳錯對象,或中途忘記原始目標。

我會把 Opus 5 優先放在高價值、可驗收的流程,而不是開放式聊天。原因很簡單:流程有明確輸入、輸出與通過條件,比較容易量化它是否真的比 Opus 4.8 省時間。若連續幾輪測試都沒有降低人工修正,升級理由就不成立。

延伸閱讀:Claude 教學:90 個官方 Use Cases、12 個工作流程與 Prompt

安全性更強,但資安工作有更細的限制

Opus 4.8、Mythos 5 與 Opus 5 在 OSS-Fuzz 漏洞辨識及漏洞利用成功數的比較
Opus 5 找漏洞的能力接近 Mythos 5,但漏洞利用能力仍明顯較低。圖片來源:Anthropic。

依 Anthropic 的自動化行為稽核,Opus 5 在欺騙、濫用誘導與高風險行動上的整體表現優於 Opus 4.8、Sonnet 5 與 Fable 5。這是官方自家測試,適合用來理解設計方向,不應當成外部獨立安全認證。

資安能力則刻意做了區隔。OSS-Fuzz 測試顯示,Opus 5 找出漏洞的表現接近 Mythos 5,但把漏洞發展成可利用攻擊的能力明顯落後。Anthropic 也表示,Opus 5 沒有刻意針對網路攻擊任務訓練,並對二進位漏洞掃描、滲透測試與 exploit 生成設下更強限制。

在 Claude.ai、Claude Code 與 Claude Cowork,若請求觸發資安分類器,系統預設會改用 Opus 4.8。API 使用者也能啟用自動 fallback。已加入 Cyber Verification Program 的企業與研究者,則可依資格使用限制較少的版本。

這種安排對一般開發工作影響有限,但做資安產品時不能只換模型 ID。團隊必須先測試哪些合法任務會觸發限制、fallback 後輸出是否一致,以及稽核紀錄能否辨認實際執行的模型。

Opus 5 API 還新增兩個 Agent 實用功能

第一個功能是對話中途變更工具。過去 Agent 若在執行期間調整可用工具,可能使 prompt cache 失效;Opus 5 上線時,Anthropic 同步提供 beta 功能,讓開發者在對話中改變工具集合而不必丟掉既有快取。Prompt cache 是重複使用相同長內容,減少再次處理成本與延遲的機制。

第二個是 API 自動 fallback。當 Opus 5 或 Fable 5 的安全分類器擋下請求,開發者可以讓系統改由其他可用模型處理,而不是直接失敗。這能提高工作流連續性,但也會增加可觀測性需求:日誌必須記錄最後由哪個模型執行,否則很難解釋品質、成本與行為差異。

Opus 5 也提供 Fast mode,速度約為預設模式的 2.5 倍。Claude Platform 的價格是基礎價格 2 倍,Claude Code 則以 usage credits 提供。它適合延遲比成本更重要的互動式程式開發,不適合無差別套用在背景批次工作。

Opus 5、Fable 5、Sonnet 5 該怎麼選?

使用情境 建議模型 原因
大型程式庫、複雜除錯、長流程 Agent Opus 5 綜合能力強,價格只有 Fable 5 的一半
最高難度、失敗成本極高的少量任務 Fable 5 部分專業與長時間任務仍有優勢
大量日常工作、客服、摘要、分類 Sonnet 5 速度與單價較適合規模化
即時互動且延遲最重要 Opus 5 Fast mode 或較快模型 需接受 Fast mode 額外成本
資安漏洞研究 先確認 CVP 與限制 一般版會封鎖部分滲透與 exploit 任務

如果目前使用 Opus 4.8,我會把 Opus 5 視為優先遷移候選,因為單價相同、API ID 明確,而且官方評測的改善方向涵蓋多種工作。但仍不建議直接切換正式環境,先用固定評測集比較會更穩。

如果目前大量使用 Sonnet 5,則沒有必要全面升級。比較實際的做法是保留 Sonnet 5 當預設模型,只把重試多次、人工修正時間高或需要跨工具完成的任務導向 Opus 5。

延伸閱讀:Claude 2026 完整學習指南

團隊升級 Opus 5 的最小測試方式

先挑 20 至 50 個真實任務,不要另外設計只為 benchmark 好看的題目。每個任務至少記錄以下五項:

  1. 一次完成率:第一輪輸出是否通過驗收。
  2. 總 token:包含工具結果、重試與修正。
  3. 總時間:從送出任務到取得可用結果。
  4. 人工修正時間:團隊還要花多久才能交付。
  5. 失敗類型:理解錯誤、工具失敗、事實錯誤或格式錯誤。

接著以相同 Prompt、工具與資料,平行比較 Opus 4.8、Opus 5 與 Sonnet 5。若 Opus 5 只讓回答看起來更完整,卻沒有提高通過率或降低人工時間,就不值得替換;若它能少跑幾輪並降低人工 Review,即使 token 用量較高,也可能是更便宜的方案。

這種小規模測試比一次改完整個系統更快落地,也比較符合產品迭代。先找出真正受益的任務,再擴大路由範圍。

常見問題

Claude Opus 5 已經正式推出了嗎?

是。Anthropic 在 2026 年 7 月 24 日發布 Claude Opus 5,Claude 各平台已可使用,開發者可透過 claude-opus-5 API ID 呼叫。

Claude Opus 5 API 價格是多少?

每百萬 token 輸入 5 美元、輸出 25 美元,與 Opus 4.8 相同。Fast mode 約為預設速度 2.5 倍,在 Claude Platform 的價格為基礎價格 2 倍。

Claude Opus 5 比 Fable 5 強嗎?

不能用一句話概括。Opus 5 在 Frontier-Bench、GDPval-AA、OSWorld 2.0 與 AutomationBench 等評測領先,但 Fable 5 在部分法律、健康與 Agent coding 任務仍較高。Opus 5 的優勢是接近高階能力,同時把 API 單價維持在 Fable 5 的一半。

Opus 4.8 使用者應該直接升級嗎?

Opus 5 是合理的優先測試對象,因為價格相同且官方評測明顯改善。但正式環境仍應先跑固定任務集,確認完成率、總成本與人工修正時間真的變好。

一般使用者需要改用 Opus 5 嗎?

高難度研究、長文件分析與複雜程式工作較容易感受到差異。日常寫作、摘要與分類不一定需要 Opus 5,使用 Sonnet 5 通常更省。

Claude Opus 5 的上下文視窗多大?

官方模型文件列出 100 萬 token 上下文視窗,最大輸出為 128K token。大容量適合長文件與大型程式庫,但仍需整理資料與控制無關內容。

結語:Opus 5 值得測試,但不值得盲目全面替換

Claude Opus 5 是一次有實際產品意義的升級。價格維持不變,程式開發、知識工作、電腦操作與多步驟 Agent 都有改善,讓它成為 Opus 4.8 使用者最自然的遷移方向。

但最好的模型不是 benchmark 表格裡拿最多第一名的模型,而是能用最低總成本通過你的驗收。高難度流程先測 Opus 5,大量日常工作保留 Sonnet 5,再用任務路由分配,會比全站一次換模更快、更穩,也更容易維護。

資料來源