Claude Fable 5.1、Mythos 5.1 是什麼?Anthropic 新模型與科學研究解析

Fable 5.1 與 Mythos 5.1 使用相同底層模型。本文整理 Coding、科學研究、API 價格、安全限制與實際適用情境。

Share
Claude Fable 5.1 與 Mythos 5.1 官方發表主視覺
Claude Fable 5.1 與 Mythos 5.1 使用相同底層模型,透過不同安全限制服務一般工作與專業研究。 圖片來源:Anthropic 官方公告(https://www.anthropic.com/claude-fable-and-mythos-5-1)

2026 年 9 月 1 日,Anthropic 發表 Claude Fable 5.1 與 Claude Mythos 5.1。兩者其實使用相同的底層模型,差別在於安全限制與開放對象:Fable 5.1 提供一般使用者與開發者使用,Mythos 5.1 則只透過受信任存取計畫,開放給通過審查的資安與生命科學團隊。

這次更新最值得注意的,不只是 Benchmark 分數又提高。Anthropic 同時展示了模型設計蛋白質、重建金星地形,以及替生物模型加速的早期成果。這代表最前沿的 AI Agent,正從「回答研究問題」走向「安排工具、執行計算、產出可被實驗驗證的候選結果」。

0:00
/0:00

Claude 官方以 27 秒影片介紹 Fable 5.1 與 Mythos 5.1。 影片來源:Claude 官方 X 貼文

AI Agent 是能根據目標自行安排步驟、呼叫工具並檢查成果的 AI 系統。不過,這批結果主要由 Anthropic 發表,部分經外部實驗單位驗證,並不是已完成同儕審查的完整學術結論,更不代表 AI 已經可以自行研發藥物。比較合理的解讀是:AI 已開始縮短研究流程中的特定環節,但驗證、風險控管與最終判斷仍離不開人類專家。

Claude Fable 5.1 與 Mythos 5.1 有什麼不同?

Anthropic 沒有為一般工作與高風險研究另外訓練兩套模型。Fable 5.1 與 Mythos 5.1 使用相同的底層模型,再透過不同的安全限制決定模型能處理哪些任務。

比較項目 Claude Fable 5.1 Claude Mythos 5.1
主要用途 Coding、知識工作、長時間 Agent 任務 資安防禦與生命科學研究
開放方式 Claude 各平台與應用程式介面(API,讓程式呼叫模型功能的規則)一般提供 僅限通過審查的組織與專業人士
高風險能力 部分生物與資安任務會被限制或轉交其他模型 在受控計畫中提供較寬鬆、但仍存在的研究限制
底層模型 與 Mythos 5.1 相同 與 Fable 5.1 相同

這種設計反映了一個現實問題:同一種推理能力可以拿來找出軟體漏洞,也可能被用來開發攻擊方法。它可以協助設計治療用蛋白質,也可能降低危險生物研究的門檻。

Fable 5.1 現在允許使用者進行漏洞發現等防禦工作,但滲透測試、Exploit 生成與二進位漏洞掃描等雙重用途任務,仍可能被重新導向限制較多的模型。Mythos 5.1 則透過資安與生命科學的受信任計畫提供,目前主要限於通過審查的美國組織,並非一般 Claude 付費方案可以直接選用。

Fable 5.1 的能力進步有多大?

Benchmark 是用固定任務比較模型能力的測驗。Anthropic 公布的測試中,Fable 5.1 在科研 Agent、終端機 Coding、商務流程與程式開發等項目,多數高於 Fable 5,但不同任務的進步幅度差異很大。

測試項目 Fable 5.1 Fable 5 差異
Terminal-Bench-Science 0.1 52.6% 24.7% +27.9 個百分點
Terminal-Bench 4.0 55.8% 42.0% +13.8 個百分點
AutomationBench 31.4% 17.1% +14.3 個百分點
CursorBench 3.2.0 73.4% 70.5% +2.9 個百分點

這些數字真正透露的是,Fable 5.1 的主要優勢集中在需要多個步驟、工具操作與持續驗證的工作,而不是每一種問答能力都翻倍。例如,在跨領域推理測驗 Humanity’s Last Exam 中,使用工具時只從 Fable 5 的 63.8% 提升到 65.0%。

測試結果也不能直接等同每個人的實際體驗。這些成績來自 Anthropic 公布的評估設定,部分測驗會受安全限制介入影響。Terminal-Bench-Science 的單一模型標準誤約為 ±3.5 至 4.5 個百分點。讀者應把它視為能力方向,而不是保證每個專案都能得到相同提升。

Claude 這次做了哪些科學研究?

Anthropic 公開的三組成果,分別代表實驗科學、資料建模與運算工程。它們的證據強度並不相同,不能只用一句「AI 會做科學研究了」概括。

1. 設計可在實驗室中結合目標的蛋白質

許多藥物需要先與人體內的特定蛋白質結合,才能阻斷、啟動或運送物質。蛋白質 Binder 可以理解成依照目標外形設計的「分子扣件」。親和力越高,代表它通常能以更低濃度抓住目標。

Anthropic 讓 Mythos 5.1 操作開源的蛋白質設計與結構預測工具,再把候選設計交給兩個外部組織做實驗驗證。官方表示,模型在 12 個目標上的平均命中率接近 50%,也就是約一半候選設計能在實驗中確認結合。Anthropic 引用的當前常見命中率約為 10% 至 15%。在三個指定目標上,最佳設計的結合親和力約為 Adaptyv Bio 競賽既有最佳設計的 10 倍。

Claude Mythos 5.1 為 Nipah G 蛋白質目標設計的 Binder 結構
橘色為 Claude 設計的 Binder、灰色為目標蛋白質。圖中 Nipah G 測試命中 18/30 個設計,結果來自 Anthropic 公布的外部實驗驗證。 圖片來源:Anthropic 官方公告

這是三組成果中最接近「實驗驗證」的一項。候選蛋白質先在電腦中完成設計,之後還被實際製造並測試結合。但能抓住目標只是藥物開發的起點。後續還要確認選擇性、毒性、穩定性、製造方式、動物試驗與人體臨床結果,不能把 Binder 命中率直接寫成新藥成功率。

比較結果本身也有條件。Anthropic 在註腳中說明,其中一個 Nipah G 的比較是針對相同結合區域。若改和另一個結合區域的參賽設計比較,兩者表現接近。這不否定模型成果,但提醒我們:生物研究的「比最佳結果強 10 倍」,必須先看目標、結合位置與測試條件是否一致。

2. 從 30 多年前的雷達資料重建金星地形

Fable 5.1 使用 NASA Magellan 任務留下的雷達影像,以及一份只覆蓋金星約五分之一面積的既有地圖,訓練神經網路重建新的高解析度地形圖。官方表示,新地圖覆蓋約三分之一個金星,能辨識約 2 至 3 公里的地形細節,優於原本約 10 至 20 公里的尺度,部分高度估計也提升最多 25%。

Claude Fable 5.1 從 Magellan 雷達資料重建的金星小型盾狀火山地形圖
Claude 重建的數位高程模型顯示一座約 15 公里寬的金星小型盾狀火山,圖中比例尺為 10 公里。 圖片來源:Anthropic 官方公告

Anthropic 已把資料放到 Zenodo,並以 Creative Commons 授權公開,希望提供 NASA VERITAS 與 ESA EnVision 等後續任務挑選觀測目標。和只展示圖片相比,可下載的資料集讓其他研究者有機會重做分析、找出偏差,證據透明度更高。

但這仍是模型推算出的地形圖,不是新的探測器直接測量。它的真正價值,要看行星科學團隊後續能否重現方法,以及新任務的觀測是否支持這些地形推估。

3. 把 7 個生物模型加速最多 2.5 倍

生命科學研究經常需要在 GPU 上重複執行蛋白質與基因模型。Mythos 5.1 透過改寫 GPU Kernel,也就是直接控制晶片如何執行計算的底層程式,並快取中間結果,替 7 個開源深度學習模型加速最多 2.5 倍,同時維持相同輸出。

Anthropic 估算,在需要掃描大量基因變異的工作中,這些最佳化可降低約 30% 至 60% 的 GPU 成本。這個成果的商業意義很直接:模型不一定要提出新理論,只要把原本需要數週工程時間的效能調校壓縮到幾天,就能讓研究團隊用相同預算測試更多假設。

限制是 Anthropic 在公告中只表示「計畫開源」這些最佳化。外界目前還不能把每個速度與成本數字視為已廣泛重現的結果。等程式碼、硬體設定與測試資料完整公開後,才有辦法判斷加速幅度能否套用到其他實驗室。

這些結果能證明 AI 已經會做科學嗎?

這批成果還不足以證明 AI 可以取代科學家。它比較接近研究流程中的「執行型協作者」,可以讀取文獻、安排開源工具、寫程式、跑大量候選方案,再把結果交給實驗或專家驗證。

三組研究的驗證程度可以這樣理解:

成果 目前可確認的證據 尚未證明的部分
蛋白質 Binder 有外部組織進行實驗室結合測試 不等於候選物可成為安全有效的藥物
金星地形圖 資料集已公開,可供其他研究者下載檢查 尚待獨立重現與未來探測資料驗證
生物模型加速 官方報告相同輸出與效能、成本改善 程式碼尚未公開,外部重現程度未知

因此,我對這次發表的判斷是「研究流程的實用進展,科學結論仍需保守」。如果只看模型自己寫出的報告,很難排除幻覺與方法錯誤。這次較有價值的地方,是 Anthropic 開始把部分成果推進到實驗室驗證、公開資料與可量測的運算改善。

Fable 5.1 價格降低了多少?

Token 是模型讀取與產生文字時使用的計費單位。Fable 5.1 的一般 API 價格沒有改變,仍為每百萬個輸入 Token 10 美元、每百萬個輸出 Token 50 美元。真正降價的是 Prompt caching 的 Cache read,也就是模型再次讀取已處理過的長篇背景資料,價格降低 75% 至每百萬 Token 0.25 美元。

Anthropic 以 2026 年 8 月四週的實際使用資料估算,在預設推理強度下,典型 Fable 工作負載的總成本可比 Fable 5 低約 25%。需要長上下文、頻繁呼叫工具的 Agent 任務,降幅最高約 45%。這是估算值,不是所有請求都固定打七五折。

對開發者來說,這項調整可能比輸出單價降一點更重要。長時間 Agent 會反覆讀取程式碼、文件與先前執行紀錄,快取內容占比越高,Cache read 降價帶來的節省越明顯。相反地,若工作每次都輸入全新內容,成本改善就不會接近 45%。

安全機制變少,還是變得更精準?

Anthropic 保留安全限制,同時降低正常研究被誤判的機率。官方表示,新版資安防護在 Claude Code 的每次 Session 中,平均可減少約 60% 的介入。生物防護對初階生物與醫療問題的誤判,則比 Fable 5 上線時減少 85%。高風險的研究與攻擊能力仍會被限制或重新導向。

企業資料方面,Anthropic 宣布 Enterprise Frontier Safeguards(EFS)。這套機制讓資料留在客戶控制的雲端環境,預設由客戶自行處理人工審查,目標是在維持濫用偵測的同時,提供接近 Zero Data Retention,也就是 Anthropic 不保留客戶提示與輸出的隱私條件。EFS 將分階段推出,符合資格的客戶在正式支援前可先使用零資料保留方案。

官方 System Card 也沒有宣稱風險已經解決。Anthropic 表示,模型在多數行為指標上比 Mythos 5 改善,但仍可能繞過某些核准與自動模式分類。現有自動稽核對超長上下文、多 Agent 協作與不可能完成的任務,觀測仍不夠完整。這些剛好都是 Fable 5.1 主打的長時間工作場景,所以真正導入時,權限、停止條件、日誌與人工驗收不能省略。

一般使用者與團隊該怎麼選?

如果只是改寫文字、整理會議或完成短任務,沒有必要因為 Fable 5.1 最強就一律選它。高階模型的價值,主要出現在任務需要跨多個檔案、長時間執行、反覆呼叫工具,或錯誤成本高到值得多花推理成本的情境。

對不同使用者,更實際的做法如下:

  • 一般使用者:把 Fable 5.1 留給深度研究、複雜文件與重要決策準備,日常問答仍可用較快、較便宜的模型。
  • 開發團隊:先用真實專案測量每個完成任務的總成本、人工修正時間與失敗率,不只比較每百萬 Token 單價。
  • AI 產品團隊:長時間 Agent 必須設定權限邊界、停止點、成果證據與人工批准,不要只因 Benchmark 提升就取消 Review。
  • 科研團隊:把 Claude 當成加速候選生成、資料分析與程式最佳化的工具,最終結論仍要交給實驗、獨立重現與領域專家。

結論:真正的變化,是 AI 開始交付可驗證的研究中間成果

Claude Fable 5.1 最容易被包裝成「世界最強 Coding 模型」,但這不是這次發表最有價值的部分。更重要的是,AI Agent 開始能在數十小時的工作中安排工具、保留脈絡、反覆驗證,並交出可以送進實驗室、資料庫或效能測試的成果。

這仍不是自動科學家。蛋白質設計離藥物很遠,金星地圖需要後續觀測,GPU 最佳化也要等程式碼公開重現。只是 AI 的角色確實正在改變:從提供答案,走向縮短「提出候選方案到取得可驗證證據」之間的時間。

我對 Fable 5.1 的結論是偏正面,但採用上要務實。對長時間 Coding、研究與 Agent 工作,它的能力與快取成本改善可能同時提高投入產出比。對短任務或高風險流程,最強模型仍不等於最低成本,也不等於可以移除人工驗收。

Claude Fable 5.1 常見問題

Claude Fable 5.1 已經可以使用了嗎?

可以。Anthropic 表示 Fable 5.1 已在 Claude 各平台、Claude API、Amazon Web Services、Google Cloud 與 Microsoft Azure 提供。API 模型名稱為 claude-fable-5-1,實際帳號可用性仍以各平台與地區顯示為準。

Claude Mythos 5.1 一般人可以使用嗎?

不行。Mythos 5.1 目前只透過資安與生命科學的受信任存取計畫開放,對象是通過審查的專業人士與組織。它不是一般 Claude 付費方案裡可直接選擇的模型。

Fable 5.1 和 Mythos 5.1 是不同模型嗎?

底層模型相同,主要差別是安全限制與存取資格。Fable 5.1 為一般用途加入較嚴格的生物與資安限制。Mythos 5.1 則在受控計畫內提供較適合專業研究的能力。

Fable 5.1 的 API 價格是多少?

每百萬個輸入 Token 10 美元、每百萬個輸出 Token 50 美元。Cache read 為每百萬 Token 0.25 美元。Anthropic 估算典型工作負載總成本比 Fable 5 低約 25%,高度 Agent 化的工作最高可低約 45%。

Claude 設計出蛋白質,是否代表它能自行開發新藥?

不是。實驗已確認部分設計能與目標蛋白質結合,但 Binder 設計只是藥物開發的早期步驟。安全性、有效性、製造、動物試驗與臨床試驗仍需大量後續研究。

資料來源