Claude Fable 5.1、Mythos 5.1 是什麼?Anthropic 新模型與科學研究解析
Fable 5.1 與 Mythos 5.1 使用相同底層模型。本文整理 Coding、科學研究、API 價格、安全限制與實際適用情境。
2026 年 9 月 1 日,Anthropic 發表 Claude Fable 5.1 與 Claude Mythos 5.1。兩者其實使用相同的底層模型,差別在於安全限制與開放對象:Fable 5.1 提供一般使用者與開發者使用,Mythos 5.1 則只透過受信任存取計畫,開放給通過審查的資安與生命科學團隊。
這次更新最值得注意的,不只是 Benchmark 分數又提高。Anthropic 同時展示了模型設計蛋白質、重建金星地形,以及替生物模型加速的早期成果。這代表最前沿的 AI Agent,正從「回答研究問題」走向「安排工具、執行計算、產出可被實驗驗證的候選結果」。
Claude 官方以 27 秒影片介紹 Fable 5.1 與 Mythos 5.1。 影片來源:Claude 官方 X 貼文。
AI Agent 是能根據目標自行安排步驟、呼叫工具並檢查成果的 AI 系統。不過,這批結果主要由 Anthropic 發表,部分經外部實驗單位驗證,並不是已完成同儕審查的完整學術結論,更不代表 AI 已經可以自行研發藥物。比較合理的解讀是:AI 已開始縮短研究流程中的特定環節,但驗證、風險控管與最終判斷仍離不開人類專家。
Claude Fable 5.1 與 Mythos 5.1 有什麼不同?
Anthropic 沒有為一般工作與高風險研究另外訓練兩套模型。Fable 5.1 與 Mythos 5.1 使用相同的底層模型,再透過不同的安全限制決定模型能處理哪些任務。
| 比較項目 | Claude Fable 5.1 | Claude Mythos 5.1 |
|---|---|---|
| 主要用途 | Coding、知識工作、長時間 Agent 任務 | 資安防禦與生命科學研究 |
| 開放方式 | Claude 各平台與應用程式介面(API,讓程式呼叫模型功能的規則)一般提供 | 僅限通過審查的組織與專業人士 |
| 高風險能力 | 部分生物與資安任務會被限制或轉交其他模型 | 在受控計畫中提供較寬鬆、但仍存在的研究限制 |
| 底層模型 | 與 Mythos 5.1 相同 | 與 Fable 5.1 相同 |
這種設計反映了一個現實問題:同一種推理能力可以拿來找出軟體漏洞,也可能被用來開發攻擊方法。它可以協助設計治療用蛋白質,也可能降低危險生物研究的門檻。
Fable 5.1 現在允許使用者進行漏洞發現等防禦工作,但滲透測試、Exploit 生成與二進位漏洞掃描等雙重用途任務,仍可能被重新導向限制較多的模型。Mythos 5.1 則透過資安與生命科學的受信任計畫提供,目前主要限於通過審查的美國組織,並非一般 Claude 付費方案可以直接選用。
Fable 5.1 的能力進步有多大?
Benchmark 是用固定任務比較模型能力的測驗。Anthropic 公布的測試中,Fable 5.1 在科研 Agent、終端機 Coding、商務流程與程式開發等項目,多數高於 Fable 5,但不同任務的進步幅度差異很大。
| 測試項目 | Fable 5.1 | Fable 5 | 差異 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | +27.9 個百分點 |
| Terminal-Bench 4.0 | 55.8% | 42.0% | +13.8 個百分點 |
| AutomationBench | 31.4% | 17.1% | +14.3 個百分點 |
| CursorBench 3.2.0 | 73.4% | 70.5% | +2.9 個百分點 |
這些數字真正透露的是,Fable 5.1 的主要優勢集中在需要多個步驟、工具操作與持續驗證的工作,而不是每一種問答能力都翻倍。例如,在跨領域推理測驗 Humanity’s Last Exam 中,使用工具時只從 Fable 5 的 63.8% 提升到 65.0%。
測試結果也不能直接等同每個人的實際體驗。這些成績來自 Anthropic 公布的評估設定,部分測驗會受安全限制介入影響。Terminal-Bench-Science 的單一模型標準誤約為 ±3.5 至 4.5 個百分點。讀者應把它視為能力方向,而不是保證每個專案都能得到相同提升。
Claude 這次做了哪些科學研究?
Anthropic 公開的三組成果,分別代表實驗科學、資料建模與運算工程。它們的證據強度並不相同,不能只用一句「AI 會做科學研究了」概括。
1. 設計可在實驗室中結合目標的蛋白質
許多藥物需要先與人體內的特定蛋白質結合,才能阻斷、啟動或運送物質。蛋白質 Binder 可以理解成依照目標外形設計的「分子扣件」。親和力越高,代表它通常能以更低濃度抓住目標。
Anthropic 讓 Mythos 5.1 操作開源的蛋白質設計與結構預測工具,再把候選設計交給兩個外部組織做實驗驗證。官方表示,模型在 12 個目標上的平均命中率接近 50%,也就是約一半候選設計能在實驗中確認結合。Anthropic 引用的當前常見命中率約為 10% 至 15%。在三個指定目標上,最佳設計的結合親和力約為 Adaptyv Bio 競賽既有最佳設計的 10 倍。

這是三組成果中最接近「實驗驗證」的一項。候選蛋白質先在電腦中完成設計,之後還被實際製造並測試結合。但能抓住目標只是藥物開發的起點。後續還要確認選擇性、毒性、穩定性、製造方式、動物試驗與人體臨床結果,不能把 Binder 命中率直接寫成新藥成功率。
比較結果本身也有條件。Anthropic 在註腳中說明,其中一個 Nipah G 的比較是針對相同結合區域。若改和另一個結合區域的參賽設計比較,兩者表現接近。這不否定模型成果,但提醒我們:生物研究的「比最佳結果強 10 倍」,必須先看目標、結合位置與測試條件是否一致。
2. 從 30 多年前的雷達資料重建金星地形
Fable 5.1 使用 NASA Magellan 任務留下的雷達影像,以及一份只覆蓋金星約五分之一面積的既有地圖,訓練神經網路重建新的高解析度地形圖。官方表示,新地圖覆蓋約三分之一個金星,能辨識約 2 至 3 公里的地形細節,優於原本約 10 至 20 公里的尺度,部分高度估計也提升最多 25%。

Anthropic 已把資料放到 Zenodo,並以 Creative Commons 授權公開,希望提供 NASA VERITAS 與 ESA EnVision 等後續任務挑選觀測目標。和只展示圖片相比,可下載的資料集讓其他研究者有機會重做分析、找出偏差,證據透明度更高。
但這仍是模型推算出的地形圖,不是新的探測器直接測量。它的真正價值,要看行星科學團隊後續能否重現方法,以及新任務的觀測是否支持這些地形推估。
3. 把 7 個生物模型加速最多 2.5 倍
生命科學研究經常需要在 GPU 上重複執行蛋白質與基因模型。Mythos 5.1 透過改寫 GPU Kernel,也就是直接控制晶片如何執行計算的底層程式,並快取中間結果,替 7 個開源深度學習模型加速最多 2.5 倍,同時維持相同輸出。
Anthropic 估算,在需要掃描大量基因變異的工作中,這些最佳化可降低約 30% 至 60% 的 GPU 成本。這個成果的商業意義很直接:模型不一定要提出新理論,只要把原本需要數週工程時間的效能調校壓縮到幾天,就能讓研究團隊用相同預算測試更多假設。
限制是 Anthropic 在公告中只表示「計畫開源」這些最佳化。外界目前還不能把每個速度與成本數字視為已廣泛重現的結果。等程式碼、硬體設定與測試資料完整公開後,才有辦法判斷加速幅度能否套用到其他實驗室。
這些結果能證明 AI 已經會做科學嗎?
這批成果還不足以證明 AI 可以取代科學家。它比較接近研究流程中的「執行型協作者」,可以讀取文獻、安排開源工具、寫程式、跑大量候選方案,再把結果交給實驗或專家驗證。
三組研究的驗證程度可以這樣理解:
| 成果 | 目前可確認的證據 | 尚未證明的部分 |
|---|---|---|
| 蛋白質 Binder | 有外部組織進行實驗室結合測試 | 不等於候選物可成為安全有效的藥物 |
| 金星地形圖 | 資料集已公開,可供其他研究者下載檢查 | 尚待獨立重現與未來探測資料驗證 |
| 生物模型加速 | 官方報告相同輸出與效能、成本改善 | 程式碼尚未公開,外部重現程度未知 |
因此,我對這次發表的判斷是「研究流程的實用進展,科學結論仍需保守」。如果只看模型自己寫出的報告,很難排除幻覺與方法錯誤。這次較有價值的地方,是 Anthropic 開始把部分成果推進到實驗室驗證、公開資料與可量測的運算改善。
Fable 5.1 價格降低了多少?
Token 是模型讀取與產生文字時使用的計費單位。Fable 5.1 的一般 API 價格沒有改變,仍為每百萬個輸入 Token 10 美元、每百萬個輸出 Token 50 美元。真正降價的是 Prompt caching 的 Cache read,也就是模型再次讀取已處理過的長篇背景資料,價格降低 75% 至每百萬 Token 0.25 美元。
Anthropic 以 2026 年 8 月四週的實際使用資料估算,在預設推理強度下,典型 Fable 工作負載的總成本可比 Fable 5 低約 25%。需要長上下文、頻繁呼叫工具的 Agent 任務,降幅最高約 45%。這是估算值,不是所有請求都固定打七五折。
對開發者來說,這項調整可能比輸出單價降一點更重要。長時間 Agent 會反覆讀取程式碼、文件與先前執行紀錄,快取內容占比越高,Cache read 降價帶來的節省越明顯。相反地,若工作每次都輸入全新內容,成本改善就不會接近 45%。
安全機制變少,還是變得更精準?
Anthropic 保留安全限制,同時降低正常研究被誤判的機率。官方表示,新版資安防護在 Claude Code 的每次 Session 中,平均可減少約 60% 的介入。生物防護對初階生物與醫療問題的誤判,則比 Fable 5 上線時減少 85%。高風險的研究與攻擊能力仍會被限制或重新導向。
企業資料方面,Anthropic 宣布 Enterprise Frontier Safeguards(EFS)。這套機制讓資料留在客戶控制的雲端環境,預設由客戶自行處理人工審查,目標是在維持濫用偵測的同時,提供接近 Zero Data Retention,也就是 Anthropic 不保留客戶提示與輸出的隱私條件。EFS 將分階段推出,符合資格的客戶在正式支援前可先使用零資料保留方案。
官方 System Card 也沒有宣稱風險已經解決。Anthropic 表示,模型在多數行為指標上比 Mythos 5 改善,但仍可能繞過某些核准與自動模式分類。現有自動稽核對超長上下文、多 Agent 協作與不可能完成的任務,觀測仍不夠完整。這些剛好都是 Fable 5.1 主打的長時間工作場景,所以真正導入時,權限、停止條件、日誌與人工驗收不能省略。
一般使用者與團隊該怎麼選?
如果只是改寫文字、整理會議或完成短任務,沒有必要因為 Fable 5.1 最強就一律選它。高階模型的價值,主要出現在任務需要跨多個檔案、長時間執行、反覆呼叫工具,或錯誤成本高到值得多花推理成本的情境。
對不同使用者,更實際的做法如下:
- 一般使用者:把 Fable 5.1 留給深度研究、複雜文件與重要決策準備,日常問答仍可用較快、較便宜的模型。
- 開發團隊:先用真實專案測量每個完成任務的總成本、人工修正時間與失敗率,不只比較每百萬 Token 單價。
- AI 產品團隊:長時間 Agent 必須設定權限邊界、停止點、成果證據與人工批准,不要只因 Benchmark 提升就取消 Review。
- 科研團隊:把 Claude 當成加速候選生成、資料分析與程式最佳化的工具,最終結論仍要交給實驗、獨立重現與領域專家。
結論:真正的變化,是 AI 開始交付可驗證的研究中間成果
Claude Fable 5.1 最容易被包裝成「世界最強 Coding 模型」,但這不是這次發表最有價值的部分。更重要的是,AI Agent 開始能在數十小時的工作中安排工具、保留脈絡、反覆驗證,並交出可以送進實驗室、資料庫或效能測試的成果。
這仍不是自動科學家。蛋白質設計離藥物很遠,金星地圖需要後續觀測,GPU 最佳化也要等程式碼公開重現。只是 AI 的角色確實正在改變:從提供答案,走向縮短「提出候選方案到取得可驗證證據」之間的時間。
我對 Fable 5.1 的結論是偏正面,但採用上要務實。對長時間 Coding、研究與 Agent 工作,它的能力與快取成本改善可能同時提高投入產出比。對短任務或高風險流程,最強模型仍不等於最低成本,也不等於可以移除人工驗收。
Claude Fable 5.1 常見問題
Claude Fable 5.1 已經可以使用了嗎?
可以。Anthropic 表示 Fable 5.1 已在 Claude 各平台、Claude API、Amazon Web Services、Google Cloud 與 Microsoft Azure 提供。API 模型名稱為 claude-fable-5-1,實際帳號可用性仍以各平台與地區顯示為準。
Claude Mythos 5.1 一般人可以使用嗎?
不行。Mythos 5.1 目前只透過資安與生命科學的受信任存取計畫開放,對象是通過審查的專業人士與組織。它不是一般 Claude 付費方案裡可直接選擇的模型。
Fable 5.1 和 Mythos 5.1 是不同模型嗎?
底層模型相同,主要差別是安全限制與存取資格。Fable 5.1 為一般用途加入較嚴格的生物與資安限制。Mythos 5.1 則在受控計畫內提供較適合專業研究的能力。
Fable 5.1 的 API 價格是多少?
每百萬個輸入 Token 10 美元、每百萬個輸出 Token 50 美元。Cache read 為每百萬 Token 0.25 美元。Anthropic 估算典型工作負載總成本比 Fable 5 低約 25%,高度 Agent 化的工作最高可低約 45%。
Claude 設計出蛋白質,是否代表它能自行開發新藥?
不是。實驗已確認部分設計能與目標蛋白質結合,但 Binder 設計只是藥物開發的早期步驟。安全性、有效性、製造、動物試驗與臨床試驗仍需大量後續研究。