Anthropic 新模型 Fable 5.1 上線,但「降智」疑慮還沒解
本周焦點事件
- Anthropic 新模型 Fable 5.1 上線,但「降智」疑慮還沒解
- NVIDIA 砸 35 億美元投資聯發科,股價當天直接鎖漲停
- Dyson 出了支 499 美元的牙刷,AI 比你認真刷牙
- 開源 Agent Skill Archify 爆紅:讓 AI 把程式碼畫成架構圖
- Runway Solaris:你的網頁介面,以後用「畫」的
Anthropic 新模型 Fable 5.1 上線,但「降智」疑慮還沒解

Anthropic 發布最新模型 Claude Fable 5.1 與 Claude Mythos 5.1 上線,這次改版最直接的變化在定價。標準輸入與輸出價格完全沒動,維持每百萬 token 10 美元/50 美元;唯一被砍的,是 cache read(快取讀取)價格,從每百萬 token 1 美元降到 0.25 美元,降幅 75%。這個改動,就是最容易在長、複雜型的任務裡,滋養出天價帳單的項目,這次直接砍掉了四分之三。
cache read 指的是模型重複讀取先前已經處理過的內容,例如同一份程式碼庫、系統指令、或累積的對話歷史,agent 在跑長任務時幾乎每一輪都要重新讀一次這些東西。Anthropic 官方說法是,這能讓一般工作負載成本降約 25%,高度 agentic 的工作負載最多降 45%(這兩個數字是官方自估,目前沒有查到公開的計算方法論)。
除了降價以外,也搭配著能力的提升:
| 測驗項目 | Fable 5(6/9) | Fable 5.1(9/1) |
|---|---|---|
| Terminal-Bench-Science 0.1(agentic 科研任務) | 24.7% | 52.6% |
| Terminal-Bench 4.0(agentic coding) | 42.0% | 55.8% |
| OSWorld 2.0(電腦操作,嚴格模式) | 36.1% | 41.7% |
| CursorBench 3.2.0 | 70.5% | 73.4% |
| Humanity's Last Exam(使用工具) | 63.8% | 65.0% |
其中提升最多的是 Terminal-Bench-Science,從 24.7% 跳到 52.6%。這個測驗項目是專門測試 AI 能不能獨立完成長時間、多步驟科研任務的跑分,官方公告也附上了幾個具體案例,可以讓大家比較好理解:Fable 5.1 能設計出結合親和力比先前競賽作品高 10 倍的蛋白質結合物、用 30 年前的 NASA 舊資料把金星地形圖解析度從 10-20 公里推進到 2-3 公里、把部分計算生物學模型效能最佳化 2.5 倍、GPU 成本降 30-60%。
新增功能還包括:對話中途可以調整推理強度(Low/Medium/High 三檔)、因應歐盟 AI Act 要求在輸出內容加上隱形浮水印、以及讓企業把監控資料留在自己基礎設施內的「Enterprise Frontier Safeguards」(預計今年秋天全面推出)。資安防護的誤判率比前代降了 60%,一般醫療或基礎生物學這類生醫良性查詢被誤擋的比例則降了 85%。
觀察筆記
我前陣子讀到一個很有趣的數字,Fable 5 上市兩個月內,在 Anthropic 約 7 萬家企業客戶的花費裡只占了約 11%,我想大家都知道背後的原因,實在是太貴啦!不只 token 費貴翻天,難預測也是 Fable 沒辦法落地的一個重要因子,有了 Fable,一個月的 API 費用是過去的五倍在跳。
另外很多人最近在社群上反映 Claude 降智的情況,我也分享一下自己對於 AI 降智的心得,我原本很懷疑這會不會跟我自己在本地跑本地 AI 時、多工會拖累生成品質是同一個邏輯,伺服器忙的時候悄悄給你打折扣(尤其最近 Claude 和 Codex 一直拉高用量)。
但查完一輪資料後,我的結論是:降智這件事,確實發生過,而且 Anthropic 自己兩次都公開認了。但認下來的原因清一色指向工程層面:推理強度預設值調低、快取清理邏輯出包、系統提示詞字數限制三件事,官方全程沒有承認過跟伺服器負載或成本考量有關。
不過我很確信的是,如果你之後也有遇到某個 AI 降智的情況(尤其是 Claude),我認為改用 API 會是一個很好的解決方式。和 ChatGPT 不一樣,Anthropic 大概 80% 營收來自企業 API,一旦被抓到 API 品質會隨負載浮動,砸的是企業信任,他們沒什麼動機去賭這個。
NVIDIA 砸 35 億美元投資聯發科,股價當天直接鎖漲停

聯發科在 2026 年 8 月 31 日完成訂價,發行總額 39 億美元的海外無擔保可轉換公司債,才晚上,NVIDIA 一家就認購了 35 億美元,占了將近九成。剩下的約 4 億美元,由 Alphabet(Google 母公司)與其他國際機構投資人共同認購。
先解釋一下「可轉換公司債」是什麼:它有點像你先借對方一筆錢,約好利息是零,但附帶一個條件,幾年後如果對方股價漲得夠多,你可以選擇把這筆借款直接換成對方的股票;如果沒漲到位,到期你就正常把本金拿回來,一毛不少。這次的條件是 5 年期、零票面利率,2031 年 9 月到期,初始轉換價是每股新台幣 4,513.75 元,比訂價日收盤價 3,925 元高了 15%。也就是說,NVIDIA 現在的身份是聯發科的債權人,不是股東,要等聯發科股價真的衝上去,這筆錢才有機會變成股份,全數轉換的話,最大稀釋比例也只有約 1.67%。
比這 35 億美元更關鍵的,是雙方同步宣布的合作範圍。聯發科將採用 NVIDIA 的 NVLink Fusion,替雲端業者設計客製 AI 晶片(XPU,泛指各種為特定 AI 工作負載打造的專用處理器)。NVLink 原本是 NVIDIA 用來串接自家 GPU、CPU、記憶體的高速連接技術,NVLink Fusion 則是把這條連接管線開放給別人家的客製晶片用。
這對聯發科來說是一次身份轉換。過去外界認識的聯發科,是手機系統單晶片(Dimensity 系列)的供應商,但這次交易被多家媒體定調為「NVIDIA 首次投資台灣 IC 設計公司」,聯發科自己也在合作公告裡把這次合作定位成從「手機晶片供應商」走向「AI 運算平台夥伴」的關鍵一步,同步把 2027 年 AI 加速器可服務市場規模上修到 800 億美元,目標市占率從 10%–15% 上修到 15%–20%。
觀察筆記
過去幾年 Google、Amazon、微軟、Meta 都在加碼自研晶片(TPU、Trainium、Maia、MTIA),表面上是想擺脫對 NVIDIA GPU 的依賴,自家資料中心不用再看黃仁勳的臉色。但這些自研晶片做出來以後,還是得靠某種高速連接技術,才能跟伺服器裡其他運算元件串成一套真正能運作的機櫃系統,而 NVIDIA 手上正好握著這個環節,就是前面提到的 NVLink Fusion。
聯發科這類替雲端業者操刀設計客製晶片的 IC 設計夥伴,就是決定這些自研晶片最後要不要接上 NVLink Fusion 的關鍵角色。NVIDIA 投資聯發科,說白了就是要確保這個決定會往對自己有利的方向走:客戶想自己設計晶片可以,但操刀的設計夥伴,最好是自己出過錢、關係夠深的那一家。NVIDIA 真正在賣的,其實一直都是同一樣東西:一個你怎麼繞都繞不掉的接口規格。
這也是為什麼我會覺得,如果把這筆交易,放進「角色重新定義」的框架裡看。聯發科的身份正在從「手機晶片供應商」滑向「AI 基礎建設夥伴」,而 NVIDIA 的身份也在悄悄從「賣晶片給你」變成「你用不用我的晶片都無所謂,反正你得用我的接口」。
AI 郵報學院近期開課:
Gemini × NotebookLM 工作資訊整理實戰

由現於企業端開發 LLM 應用(RAG 工作流與 MCP 工具鏈整合)、曾在工研院負責機器學習專案的 AI Solution Engineer 過勞熊,親自帶你用 PDSA 方法論架構,建立一套 Gemini × NotebookLM 的資訊整理流程。
課堂以三種職場情境實作:
- 把零散的工作經歷整理成一頁式中英文履歷,順手學會設定 AI 的責任邊界
- 把會議逐字稿轉成含重點結論、待辦與待確認事項的可追蹤會後文件
- 從文章與研究報告建立一座能回查來源、可引用的 NotebookLM 知識庫
下課後,你將帶走三套實作工具、提示詞範本與示範資料,以及可以直接套用的空白模板,把零散資訊變成可交付、可檢核、也能再次使用的成果。
特別適合:
- 剛開始接觸 Gemini 與 NotebookLM 的人
- 需要整理會議文件的工作者
- 正在求職或想整理個人經歷的你
Dyson 出了支 499 美元的牙刷,AI 比你認真刷牙

Dyson 9 月 1 日在巴黎發表 CameraJet,一支要價 499 美元的電動牙刷。刷頭裡塞了一顆 10 萬像素相機,每秒拍 28 張影像,搭配用 47 萬張牙齒影像訓練出來的裝置端 AI(Dyson 取名 Gap Optical Targeting),在 100 毫秒內找出牙縫位置(坦白說,這一百毫秒還真是久...),對著它噴一發錐狀漱口水,同時刷頭本身還在以每分鐘 5.8 萬次的頻率震動。
Dyson 說這背後是 6 年開發、661 名工程師、38 項專利,還跟新加坡國立大學合作五年研發合成牙菌斑,因為總不能每改一次設計就找一群真人重跑臨床試驗;因為相機需要清晰視野,連牙膏都重新配方成低泡沫版本。
這有點像拿大砲打小鳥。刷牙這件事,一支 90 美元的普通電動牙刷加一段牙線就能做到八成效果,牙醫講了很多年,Dyson 卻用造飛機引擎的規格去解決它。官方公布的數字:實驗室測試比市售頂級電動牙刷多去除 69% 難處牙菌斑,4 週臨床試驗中牙齦出血減少 65%(對照組僅 37%),74% 使用者達到「健康牙齦」(對照組 6%)。這組臨床百分比目前只查得到 Dyson 自己的行銷素材,還沒找到獨立第三方逐字覆核,看看就好,別當成鐵板釘釘的醫學證據。
Dyson 也不是第一次把 AI 攝影機塞進家電:過去也發表過掃地機器人 Spot+Scrub Ai 已經在用類似套路辨識近 200 種居家污漬。Philips Sonicare、Oral-B 這些牙刷老牌,也幾乎同步在做「AI 感測牙刷」,只是 Dyson 目前是唯一把攝影機直接嵌進刷頭、運算全程留在裝置端不上雲的品牌。
觀察筆記
老實說,這則新聞跟這期其他幾篇比起來,AI 含量薄了不少。它不是會聊天、會規劃任務的 Agent,就是一顆單一任務、專門辨識牙縫的裝置端小模型,跟這陣子動輒喊資料中心、喊算力競賽的敘事幾乎搭不上邊。但這反而是它有趣的地方:當所有人都在比誰的模型更大、更燒錢,Dyson 選擇用一顆小到不能再小的模型,換一個消費者願意多付四百多塊的理由。
如果你是那種一支牙刷用到毛都禿了才想到要換的人,499 美元大概還是會讓你倒抽一口氣。但如果你已經買單過 Dyson 的吸塵器或吹風機,你大概也知道接下來會發生什麼事:先覺得是噱頭,用了一週後開始說服自己「其實還蠻有感的」。這條產品經營的與其說是牙齒健康,不如說是你對「工程感」這三個字有多買單。
開源 Agent Skill Archify 爆紅:讓 AI 把程式碼畫成架構圖

Archify 這個 Skill 在 8 月 26 日登上 GitHub Trending 全站第一,連續掛榜約 11 天,單日最多增加近 3,900 顆星,短短一週左右從約 4 千星衝到 4 萬星以上。他最主要的功能是把程式碼庫或一句話系統描述,自動轉成架構圖、流程圖、時序圖、資料流圖、生命週期圖五種技術圖表。用法很直接,你可以請 agent 先讀完整個專案檔,再要求「畫出 8 到 12 個核心元件的高階架構圖,標出主要路徑、外部依賴跟信任邊界」。官方主打輸出是一個雙擊就能打開的單一 HTML 檔案,內建明暗雙主題,還能再匯出成 PNG、SVG、WebM,跟一張專為社群分享設計的卡片圖。

它的技術流程分三段:AI agent 先把程式碼或描述轉成一份「型別化 JSON IR」,決定要畫哪些節點、階層關係怎麼排;接著這份 JSON 被「確定性編譯」成 HTML/SVG,這一步完全不涉及 AI,同樣的輸入永遠得到同樣的圖;最後跑一輪自動驗證,沒過關就不會產出檔案,還會附上機器可讀的錯誤碼讓 agent 自己修正重試。架構圖裡的節點還可以標記回溯到具體的 Git commit,理論上讓「這個節點為什麼存在」有跡可循,不是憑空生成。有中文技術部落格的實測心得形容它的輸出是「設計稿水準」,節點對齊、配色協調,可以直接放進技術文件或簡報,這大概也是它能在 GitHub Trending 上被瘋狂轉發的原因之一,好看到可以截圖發文,本身就是一種傳播誘因。
觀察筆記
上週五(8/29),唐鳳在台北「You Are Here」這場活動上分享過一張圖,中間是「轉譯者」,四個角落分別是造橋者(為眾人打造系統)、織網者(為眾人織造制度)、手藝人(為自身打造系統)、陪走者(為自身織造制度),轉譯者的位置被定義成「看清楚限制變了沒,再決定要換到哪個角色」。
archify 做的事,某種程度上就是這個角色的技能包版本:它把工程師才看得懂的程式碼,翻譯成任何人一眼就能懂的架構圖,讓不會寫程式的 PM、負責審查的人、剛加入團隊的新人,都能對著同一張圖跟工程師對話。當 AI 開始能接手這種「轉譯」工作,某種程度上也在把轉譯者這個角色,從少數資深工程師才有的稀缺技能,變成一個隨時可以呼叫的 Skill。

Runway Solaris:你的網頁介面,以後用「畫」的

8 月 31 日,Runway 發布了一款他們稱為「介面世界模型」的東西,名字叫 Solaris。可以想像一下,你螢幕裡的網頁跟 App,不再是被預先做好的,而是你在點擊的當下,同步「生成」你可以點按的介面。
現在多數 AI 建站工具的流程,是先讓模型生成設計圖,再把設計圖轉成 HTML、CSS、JavaScript,畫面再漂亮,最後還是得經過一層程式碼才能被點擊操作。Solaris 想跳過這個轉換步驟。它建立在 Runway 自家的 Gen-4.5 影片模型上,把「正在生成的畫面」直接當成網站或 App 本身,不只是單純生成一張網頁截圖:你點擊、拖曳、打字,模型就依你的動作即時生成下一個畫面,讓整個介面像被 AI 一幀一幀畫出來一樣即時回應。
技術上,Runway 把一般影片擴散模型需要多輪去雜訊、耗時以秒或分鐘計算的生成方式,改成自回歸生成(依照已經出現的畫面,一幀接一幀往下預測),再透過模型蒸餾把原本要跑多輪的流程壓縮成幾個步驟,換取即時互動的速度。系統裡還有一個語言模型負責推理「使用者現在想做什麼」,世界模型則負責「這件事該怎麼畫出來」,兩者分工合作。
Runway 找來 250 名參與者,針對 30 組互動例子,收集了將近 7,500 次成對判斷,拿 Solaris 跟用 Claude Opus 5 寫出的程式介面做比較,兩邊從同一張圖片出發、收到同樣的互動要求。結果在「有沒有照著互動指令做」這一題,多數人偏好 Solaris;在「行為看起來自不自然」這一題,偏好 Solaris 的比例更懸殊。這是 Runway 自己設計、自己執行的內部測試,題目也偏向讓物件漂浮、換鏡頭、操作場景這類世界模型本來就擅長的視覺互動,還沒有第三方重現或獨立驗證。

官方鎖定的應用方向是虛擬購物(把衣服直接拖到自己身上試穿)、個人化教學(依學習者當下操作即時生成下一步引導)、以及訓練「電腦操作 Agent」在不斷變動的介面裡練習辨認意圖,而不是死記單一網站的按鈕位置。但 Runway 自己也列出三個沒解決的問題:生成畫面裡的文字還不穩定;畫面看起來合理不代表資訊正確;互動時間一拉長,物件外觀、位置、語意都可能悄悄跑掉。目前也沒有公布延遲、幀率、成本或正式上線時間,只開放 early access 申請。
觀察筆記
我們跟機器互動的介面,其實換過好幾輪骨架了:從最早的指令列,到滑鼠加視窗的 GUI,到觸控螢幕,到這幾年開始有人賭 VR/空間運算會是下一代介面,但這些改朝換代講的都還是「輸入方式變了」,畫面本身怎麼被畫出來這件事,一直沒變過,都是工程師先寫死。Solaris 第一次認真地問了另一個問題:如果連畫面本身都是即時生成的,介面會變成什麼樣子?
以前的網頁像一本印好的書,你只能翻到工程師寫好的那幾頁;Solaris 想做的,是一個邊看你反應邊畫畫的說書人。這個轉變如果成立,前端工程師的工作可能不再是逐頁刻版面,而是往「定義規則、驗收生成結果、把關可靠性」這個方向挪。
但讓我沒辦法完全興奮起來的,是「介面其實是一種契約」這件事。核取方塊要有穩定的勾選狀態,刪除按鈕每次都要跳出確認,數量欄位不能因為你多點兩下就悄悄跑掉,這些是機率式生成目前還給不出保證的東西,不只是美感問題而已。Solaris 展示的偏好度數字,測的其實是「感覺自然不自然」,跟「能不能穩定處理登入、付款、資料寫入」是兩件事,Runway 自己也承認,還沒說清楚生成介面要怎麼串接後端資料庫和身份驗證。
我自己的立場是中性偏多。這東西的想像空間確實很大,值得繼續關注,但在 Runway 願意公布延遲、成本,還有真實商業流程的錯誤率之前,我會把它當成一個很酷的研究方向,而不是急著把公司的下一個網站交給它。
喜歡這期內容嗎?有哪一則讓你特別有感?
歡迎回信或是 Instagram 告訴我們,我們會偷偷讀大家的回覆的!
我們下周見
—AI郵報 編輯團隊