Claude Haiku 5.5 發布:平均成本降約 75%,便宜模型如何改變 AI 工作分工?

Claude Haiku 5.5 正式發布,官方稱平均執行成本下降約 75%。本文深入分析短長提示詞費率、思考投入設定、子代理分工、快取降價與既有應用遷移條件,說明便宜模型何時值得採用。

Share
Claude Haiku 5.5 官方發布封面
Claude Haiku 5.5 官方發布封面,以彩色拼貼搭配模型名稱。 圖片來源:Anthropic。

AI 服務每天處理大量小任務時,模型便宜一點就可能改變整個產品的成本結構。Anthropic 在 2026 年 10 月 7 日推出 Claude Haiku 5.5,主打快速、低價與大量重複工作,並把可調整思考投入程度的設定帶進 Haiku 系列。對企業與開發者來說,這次發布最有價值的問題,是哪些工作可以交給它,以及何時仍該使用較大的模型。

這個問題也關係到一般使用者的體驗。客服願不願意即時查資料、文件工具能不能讓每一頁都被處理、程式助理是否可以多找幾個檔案,常常受每次呼叫的費用與等待時間限制。Haiku 5.5 把這些限制往下推,但採用它仍需要理解長提示詞費率、實際完成工作的成本,以及多模型分工帶來的新管理責任。

0:00
/0:00
Claude 官方 Haiku 5.5 發布短片。 影片來源:Anthropic。

平均省下七成五,要先看提示詞長度

依 Anthropic 的發布說明,Haiku 5.5 相較 Haiku 4.5,平均執行成本約下降百分之七十五。官方也解釋這個數字包含不同長度請求的組合,以及新版文字切分方式造成的用量差異。它是特定工作組合的平均結果,不能直接乘上每一家公司的舊帳單。

模型費率的單位是 token,也就是模型把文字切成的計算單位。字數與 token 數並非固定比例,中文、英文、程式碼和表格會有不同用量。Haiku 5.5 對十萬 token 以內的提示詞,輸入與輸出單價分別為每百萬 token 零點一美元與零點五美元。超過這個門檻,對應單價升為零點五與二點五美元。

提示詞長度 每百萬輸入 token 每百萬輸出 token 每百萬快取讀取 token
十萬 token 以內 0.10 美元 0.50 美元 0.01 美元
超過十萬 token 0.50 美元 2.50 美元 0.05 美元

上述為官方 2026 年 10 月 7 日價格表。這種分段費率,讓短小而高頻的請求特別有吸引力。開發者若把整份知識庫、長篇聊天記錄與多個附件全部放入同一次請求,可能跨入另一個價格區間。對使用者而言,產品願意整理與挑選相關資料,比一味塞入更多背景更有經濟意義。

以下是單純說明單價的假設試算。若十萬次請求,每次使用一千個輸入 token 與兩百個輸出 token,而且全部落在短提示詞區間,不含快取、工具與重試,輸入費用約十美元,輸出費用約十美元。這不代表一套客服服務只要二十美元,因為資料搜尋、外部系統、監控與人工處理都有各自成本。它顯示的是模型呼叫可能不再是這類小任務最大的費用來源。

可調整思考投入,讓小模型也能分配工作預算

同一個模型可以用不同投入程度處理任務,這是 Haiku 5.5 的重要改變。官方稱它是第一個提供可調整 effort 設定的 Haiku。這個設定讓開發者在成本與能力之間取捨,適合把工作分成急迫的小事,以及需要多一點分析的問題。提高設定的效果仍要透過自己任務的測試確認。

例如,辨識一封信應該交給帳務或技術客服,通常只需要讀懂信件與幾項分類規則。整理一位客戶過去半年的爭議,並判斷哪些承諾尚未履行,則可能需要跨文件比對。兩件事都叫「處理客服資料」,但適合的投入程度不同。讓它們使用同樣預算,會讓簡單工作多花錢,也可能讓複雜工作拿不到足夠資源。

文章的判斷是,這種設定有助於把模型能力當成可以分配的工作資源。不過,設定名稱本身無法告訴開發者答案是否可靠。若回覆碰到退款規則、特殊合約或資料矛盾,產品仍要有升級處理的方法。可調整投入程度解決的是模型運算配置,業務責任與判斷標準仍由產品團隊決定。

這也改變了測試方式。團隊可以固定一組真實任務,比較不同設定的完成率、等待時間與單次成功成本。假如提高投入只讓回答更長,卻沒有減少漏讀合約條件,增加費用就缺乏理由。若它能明顯降低錯誤,則可以把高投入限縮在這類問題,避免整個產品都使用同一個昂貴設定。

Haiku 5.5 與其他 Claude 模型的電腦操作成本及測試表現
Haiku 5.5 官方電腦操作測試圖,顯示不同投入程度的成本與部分得分。 圖片來源:Anthropic。

小模型適合做明確工作,大型程式任務仍有差距

Anthropic 把摘要、對話壓縮、資料庫查詢與分類列為 Haiku 5.5 的主要工作,也提到它可搭配 Opus 5.5、Sonnet 5.5,擔任程式工作中的子代理。子代理就是主工作流程交出去的一項獨立任務,例如搜尋一個檔案、整理一份報表,完成後再把結果交回主流程。這種分工讓小模型的價值更具體。

官方公佈的程式工作評估也保留了大小模型的差距。Terminal-Bench 4.0 測試需要在命令列完成多步驟工作,Haiku 5.5 的成績為百分之三十九點二,Sonnet 5.5 為百分之七十點六。這些是供應商公佈的測試結果,測試方法與細節可在 Haiku 5.5 系統說明 查看。它們支持分工方向,卻不能直接預測某個專案的成功率。

假設一個程式助理要修正跨三個模組的問題,可以讓主模型負責理解影響與決定改法,再讓 Haiku 尋找相關呼叫位置或整理測試輸出。搜尋任務若有清楚範圍,產出也容易檢查。相反地,把架構決策、權限設計與正式部署全部交給同一個便宜子代理,就會把節省費用與增加失誤風險綁在一起。

小模型的普及也要求工作交接更清楚。主模型需要知道子代理看過哪些檔案、使用哪個資料版本,以及哪些結果只是推測。若只收到一句「已找到原因」,後續決策可能建立在不完整資訊上。清楚的輸入範圍與可檢查的輸出,比把代理數量增加到很多更能提升實際工作品質。

Haiku 5.5 官方知識工作評估與成本圖
官方知識工作評估圖將任務成本與分數一起呈現,方便觀察不同設定的取捨。 圖片來源:Anthropic。

完成一件事的成本,比單價更接近產品現實

低費率可以吸引團隊試用,但產品應比較的是「完成一件事花多少」,而不只是一百萬 token 的價格。一次錯誤分類可能造成重新寄信、人工查帳或客戶再次聯絡。這些費用不會出現在模型價格表,卻會出現在營運現場。當模型已經很便宜,後續失誤成本的重要性反而更高。

以文件查詢為例,成功需要找對文件、讀到正確版本、理解表格,最後回答使用者的問題。Haiku 只負責其中一部分。若搜尋工具提供的是過期文件,模型再快也可能產生錯誤答案。評估新模型時,固定前面搜尋結果並保留來源,才比較容易知道改善來自模型能力,還是資料流程恰巧變得更好。

企業可以把請求分成一般成功、重試成功、升級大型模型,以及人工處理四類。每一類都累計費用與時間,再以最終解決的工作數量計算平均成本。這樣纔看得出便宜模型是否只是把問題往後移。也能找出哪些工作適合一開始就交給較強模型,免得先嘗試便宜路線,最後反而多走一輪。

這種衡量同樣有利於使用者體驗。客服第一次回覆得快,卻答錯政策,使用者仍得花時間解釋。文件工具若立即回覆卻漏掉關鍵註腳,速度也沒有解決問題。把「快而正確」與「快但要重做」分開記錄,能避免產品只追逐漂亮的平均等待數字,而沒有改善人們完成工作的感受。

Haiku 5.5 不同思考設定的學術推理成本圖
官方學術推理圖顯示,同一模型增加投入後的改善幅度會隨測試而不同。 圖片來源:Anthropic。

快取降價,讓主模型與子代理一起受益

這次發布還同時調降 Sonnet 5.5 的快取讀取費率。快取是把重複使用的輸入內容保存起來,後續請求可以用較低費用再次讀取。它特別適合有固定規則、相同專案背景,或多輪工作持續使用同一段資料的流程。官方稱 Sonnet 5.5 的快取讀取單價減半,並估計多數代理工作成本約下降兩成。

團隊需要把這個變化與 Haiku 降價一起看。主模型若能便宜地重複使用專案背景,未必需要把所有工作都切得很碎。有些任務交接會增加資料整理與比對成本,留在主模型中反而更有效率。分工應根據工作是否容易獨立驗證,不能只按模型大小決定。

快取也有資料管理的含義。合約已更新,產品仍使用舊背景,就可能把過期條件帶入新答案。設計快取時要能辨識資料版本,讓政策修改後相關內容重新建立。價格下降提供更多使用空間,但它不會自動替團隊完成版本管理。這是從展示功能走向長期服務時,常被忽略的工作。

對預算較小的開發者而言,這波價格調整可以支持更多低成本實驗。更有意義的實驗是挑一個明確流程,記錄舊方案與新方案的差異,再逐步增加使用量。如果一開始就把所有請求換到新模型,事後很難追查某個答案變差的原因,也難以保留可靠的比較基準。

既有應用遷移,需要檢查輸出與權限

Haiku 5.5 已在 Claude Platform 與官方列出的雲端平臺提供,開發者可使用模型名稱 claude-haiku-5-5。不過,雲端服務的區域、帳戶權限與供應商設定,仍應依各平臺文件確認。已有的 Haiku 4.5 應用,可以先按 官方遷移指南 建立比較版本。

遷移時應保留舊任務的輸入、標準答案與工具條件。若舊服務要求模型回覆固定欄位,新模型產生更多說明文字,後續程式可能無法讀取。分類順序、資料格式與錯誤處理都屬於應用契約。模型評估成績較高,仍不能代替這些檢查,因為軟體流程需要的是正確而且可處理的結果。

官方指南還列出幾項會影響既有程式的變更。新版採用自適應思考,舊的思考 token 預算參數會回傳錯誤,取樣參數也需要移除。回應可能先出現思考區塊,因此程式應依區塊類型讀取答案。相同文字在新版通常會被切成更多 token,原本的輸出上限與費用估算也要重新計算。這些都是實際遷移項目,單純替換模型名稱可能無法完成升級。

涉及瀏覽器操作或外部工具時,權限也應跟著任務範圍走。查詢文件可以用唯讀工具,修改資料需要另外的明確動作界線。當執行費用大幅下降,團隊可能提高呼叫頻率,原本很少發生的錯誤也會更常被遇到。限制單次工作可操作的範圍,有助於把大量使用帶來的風險控制在可修復程度。

最適合先採用 Haiku 5.5 的工作,是輸入清楚、產出容易檢查,而且重複次數很多的任務。對高風險決策與複雜程式修改,則應維持較強模型或人工審查。這個分工會隨實測結果調整。當新模型能在自己的關鍵案例中穩定達標,擴大使用纔有可靠依據。

常見問題

Haiku 5.5 可以取代 Sonnet 或 Opus 嗎?

它適合承接摘要、分類與範圍明確的子任務。Anthropic 的發布資料仍把大型模型列為複雜程式代理工作的更佳選擇。企業應用自己的案例測試,再決定工作分配,尤其要觀察錯誤是否會流入後續重要決策。

官方說平均便宜百分之七十五,帳單也會同幅下降嗎?

未必。實際費用取決於提示詞長度、輸出量、快取、重試,以及是否升級到其他模型。官方平均值包含特定請求分佈與新版文字切分方式的影響。固定工作量後比較最終成功成本,才接近實際帳單變化。

一般使用者最可能感受到什麼?

如果產品善用低成本模型,常見查詢與文件小任務可能更快,服務也有空間處理更多資料。這是產品設計可以達成的方向,不能只憑模型發布就保證每一款應用都變快。服務仍需要做好搜尋、來源引用與錯誤升級。

資料來源