Claude Haiku 5.5 發布:平均成本降約 75%,便宜模型如何改變 AI 工作分工?
Claude Haiku 5.5 正式發布,官方稱平均執行成本下降約 75%。本文深入分析短長提示詞費率、思考投入設定、子代理分工、快取降價與既有應用遷移條件,說明便宜模型何時值得採用。
AI 服務每天處理大量小任務時,模型便宜一點就可能改變整個產品的成本結構。Anthropic 在 2026 年 10 月 7 日推出 Claude Haiku 5.5,主打快速、低價與大量重複工作,並把可調整思考投入程度的設定帶進 Haiku 系列。對企業與開發者來說,這次發布最有價值的問題,是哪些工作可以交給它,以及何時仍該使用較大的模型。
這個問題也關係到一般使用者的體驗。客服願不願意即時查資料、文件工具能不能讓每一頁都被處理、程式助理是否可以多找幾個檔案,常常受每次呼叫的費用與等待時間限制。Haiku 5.5 把這些限制往下推,但採用它仍需要理解長提示詞費率、實際完成工作的成本,以及多模型分工帶來的新管理責任。
平均省下七成五,要先看提示詞長度
依 Anthropic 的發布說明,Haiku 5.5 相較 Haiku 4.5,平均執行成本約下降百分之七十五。官方也解釋這個數字包含不同長度請求的組合,以及新版文字切分方式造成的用量差異。它是特定工作組合的平均結果,不能直接乘上每一家公司的舊帳單。
模型費率的單位是 token,也就是模型把文字切成的計算單位。字數與 token 數並非固定比例,中文、英文、程式碼和表格會有不同用量。Haiku 5.5 對十萬 token 以內的提示詞,輸入與輸出單價分別為每百萬 token 零點一美元與零點五美元。超過這個門檻,對應單價升為零點五與二點五美元。
| 提示詞長度 | 每百萬輸入 token | 每百萬輸出 token | 每百萬快取讀取 token |
|---|---|---|---|
| 十萬 token 以內 | 0.10 美元 | 0.50 美元 | 0.01 美元 |
| 超過十萬 token | 0.50 美元 | 2.50 美元 | 0.05 美元 |
上述為官方 2026 年 10 月 7 日價格表。這種分段費率,讓短小而高頻的請求特別有吸引力。開發者若把整份知識庫、長篇聊天記錄與多個附件全部放入同一次請求,可能跨入另一個價格區間。對使用者而言,產品願意整理與挑選相關資料,比一味塞入更多背景更有經濟意義。
以下是單純說明單價的假設試算。若十萬次請求,每次使用一千個輸入 token 與兩百個輸出 token,而且全部落在短提示詞區間,不含快取、工具與重試,輸入費用約十美元,輸出費用約十美元。這不代表一套客服服務只要二十美元,因為資料搜尋、外部系統、監控與人工處理都有各自成本。它顯示的是模型呼叫可能不再是這類小任務最大的費用來源。
可調整思考投入,讓小模型也能分配工作預算
同一個模型可以用不同投入程度處理任務,這是 Haiku 5.5 的重要改變。官方稱它是第一個提供可調整 effort 設定的 Haiku。這個設定讓開發者在成本與能力之間取捨,適合把工作分成急迫的小事,以及需要多一點分析的問題。提高設定的效果仍要透過自己任務的測試確認。
例如,辨識一封信應該交給帳務或技術客服,通常只需要讀懂信件與幾項分類規則。整理一位客戶過去半年的爭議,並判斷哪些承諾尚未履行,則可能需要跨文件比對。兩件事都叫「處理客服資料」,但適合的投入程度不同。讓它們使用同樣預算,會讓簡單工作多花錢,也可能讓複雜工作拿不到足夠資源。
文章的判斷是,這種設定有助於把模型能力當成可以分配的工作資源。不過,設定名稱本身無法告訴開發者答案是否可靠。若回覆碰到退款規則、特殊合約或資料矛盾,產品仍要有升級處理的方法。可調整投入程度解決的是模型運算配置,業務責任與判斷標準仍由產品團隊決定。
這也改變了測試方式。團隊可以固定一組真實任務,比較不同設定的完成率、等待時間與單次成功成本。假如提高投入只讓回答更長,卻沒有減少漏讀合約條件,增加費用就缺乏理由。若它能明顯降低錯誤,則可以把高投入限縮在這類問題,避免整個產品都使用同一個昂貴設定。

小模型適合做明確工作,大型程式任務仍有差距
Anthropic 把摘要、對話壓縮、資料庫查詢與分類列為 Haiku 5.5 的主要工作,也提到它可搭配 Opus 5.5、Sonnet 5.5,擔任程式工作中的子代理。子代理就是主工作流程交出去的一項獨立任務,例如搜尋一個檔案、整理一份報表,完成後再把結果交回主流程。這種分工讓小模型的價值更具體。
官方公佈的程式工作評估也保留了大小模型的差距。Terminal-Bench 4.0 測試需要在命令列完成多步驟工作,Haiku 5.5 的成績為百分之三十九點二,Sonnet 5.5 為百分之七十點六。這些是供應商公佈的測試結果,測試方法與細節可在 Haiku 5.5 系統說明 查看。它們支持分工方向,卻不能直接預測某個專案的成功率。
假設一個程式助理要修正跨三個模組的問題,可以讓主模型負責理解影響與決定改法,再讓 Haiku 尋找相關呼叫位置或整理測試輸出。搜尋任務若有清楚範圍,產出也容易檢查。相反地,把架構決策、權限設計與正式部署全部交給同一個便宜子代理,就會把節省費用與增加失誤風險綁在一起。
小模型的普及也要求工作交接更清楚。主模型需要知道子代理看過哪些檔案、使用哪個資料版本,以及哪些結果只是推測。若只收到一句「已找到原因」,後續決策可能建立在不完整資訊上。清楚的輸入範圍與可檢查的輸出,比把代理數量增加到很多更能提升實際工作品質。

完成一件事的成本,比單價更接近產品現實
低費率可以吸引團隊試用,但產品應比較的是「完成一件事花多少」,而不只是一百萬 token 的價格。一次錯誤分類可能造成重新寄信、人工查帳或客戶再次聯絡。這些費用不會出現在模型價格表,卻會出現在營運現場。當模型已經很便宜,後續失誤成本的重要性反而更高。
以文件查詢為例,成功需要找對文件、讀到正確版本、理解表格,最後回答使用者的問題。Haiku 只負責其中一部分。若搜尋工具提供的是過期文件,模型再快也可能產生錯誤答案。評估新模型時,固定前面搜尋結果並保留來源,才比較容易知道改善來自模型能力,還是資料流程恰巧變得更好。
企業可以把請求分成一般成功、重試成功、升級大型模型,以及人工處理四類。每一類都累計費用與時間,再以最終解決的工作數量計算平均成本。這樣纔看得出便宜模型是否只是把問題往後移。也能找出哪些工作適合一開始就交給較強模型,免得先嘗試便宜路線,最後反而多走一輪。
這種衡量同樣有利於使用者體驗。客服第一次回覆得快,卻答錯政策,使用者仍得花時間解釋。文件工具若立即回覆卻漏掉關鍵註腳,速度也沒有解決問題。把「快而正確」與「快但要重做」分開記錄,能避免產品只追逐漂亮的平均等待數字,而沒有改善人們完成工作的感受。

快取降價,讓主模型與子代理一起受益
這次發布還同時調降 Sonnet 5.5 的快取讀取費率。快取是把重複使用的輸入內容保存起來,後續請求可以用較低費用再次讀取。它特別適合有固定規則、相同專案背景,或多輪工作持續使用同一段資料的流程。官方稱 Sonnet 5.5 的快取讀取單價減半,並估計多數代理工作成本約下降兩成。
團隊需要把這個變化與 Haiku 降價一起看。主模型若能便宜地重複使用專案背景,未必需要把所有工作都切得很碎。有些任務交接會增加資料整理與比對成本,留在主模型中反而更有效率。分工應根據工作是否容易獨立驗證,不能只按模型大小決定。
快取也有資料管理的含義。合約已更新,產品仍使用舊背景,就可能把過期條件帶入新答案。設計快取時要能辨識資料版本,讓政策修改後相關內容重新建立。價格下降提供更多使用空間,但它不會自動替團隊完成版本管理。這是從展示功能走向長期服務時,常被忽略的工作。
對預算較小的開發者而言,這波價格調整可以支持更多低成本實驗。更有意義的實驗是挑一個明確流程,記錄舊方案與新方案的差異,再逐步增加使用量。如果一開始就把所有請求換到新模型,事後很難追查某個答案變差的原因,也難以保留可靠的比較基準。
既有應用遷移,需要檢查輸出與權限
Haiku 5.5 已在 Claude Platform 與官方列出的雲端平臺提供,開發者可使用模型名稱 claude-haiku-5-5。不過,雲端服務的區域、帳戶權限與供應商設定,仍應依各平臺文件確認。已有的 Haiku 4.5 應用,可以先按 官方遷移指南 建立比較版本。
遷移時應保留舊任務的輸入、標準答案與工具條件。若舊服務要求模型回覆固定欄位,新模型產生更多說明文字,後續程式可能無法讀取。分類順序、資料格式與錯誤處理都屬於應用契約。模型評估成績較高,仍不能代替這些檢查,因為軟體流程需要的是正確而且可處理的結果。
官方指南還列出幾項會影響既有程式的變更。新版採用自適應思考,舊的思考 token 預算參數會回傳錯誤,取樣參數也需要移除。回應可能先出現思考區塊,因此程式應依區塊類型讀取答案。相同文字在新版通常會被切成更多 token,原本的輸出上限與費用估算也要重新計算。這些都是實際遷移項目,單純替換模型名稱可能無法完成升級。
涉及瀏覽器操作或外部工具時,權限也應跟著任務範圍走。查詢文件可以用唯讀工具,修改資料需要另外的明確動作界線。當執行費用大幅下降,團隊可能提高呼叫頻率,原本很少發生的錯誤也會更常被遇到。限制單次工作可操作的範圍,有助於把大量使用帶來的風險控制在可修復程度。
最適合先採用 Haiku 5.5 的工作,是輸入清楚、產出容易檢查,而且重複次數很多的任務。對高風險決策與複雜程式修改,則應維持較強模型或人工審查。這個分工會隨實測結果調整。當新模型能在自己的關鍵案例中穩定達標,擴大使用纔有可靠依據。
常見問題
Haiku 5.5 可以取代 Sonnet 或 Opus 嗎?
它適合承接摘要、分類與範圍明確的子任務。Anthropic 的發布資料仍把大型模型列為複雜程式代理工作的更佳選擇。企業應用自己的案例測試,再決定工作分配,尤其要觀察錯誤是否會流入後續重要決策。
官方說平均便宜百分之七十五,帳單也會同幅下降嗎?
未必。實際費用取決於提示詞長度、輸出量、快取、重試,以及是否升級到其他模型。官方平均值包含特定請求分佈與新版文字切分方式的影響。固定工作量後比較最終成功成本,才接近實際帳單變化。
一般使用者最可能感受到什麼?
如果產品善用低成本模型,常見查詢與文件小任務可能更快,服務也有空間處理更多資料。這是產品設計可以達成的方向,不能只憑模型發布就保證每一款應用都變快。服務仍需要做好搜尋、來源引用與錯誤升級。