AI 更強也更貴?看懂能力與任務成本曲線,別把排行榜當採購單
最高分與最低成本未必是同一個模型。從能力成本動態圖理解取捨,再用有效任務成本衡量自己的工作。
AI 模型更新很快,每次看到排行榜換人領先,都容易產生「現在就應該換模型」的衝動。Artificial Analysis 在 X 分享的能力與任務成本動態圖,把另一個問題放回視野:能力提高時,我們付出的成本如何變化?這則貼文比較過去十八個月的曲線,本次採集時有接近五百個喜歡與超過兩萬次瀏覽,適合用來理解模型選擇的取捨。
貼文舉出兩個時間點:一年前,當時分數最高的 GPT-5 mini(high)在 v4.3 指標口徑下得十七分,平均每項指標任務成本約零點零五美元,截至貼文所說的上週,Claude Opus 5.5 創下五十八分,任務成本約五點九八美元。這兩個點同時涉及能力、模型、時間與成本的變化,不能直接寫成「同一項工作變貴一百多倍」,也不能倒過來寫成「AI 已便宜一百多倍」。
我的看法是,這類圖最適合拿來縮小候選範圍,再回到自己的工作做驗證。企業需要的是能以合理成本穩定完成任務的模型,而最高分、最低單位價格與最快回答,未必落在同一個選項上。先定義可接受的結果,再比較總成本,通常比追著排行榜換工具更有用。
先認識 Pareto 前緣:同時比較能力與成本
Pareto 前緣可以理解成「目前沒有其他候選項,在這兩個指標上同時比它更好」的一組選擇。假設有兩個模型,甲的能力較高、成本也較高,乙的能力較低、成本較低,兩者可能都值得考慮。若丙的能力比乙低、成本卻比乙高,在這個比較範圍內就缺乏明顯優勢。
這個概念能幫助讀者避免只看單一排行。橫軸是成本、縱軸是能力時,你可以先排除明顯被其他選項壓過的點,再根據需求選擇適當位置。它不會替你決定應該花多少錢,也不會把資料保護、部署地區、回應速度或產品整合一起算進去。
圖上的前緣還依賴比較集合。若某個適合你的模型沒有被測試,它就不會出現在圖上,若成本計算方式或任務組成改變,點的位置也可能移動。因此「位於前緣」應理解為特定資料與條件下的結果,不能延伸成全面優於所有其他產品。
對一般讀者,一個實用的閱讀順序是先看指標定義,再看模型設定與日期,最後才看點的位置。同樣的模型名稱可能有不同推理設定,較高設定通常會使用更多計算。把不同設定全部當成同一個價格與能力,容易讓比較失去意義。

任務成本與每百萬 token 價格,差在哪裡
模型價格表常以 token 計費。Token 是模型處理文字時使用的片段單位,並非每個字都一定對應一個 token。輸入、輸出、推理與快取可能有不同計費方式,因此價格表提供的是各類使用量的單位價格,不能直接告訴你完成一項工作要花多少錢。
Artificial Analysis 的方法說明,把任務成本建立在各評估的實際使用量與對應價格,再依指標權重彙總。資料包含輸入、快取命中、快取寫入、推理與回答等價格。這讓比較更接近「跑這組任務花多少錢」,也同時限制了它的適用範圍:你的工作若需要不同長度的資料、不同工具或不同重試方式,成本就可能不同。
可以用一個假設例子理解。模型甲每次呼叫較便宜,但完成一項任務平均要重試三次,模型乙每次呼叫較貴,卻能一次完成。最後的費用可能接近,也可能由乙更低。若甲經常需要人員補救,還要加上人工時間。這個例子只是說明計算方法,並非本文對任何特定模型的實測結果。
快取也需要看使用情境。快取是重複使用先前已處理內容的方法,在符合服務條件時可能降低部分費用或時間。若你的工作每次輸入都不同,就不能假設會有同樣收益,若大量任務共用一份長檔案,則值得確認快取規則。只比較一般輸入價格,可能漏掉實際成本中的重要差異。
十七分到五十八分,不能讀成答案正確率
綜合能力指標把多種測試結果按方法彙總,用來比較模型在一組任務上的表現。十七分與五十八分並不表示「答對十七趴」與「答對五十八趴」,也不能把分數比例直接換算成工作效率倍數。理解這一點,才能避免把綜合排行榜寫成不支援的效果承諾。
Artificial Analysis 的 v4.3 更新加入或調整代理與程式相關評估,並說明不同類別權重。這意味著綜合分數的變化可能反映多項能力的提升,而使用者實際需要的可能只有其中一小部分。公司若主要整理短檔案,未必能從高難度程式任務的提升獲得相同收益。
模型設定也影響表現。貼文中的 high 是推理投入設定的一部分,不能省略後再拿去與其他設定下的價格比較。推理投入較高,可能讓模型花更多步驟處理問題,它是否值得,取決於任務難度與失敗成本。簡單分類工作如果已經能穩定完成,就未必需要最高設定。
時間點同樣重要。九月七日的 v4.3 官方文章與九月下旬的 X 貼文,是不同日期的資料。本文以貼文所列的兩個端點解釋趨勢,以方法頁理解指標,沒有把較早文章中的排名當成九月三十日的最新完整排行。看到類似比較時,應保留日期與版本,才知道結論依據哪一張快照。
分數提高,為什麼完整工作仍可能失敗
企業工作常由多個相依步驟構成。整理客戶需求可能需要先讀資料、找出條件、產生檔案,再核對結果是否符合要求。即使大部分步驟成功,只要漏掉一個必要條件,整體工作仍可能不合格。綜合分數無法直接告訴你每一條工作流程的完整成功率。
官方方法對代理工作流程的評估,區分完成部分目標的分數與全部目標都完成的比例,也把違反護欄的情況納入計分。護欄可以理解成任務中不能違反的限制,例如不得修改指定資料或不得執行未授權操作。這種區分很實際,因為「做了很多事」與「完成正確的工作」之間可能有落差。
採購時,可以借用相同思路,把任務寫成明確的完成條件與不可違反條件。以整理訂單報表為例,完成條件可能是所有指定欄位都正確,限制則可能是不能更動原始資料。若模型填好九成內容,卻把來源檔案改掉,就不應只記錄高完成度而忽略這項失敗。
這也解釋了為什麼能力提升不一定立刻消除人工檢查。流程越長,越需要確認中間狀態、保留操作紀錄與安排失敗回復。模型可以承擔更多步驟,人仍要判斷哪些結果能自動接受、哪些需要抽查,以及哪種錯誤必須立即停止。
選模型之前,先把自己的任務分層
比較合理的第一步,是把工作分成簡單可核對、需要推理,以及失敗成本高的幾類。短文字分類、固定格式轉換與公開資料整理,通常比較容易設計驗證方式,多步驟推理或跨工具操作,則可能需要更多能力與控制。這只是評估起點,仍要用實際資料確認。
每一類都準備少量具有代表性的任務,包含一般案例與容易出錯的邊界情況。不要只選最乾淨的資料,否則測試結果會過度樂觀。比如檔案可能有缺欄、重複、互相矛盾或格式變化,這些條件才接近日常工作。測試資料也應符合公司的使用與資料處理要求。
接著比較兩到三個候選模型與合理設定,記錄一次完成、重試、人工修改與總費用。若較便宜的選項已滿足要求,就有理由先使用它,若失敗多到抵消成本優勢,再評估更強的選項。這樣的選擇依據來自任務結果,也比較容易對主管解釋。
可以在正式擴大前設定一個停止條件。例如出現資料越權、無法核對的來源或不可回復的修改時,暫停自動流程,回到人工處理。停止條件能讓團隊知道何時應介入,避免為了維持自動化率而接受不可靠的結果。
算總成本時,把人員與重試放進去
有效任務成本可以用「總投入除以可接受完成數」理解。總投入包含模型費用、工具費用與必要人工處理時間,可接受完成數則依事先定義的標準判斷。這比單看每次呼叫費用更接近企業實際付出的代價,也能比較不同方案的價值。
假設一個方案每百次呼叫便宜很多,但其中二十次需要人工修正,另一個方案只要處理少數例外。若工作量很大,人工差異可能成為主要成本。反過來,若每次結果都能快速自動驗證,便宜模型的優勢就可能很明顯。關鍵在於驗證與補救需要花多少時間。
回應時間也有成本。面向使用者的服務若讓人等得太久,可能增加中途離開或客服詢問,背景批次工作則可能較能容忍等待。相同模型在不同流程裡,最適設定可能不同。不要把一個團隊使用最高推理設定的經驗,直接推廣到所有工作。
最後還要考慮整合與維護。模型更換可能需要修改提示、重新驗證格式、確認工具相容與調整失敗處理。若每週都因榜單更新而切換,維護成本可能吞掉價格收益。只有當新選項在自己的任務上帶來明確改善,才值得安排切換。
Artificial Analysis 官方動態圖影片,呈現十八個月的能力與任務成本前緣變化。 影片來源:Artificial Analysis 官方 X。
官方動態圖,適合看趨勢與候選範圍
這篇搭配 Artificial Analysis 原始影象與動態圖影片,讓讀者直接看見能力與任務成本位置隨時間改變。它是一個對評估資料的視覺化呈現,並非某家企業的實際帳單,也沒有替所有部署方式計算成本。把它當成選擇候選模型的起點,會比當成採購結論更合適。
圖上的點向更高能力或更低成本移動,可能代表新模型、不同設定或價格變化。要理解某次變化,應檢視對應資料與方法,不能只憑動畫猜原因。尤其在任務組成或評估版本改變時,跨期比較必須確認是否採用一致口徑。
實務上,可以把當期候選模型與自己的測試結果一起儲存。未來排行榜更新時,先確認哪些任務仍有問題,再挑對應的新選項重測。如此可以把追蹤科技新聞轉成有目的的改進,減少因新名稱或高分而反覆更換工具。
常見問題
前緣上的模型就是最適合我的嗎?
它在圖中比較的能力與成本指標上具有某種優勢,但你的需求還可能包含速度、資料處理、部署與整合。應把圖用來縮小範圍,再做自己的任務測試。
為什麼每百萬 token 很便宜,帳單還是高?
總費用受到輸入長度、輸出、推理、快取與重試次數影響。多步驟流程可能呼叫模型很多次,因此需要按完成一項工作所用的全部資源計算。
能力分數從十七到五十八,表示效率增加三倍以上嗎?
不能這樣換算。綜合分數由多項評估彙總,並非時間或完成量的直接倍數。實際效率要看你自己的工作流程、成功率與人工介入。
先決定什麼叫完成,再選付得起的模型
Artificial Analysis 的動態圖提醒我們,模型能力與成本必須一起看。最高分的選項可能適合困難任務,便宜的選項也可能足夠完成日常工作。兩者都需要放回具體情境判斷。
選模型時,先寫出完成條件與限制,記錄成功、重試與人工成本,再決定是否升級。當模型可以穩定交付你需要的結果,且總投入合理,排行榜上的位置才會轉化成實際價值。