ActiveSaddler 是什麼?讓 AI 代理練對題目,終端任務成功率提高 7.5 個百分點

ActiveSaddler 用失敗模式安排 AI 代理的練習課程,在論文的終端任務測試提高 7.5 個百分點。本文拆解動態課程、測試數字與實際應用,說明為何一直改提示詞,可能不如先改練習題。

Share
ActiveSaddler 依失敗模式調整代理練習課程的流程圖
ActiveSaddler 把反覆失敗分類,動態安排下一輪情境。圖/論文作者 圖片來源:https://arxiv.org/html/2610.00906

AI 代理一直出錯,問題可能不只在提示詞,也在你拿什麼案例讓它改進。Microsoft 與研究合作者提出的 ActiveSaddler,把反覆出現的失敗整理成不同類型,再動態安排下一批練習。在論文的 Terminal-Bench 2.0 測試中,它讓同一個流程最佳化方法的成功率提高 7.5 個百分點。

這項研究在 X 的 AI 社群被分享,吸引人的地方很像人類學習:已經熟悉的題目不用一直重做,困難題也不能毫無順序地硬塞。ActiveSaddler 會估計哪一種失敗還值得投入,兼顧補強已知弱點與尋找新的問題。它調整的是練習材料的安排,而不是推出一個新的大型語言模型。

對用 AI 操作電腦、查資料或處理工作流程的團隊,這個方向相當實際。當改了很多規則,整體成績卻停在原地,應先看看測試案例是否還能提供有效回饋。本文用白話說明 ActiveSaddler 的運作、實驗結果與限制,也整理一個可以借鏡的錯誤分類方式。

ActiveSaddler 依失敗模式調整代理練習課程的流程圖
ActiveSaddler 把反覆失敗分類,動態安排下一輪情境。圖/論文作者 圖片來源:ActiveSaddler 論文作者。

為什麼固定練習題會讓 AI 改進停滯?

AI 代理是一個能使用工具、執行步驟並完成任務的系統。它的外圍工作流程決定何時搜尋、怎麼檢查輸出、如何處理工具失敗。研究常用 harness 指稱這套規則與程式,流程最佳化就是依照任務表現,反覆修改這一層安排。

如果一直用相同順序的案例評估,每輪得到的回饋可能越來越少。簡單題已經穩定完成,仍占用測試預算。某一類難題雖然反覆失敗,卻可能因為模型能力或工具限制而暫時無法改善。新的錯誤類型沒有被抽到,團隊則可能誤以為現有流程已經十分成熟。

以電腦操作為例,代理可能早已學會開啟檔案,卻還不擅長從多個相似檔名找到正確版本。若練習題大部分都只測「能不能開檔」,修改提示詞時自然會收到很多成功訊號。這些成功不能證明它解決了版本辨識問題,反而可能掩蓋實際需要補強的部分。

固定題目也容易把不同失敗混在一起。一次任務沒完成,可能是看錯畫面、漏讀條件、工具回傳格式改變,或驗證步驟太弱。若只記錄成功與失敗,系統很難判斷下一輪該練什麼。ActiveSaddler 的起點就是把失敗變成可追蹤的模式,再依模式安排課程。

ActiveSaddler 如何把失敗變成動態課程?

依照原始論文,研究會整理反覆出現的 failure patterns,也就是失敗模式。它們代表一群具有相似問題的案例,而不只是某一題的編號。當代理流程改變,這些模式的難度與改善潛力也可能跟著改變。

接著,系統需要決定有限的預算應分配給哪個模式。論文採用非固定環境的多臂賭徒方法。這個名字來自一種選擇問題:有好幾個選項,每個選項的回報不完全清楚,你必須一邊嘗試,一邊決定下一次選哪個。在這裡,選項就是不同失敗模式,回報則與流程還能從中學到多少有關。

「非固定」尤其重要。剛開始十分有用的題目,等代理學會後,價值可能下降。某種錯誤也可能因為新流程而浮現,需要更多練習。ActiveSaddler 因此不是做一份難度由低到高的課表就結束,而是持續更新對各類題目的判斷。

其中一部分預算用來回頭補強已知弱點,另一部分用來探索未掌握的失敗。這兩種需求有時互相拉扯:全部補弱點,可能漏掉新問題。全部探索,則可能讓已知問題一直沒有完成修正。動態課程的目的,是在流程改善過程中重新分配這兩種投入。

這套安排並不表示系統能保證每個問題都有解。若一個任務需要代理沒有權限取得的資料,或工具根本無法執行必要操作,繼續練習也未必有效。失敗分類仍需要分清楚能力不足、流程問題與環境缺件,否則可能把不可能完成的任務當成普通弱點反覆訓練。

終端任務增加 7.5 個百分點,數字該怎麼看?

研究把 ActiveSaddler 與固定安排的 AutoSaddler 比較,讓流程最佳化方法保持一致,觀察調整案例安排是否有幫助。這樣的設計讓重點比較清楚:改進主要針對「下一輪用哪些情境提供回饋」,而不是同時更換模型、工具與評分方式。

論文測試 固定安排的比較方法 ActiveSaddler 差異
GAIA2 55.4% 59.8% 增加 4.4 個百分點
Terminal-Bench 2.0 72.5% 80.0% 增加 7.5 個百分點

GAIA2 與 Terminal-Bench 2.0 都用來測試代理完成任務的能力,但環境與任務內容不同。Pass@1 指的是一次嘗試完成的比例,與允許重試十次後有一次成功不同。這讓指標比較接近一次交辦的成果,仍不能代表所有正式工作都能一次完成。

研究報告多次執行的結果與變動範圍,也提供兩組測試的任務數。GAIA2 的測試有 300 項任務,終端測試有 40 項。任務數較少時,少數題目的變化就會明顯影響百分比,因此閱讀 80% 這個數字時,也要一起看測試規模與重複執行方式。

更重要的是,這些數字沒有承諾「所有代理都能提高七點五」。不同公司可能有不同工具、權限、資料品質與驗收條件。如果你的任務主要是整理格式,而研究情境主要需要多步工具操作,改善幅度可能相當不同。借用方法之前,應先用自己的任務建立基準。

ActiveSaddler 課程選擇機率隨最佳化輪次變動的熱圖
不同失敗模式獲得的練習比重會隨流程改善而調整。圖/ActiveSaddler 論文作者 圖片來源:ActiveSaddler 論文作者。

用 AI 報表助理示範:哪些失敗應分開記?

假設你要 AI 從試算表整理每月營收,再產生一份摘要。這是本文用來理解方法的示例,並非論文的實驗。相同的「報表錯了」,至少可能包含四種不同問題:讀錯月份、漏掉資料列、計算公式不對,以及說明文字和表格數字不一致。

讀錯月份需要練習辨識資料日期與檔案版本。漏列可能要改善篩選條件和列數核對。公式錯誤需要加入可重算的計算步驟。文字不一致則需要在產出後,把摘要數字再與表格逐項比對。如果把這四種失敗都叫作報表失敗,後續修改很可能沒有對準原因。

動態課程可以先集中在最常發生、也最容易得到有效回饋的問題。當日期辨識已經穩定,下一輪就把更多案例分配給公式與例外資料。若某個月新增退款欄位,又可以把新出現的資料理解問題納入追蹤。這種調整比永遠重跑同一份最簡單的表格,更容易反映真正的工作變化。

但不要只追求平均正確率。例如,讀錯月份雖然少見,卻可能造成整份報表的決策依據錯誤。公司可以為不同錯誤設定影響程度,並保留固定的關鍵案例。動態安排有助於善用預算,仍需要一套不被平均分數沖淡的最低驗收條件。

把研究思路用到工作,先做好這四件事

先保留原始任務與失敗過程。只寫一句「AI 回答不好」很難重現,也無法知道規則修改是否真的有效。比較有用的紀錄包含輸入資料版本、預期結果、實際結果、工具回應,以及哪一步開始偏離。敏感資料可以遮蔽,重要的是保存能判斷問題的證據。

再把錯誤分類定得足夠具體。分類如果只是簡單、普通、困難,常會混合多種原因。可以先按資料定位、工具使用、條件理解、結果驗證分組,再看是否需要拆成更小的模式。不要一開始就分出幾十類,否則每一類都可能只有一兩個例子,難以估計改善趨勢。

接著,為每次流程改動保存版本。某個新規則修好了讀檔問題,也可能讓代理對簡單問題過度檢查。保留舊流程與題目成績,才能比較改善與退步。對會寫入外部系統的代理,版本紀錄還應包含操作權限,避免最佳化時無意間擴大可執行的行動。

最後,保留沒有參與調整的測試案例。這批資料應用來檢查真正的泛化,也就是新流程能否處理未用來練習的情況。若所有案例都曾進入改善循環,得分上升可能只是學會熟悉的題目。把測試留到後面,才有機會分辨方法變好與題目記熟。

這些步驟可以先用表格與現有測試工具完成,不必立即實作整套演算法。對小型團隊,先把失敗原因、改動版本與驗收結果連起來,就能少掉許多盲目修改。等案例與預算增加,再評估自動安排課程是否值得,會比先追求複雜的工具更務實。

動態課程與改提示詞、換模型有何不同?

改善方向 主要處理的問題 適合觀察的指標
改提示詞與流程 步驟不清楚、工具使用不當 同一批任務的成敗與錯誤類型
換模型 理解或推理能力可能不足 正確率、延遲與單次成本
動態安排案例 回饋重複、練習沒有對準弱點 每輪改善幅度與測試預算效率
加強驗收工具 答案看似完整卻沒有證據 可重算、可查證的完成比例

這些方法可以一起使用,卻應分開量測。若同時換模型、修改流程又更新題目,最後即使表現更好,也很難知道是哪一項帶來改善。ActiveSaddler 的研究價值之一,就是讓課程安排本身成為可以比較的變數。

對管理者來說,它也提醒了一件事:測試資料不是一次整理完就永久有效。產品功能、資料格式與使用者需求都會變,練習材料也需要更新。如果一套代理已經熟悉舊任務,新的評估應能讓它暴露新弱點,而不是只證明它仍然會做昨天學會的事。

常見問題:AI 會自己決定練什麼嗎?

ActiveSaddler 有重新訓練大型模型嗎?

這篇研究聚焦於代理工作流程的最佳化課程。它讓情境安排隨失敗模式改變,配合流程改進器使用。讀者不應把這個結果理解為 Microsoft 發布了一個參數更新後的新聊天模型,或只要使用現有聊天服務就會自動套用相同方法。

是不是只挑最難的題目就好?

不是。最難的題目可能需要新的工具、資料或模型能力,持續投入不一定帶來進步。課程安排還要考慮目前可以學到什麼,以及是否需要探索新的錯誤。某些中等難度的案例,反而可能提供更清楚、可採取行動的回饋。

一般人如何開始借用這個概念?

可以先選一項重複工作,整理近期失敗並分類,記錄每次修改後哪些類型改善。保留一批固定驗收案例,再逐步把練習重心轉向尚未解決的問題。這是借用研究的學習原則,並不是聲稱簡單表格能重現論文的數字。

結語:讓 AI 改進,也要讓測試跟著進化

ActiveSaddler 提醒我們,反覆改規則並不是唯一值得優化的地方。代理需要有效回饋,而有效回饋取決於下一輪遇到什麼情境。把失敗整理成模式,再動態平衡補強與探索,讓流程最佳化更像一段有方向的學習過程。

如果你已經花很多時間改提示詞,卻一直看到相同錯誤,可以先檢查案例安排與失敗紀錄。把原因寫清楚、把版本保存好、把未見過的測試留出來,再決定要怎麼自動化。研究中的七點五個百分點,最值得帶走的不是保證值,而是一個能改善工作的方法問題。

官方資料來源