Harness Learning 是什麼?AI 不改模型參數,也能從執行回饋改善工作流程

Harness Learning 訓練一個流程提案模型,讓 AI 根據執行回饋修改解題程式。本文解析提案者與解題者分工、測試時調整及研究限制,說明它和一般自我反省提示詞有何不同。

Share
Harness Learning 提案者與解題者分工示意圖
提案者利用執行回饋修改工作流程,解題者再按新流程執行。圖/論文作者 圖片來源:https://arxiv.org/html/2609.35738

AI 做完一次任務,能不能把失敗經驗變成下一次更好的工作方式?Harness Learning 研究給出一個具體方向:訓練另一個模型閱讀執行回饋,修改負責解題的代理流程。在處理新任務時,系統更新的是可執行的流程程式,模型參數可以維持不變。

這項研究近期在 X 引起 AI 開發社群討論。它關心的不是多問一次「你確定嗎」,而是把模型呼叫、工具安排與資訊傳遞的規則交給提案者改善。當一個任務需要不同的搜尋與檢查方式,流程就有機會依回饋調整。

這個想法聽起來像 AI 自我進化,實際範圍卻需要說清楚。論文測試的是指定任務、固定解題模型與可評分的執行回饋,沒有證明所有代理能無限制持續變聰明。本文會拆解訓練與使用時的差別,也說明為什麼有效的回饋,比一句自我反省更重要。

Harness Learning 提案者與解題者分工示意圖
提案者利用執行回饋修改工作流程,解題者再按新流程執行。圖/論文作者 圖片來源:Harness Learning 論文作者。

Harness 是什麼?模型周圍的程式也影響答案

Harness 可以理解為代理工作流程的可執行程式。它安排模型何時被呼叫、模型看到哪些資訊、工具如何使用,以及不同步驟的結果怎麼傳遞。相同模型搭配不同流程,可能產生不同的成功率與成本。

以資料問答為例,一條流程先搜尋文件,再回答。另一條先把問題拆成幾個子問題,分別搜尋,最後檢查答案是否與來源一致。模型沒有變,能取得的資訊與核對方式卻變了,結果自然可能不同。研究希望學會如何根據任務回饋選擇這些安排。

這和只改文字提示有相似之處,但修改範圍更廣。提案者可以調整可執行流程,讓某個步驟多查一份資料,或把結果先整理再交給解題者。對需要多步工作的代理,程式結構往往和提示詞一樣重要。

因此,評估 AI 能力時也應看整個系統。某個模型在特定流程中表現差,可能來自工具使用方式不合適。另一個高分流程也可能使用更多工具與運算。把模型、流程與成本一起記錄,才容易理解改善究竟來自哪裡。

提案者與解題者,分別負責什麼?

原始論文把角色分成 proposer 與 solver。提案者根據目前流程和執行結果提出修改,解題者則使用修改後的流程完成任務。這讓改善方法與實際解題成為可以分開觀察的兩件事。

訓練提案者時,研究會看新流程的任務表現,作為回饋。強化學習是一種依結果回饋調整行為的訓練方法,在這裡用來鼓勵更有用的流程修訂。它不只獎勵程式看起來合理,而是希望修改能改善實際執行成果。

到了新任務,提案者可以讀取回饋,再修改流程,解題者重新執行。這個階段沒有做模型參數更新,與一般重新微調模型不同。微調會改變模型內部參數,流程修訂則改變模型如何被使用,兩者的成本與部署條件不同。

研究把這種能力放在學習如何學習的脈絡中。提案者在訓練階段學到修改方法,再把方法用到未見過的任務。真正值得觀察的是它能否提出有幫助的新修訂,而不是只對熟悉的題目記住固定流程。

角色或階段 做的事情 改變的部分
提案者訓練 學習提出有效流程修改 提案模型的行為與參數
解題者執行 按流程處理任務 產出與工具使用結果
新任務調整 根據回饋再次修訂流程 可執行的工作安排
一般模型微調 以資料更新模型 模型內部參數

這個區分也避免一種常見誤讀:測試時沒有更新參數,不代表整個方法從未訓練模型。提案者事先接受了訓練,才能比較有效地修改流程。使用時的彈性建立在前面的訓練與設計之上,不是免費出現的自我改善能力。

執行回饋為什麼比「再想一次」更有用?

回饋必須提供可以判斷的資訊。若系統只收到一句「不好」,提案者很難知道是搜尋失敗、答案格式錯誤,還是推理方向不對。可用的回饋可能包含任務得分、工具回應、錯誤訊息與中間成果,讓修改有具體依據。

以跨文件問答為例,問題可能需要同時讀兩份資料。如果流程只搜尋一次就回答,失敗原因可能是缺少第二份證據。提案者可以改成先列出需要的資訊,再分別搜尋。這是本文的示意例子,並非論文聲稱所有文件任務都已自動找到最佳流程。

另一個例子是輸出格式。代理可能已找到正確資料,卻把日期寫成不符合系統要求的形式。這種情況增加搜尋沒有幫助,應改善整理與驗證步驟。不同錯誤需要不同修訂,顯示回饋品質會直接影響學到的改善方式。

回饋也可能有誤。如果評分器把冗長回答當成高品質,提案者可能學會增加無用文字。如果測試只看檔案是否存在,流程可能建立空檔案就得到高分。任何自動改善機制,都需要先確認評分反映真正的完成條件。

Harness Learning 訓練與測試時流程修訂架構
研究區分提案者訓練與新任務上的流程調整。圖/論文作者 圖片來源:Harness Learning 論文作者。

論文測試了哪些任務?

研究包含 Reasoning Gym 與多步問答兩種設定。Reasoning Gym 提供多樣的合成推理任務,讓研究者觀察提案者能否把修訂能力帶到訓練沒有包含的任務類型。多步問答則需要整合不只一段資訊,適合檢查搜尋與資訊組織的流程。

在推理設定中,研究使用 Qwen3.5-4B 作為提案者與解題者,並安排監督訓練與強化學習階段。4B 表示模型約有四十億個參數,是模型規模的描述,不是任務成功率。問答設定則採用不同規模的提案與解題模型,不能把兩組結果混成同一場測試。

論文報告未見任務上的平均修訂表現,推理設定的平均分數由基礎提案者約 0.32 提高至強化學習後約 0.62。這個分數屬於指定任務與評估方式,不能讀成所有真實工作準確率從三十二變成六十二。更重要的是,改善也出現在多個提案的平均值,不只在事後挑出的最佳版本。

研究還比較一次修改與多輪修訂。多輪可以根據新的執行結果繼續調整,但訓練多輪修訂的收益在不同設定中並不一致。這表示「多跑幾輪」不是必然更好的答案,需要看回饋、預算與流程是否有穩定改善。

看懂最佳候選分數,避免把研究上限當日常表現

論文中的部分圖表提供 oracle best-of-N,也就是利用保留測試分數事後挑選最佳候選。這種做法能觀察候選中是否存在很好的流程,卻不等於正式使用時就能知道哪一個最好。沒有標準答案的任務,往往需要另一個選擇機制。

例如一次產生八個流程,其中一個答得很好,其他七個普通。如果只展示最佳分數,讀者可能以為使用者每次都能拿到最佳版本。實際部署需要解決如何選擇,以及選擇要花多少成本,否則成果可能接近平均而不是最佳。

研究也使用開發資料決定是否保留修訂,再以其他問題評估。開發資料用來調整方法,保留測試用來檢查新情境表現。兩者分開,是避免方法只記住練習題的重要設計。閱讀結果時,最好一起看選擇依據與最終評分資料。

這些細節不會讓研究失去價值,反而讓它更容易正確理解。它證明了訓練提案者可以改善修訂品質,也探索了連續調整的可能性。要走到沒有標準答案的正式工作,仍需要可靠的選擇、評分與驗收程序。

如果用在公司工作,應先讓哪些東西可驗證?

先定義完成條件。若任務是整理報表,應能重算總額並核對來源。若任務是修復程式,應有能重現問題的檢查。可執行的驗收比「看起來不錯」更容易提供穩定回饋,也更能限制流程最佳化走偏。

再保存每一版流程與修改原因。當新流程表現退步,團隊需要知道它增加了什麼工具、刪了哪個驗證,以及使用哪些案例作決策。只留最高分版本,會失去理解失敗的證據,也不容易回復到已知可用的安排。

接著限制可修改範圍。提案者能改善步驟,不代表應自行增加讀寫權限。對會操作外部系統的代理,資料存取與實際寫入能力應由應用控制。流程生成之後,仍需要檢查它是否符合允許的操作條件。

最後計算完整成本。產生多個修訂、執行測試與比較結果,都會使用運算與工具資源。如果工作只做一次,最佳化成本可能高於收益。如果同一流程會處理大量相似任務,前期投入才比較可能被後續改善抵銷。

與一般自我反省、多代理審查相比

一般自我反省提示詞會請模型重新檢查答案,有時能發現問題,有時只是改寫原本的說法。Harness Learning 將改善目標放在可執行流程,並以訓練讓提案者學會有用的修訂。它需要更多系統設計,也能提供更明確的修改對象。

多代理審查則讓另一個角色檢查成果,重點通常是評估答案或提出意見。若審查者只有文字評論,仍需要有人把意見轉成流程改動。Harness Learning 嘗試連起這段工作,讓執行回饋能直接推動下一版程式。

方式 改善目標 主要條件
自我反省提示 當次答案或說明 模型能辨識自己的錯誤
多代理審查 成果與論證 審查標準與角色資訊可靠
流程修訂 工作步驟與工具安排 回饋可驗證,修改可執行
模型微調 模型本身的行為 訓練資料與運算資源

選擇哪一種,應看問題發生在哪裡。若資料根本錯誤,反省與流程修改都可能繼續使用錯資料。若關鍵是少了一個計算核對步驟,改善流程就可能比換更大的模型更直接。先辨識失敗原因,才能讓方法對準問題。

常見問題:AI 真的能一邊工作一邊學嗎?

沒有更新參數,也算學習嗎?

研究把新任務上的流程修訂視為一種適應方式。模型內部不變,外部工作安排可以根據回饋改進。它與模型參數訓練是不同層次,因此最好明確說「流程適應」,避免讓讀者以為每次聊天都會永久改變模型。

多改幾次就會一直進步嗎?

不一定。回饋不準、候選品質不足或流程過度複雜,都可能造成退步。論文也指出不同訓練設定的多輪收益有差異。實際使用應保存基準與停止條件,不能只因系統還能提出修改,就無限持續執行。

一般聊天工具已經有這套方法嗎?

不能從研究論文推出所有工具都已實作。一般使用者可以借用它的原則:保留失敗證據,修改具體步驟,再用未參與調整的案例檢查。要重現論文方法,仍需要提案者訓練、執行環境與評估設計。

結語:把經驗變成流程,才有可追蹤的改善

Harness Learning 把 AI 改進從一句「再想一次」,推向可以執行、比較與保存的流程修訂。它訓練提案者使用回饋,在新任務上改變工作安排,讓固定模型也有機會以更合適的方式處理問題。

如果你正在建立代理,可以先問:失敗能否重現?結果能否驗證?修改能否比較?當這三件事清楚,流程改善才有可靠的方向。研究提供了新的方法,真正的工作價值仍要由自己的任務、成本與驗收證明。

官方資料來源