ServiceNow AutoSynthData:從 AI 代理的失敗,產生真的能執行的訓練題目

ServiceNow 公布 AutoSynthData,從企業代理的能力缺口產生訓練任務,並驗證正確與錯誤結果。本文整理流程與實驗數據,說明生成資料為什麼不能只看數量。

Share
ServiceNow AutoSynthData 官方發布圖片。
ServiceNow CoreAI 官方 AutoSynthData 發布圖片,方法從代理能力缺口產生訓練任務。 圖片來源:https://huggingface.co/blog/ServiceNow-AI/autosynthdata

ServiceNow CoreAI 在 2026 年 10 月 2 日介紹 AutoSynthData,這是一套從 AI 代理失敗情況產生訓練資料的流程。它想處理的問題很具體:通用模型可能很會回答問題,卻不一定能在某家公司自己的工具和規則裡完成工作。

這則官方技術發布的價值在於說明,企業代理要進步,需要讓訓練題目對準實際工作,而不只是增加更多文字。

ServiceNow AutoSynthData 官方發布圖片。
ServiceNow CoreAI 官方 AutoSynthData 發布圖片,方法從代理能力缺口產生訓練任務。 圖片來源:ServiceNow CoreAI 官方發布圖片。

先看代理在哪一步失敗

AI 代理是能使用工具並執行任務的模型流程。企業代理的工作可能需要查詢資料、修改系統狀態,再遵守公司自己的處理規則。

官方介紹說明,AutoSynthData 會在目標環境評估模型,找出做不好的任務,再用能力較強的教師模型協助判斷哪些任務有解、成功流程應該是什麼。

例如,一個代理會找到需要處理的案件,卻在更新狀態時遺漏必要條件。這是解釋能力缺口的示例,並非官方公布的一筆真實公司案件。有效訓練要讓它練習缺少的能力,而不是反覆回答已經擅長的問題。

題目需要同時有環境、需求與驗收

AutoSynthData 產生的任務包含系統規格、使用者要求與驗證器。驗證器是檢查任務是否完成的程式或規則。

官方強調,題目必須可執行、接近真實需求,又能挑戰目標模型。如果環境裡沒有需要的工具,或者規則禁止所有解法,即使題目看起來合理,也沒有訓練價值。

這點和一般練習題很像。要求學生查一本不存在的書,不能用來判斷查資料能力;讓代理執行不存在的操作,也無法有效訓練工作流程。

不只讓正確答案通過,也讓錯誤結果失敗

流程會執行參考解法,確認它真的完成了任務。接著還會改動預期結果,檢查相關錯誤是否被驗證器拒絕。

這兩種檢查各有目的。正向驗證避免題目與答案彼此矛盾,負向驗證則避免驗收太寬鬆,讓沒完成工作的代理也被算成成功。

我認為這是整個方法最值得理解的地方。假如評分只看「有沒有改過資料」,模型可能學會改一個無關欄位來過關。驗收要檢查需求中的具體狀態,才能把訓練訊號對準正確行為。

從合格題目擴充,再看整批是否偏科

AutoSynthData 先建立並驗證核心題目,再產生不同實體、初始狀態與流程組合的變體。每個變體仍要經過同樣的執行和驗證,不能只因來源題目通過就直接納入。

官方也設計整批資料的檢查,觀察是否反覆出現少數任務、有沒有漏掉某種能力,以及哪些生成方向一直失敗。

這種做法試圖同時處理題目品質與資料多樣性。數量增加如果只是重複相近題目,未必能讓模型學會新情境。模型進步後,下一輪也會重新找它還做不好的地方。

實驗改善要放回原本的環境

在 EnterpriseOps Gym 的 Hybrid 實驗中,團隊用 Gemma-4-26B-A4B-it 當目標模型、Qwen3.8-27B 當教師,約 18 小時產生 2,000 個訓練樣本。

官方報告,訓練後平均 Pass@1 提高 7.2 個百分點,相對改善為 35%。Pass@1 是第一次嘗試就完成任務的成功率。兩個數字表達不同方式,不能把相對改善寫成成功率增加 35 個百分點。

另一個 ITSM 環境的平均 Pass@1 從 18.77% 提升到 27.18%。這些結果支持方法在所測環境有幫助,不能直接承諾任何公司的流程都會有同樣改善。

常見問題

AutoSynthData 是給員工聊天的產品嗎?

官方介紹的是企業代理訓練資料生成流程,包含環境執行、題目驗證與後續訓練。

教師模型說答案對,就足夠嗎?

流程還會在目標環境執行參考解法,並測試錯誤結果能否被拒絕。文字判斷不能代替實際驗收。

已證明在所有企業都有效嗎?

官方實驗使用 EnterpriseOps Gym 的指定環境。新公司的工具、規則與資料狀態,仍需要個別評估。

結語:好資料要能驗收

AutoSynthData 提醒我們,訓練企業代理的重點是建立貼近工作、可以執行、又能可靠驗收的任務。模型失敗可以告訴團隊該練什麼,但還要把這些訊號轉成合格題目。

我會特別關注環境與驗證器是否忠於真實需求。當正確解法能通過、相關錯誤會失敗,訓練資料才比較有機會教出實際可用的能力。

官方資料來源