OpenAI 與 Ironclad 測試 AI 操作企業軟體:11 項任務仍需人工把關
OpenAI 與 Ironclad 用 11 項企業軟體任務評估電腦操作能力。本文解釋 GPT-6 Astra 的 55% 平均評分、估計時間與研究限制,避免把指標誤當完整成功率。
OpenAI 在 10 月 6 日公佈與合約管理公司 Ironclad 的研究,測試 AI 透過電腦介面操作企業軟體的能力。研究包含 11 項任務,涵蓋合約流程設定、核准條件與條款相關操作。
這份研究提供了一個較貼近日常企業工作的觀察方式:模型不只回答問題,還要在軟體中完成多個步驟。結果顯示能力進步,但也清楚呈現目前仍需人工監督的部分。
11 項任務都有分項評分條件
Ironclad 團隊設計任務,並為每項建立約 8 至 50 個評分條件。研究使用公開的美國證券交易委員會合約資料建立情境,沒有使用客戶資料。
這種評估會檢查任務中的不同要求是否完成,例如設定是否正確、規則是否符合需求。平均得分能呈現完成程度,卻不是把每項任務簡單分成全部成功或全部失敗。

55% 是平均評分,不是完整成功率
公開比較中,GPT-6 Astra 的平均評分是 55%,GPT-5.6 Sol 為 41.6%。前者相對高約 32%,但兩個分數相減是 13.4 個百分點,這兩種表達不能混用。
研究也使用不同的推理設定:Astra 採 Max,Sol 採 High。因此,結果反映這組測試配置下的表現,不宜直接延伸成所有設定、所有軟體或所有企業流程都能得到相同提升。
完成時間是研究估計值
報告列出 Astra 約 19.2 分鐘、GPT-5.6 Sol 約 37 分鐘的估計單次嘗試時間,約減少 48%。這是兩個模型的比較,不是拿 Astra 與人工比較,也並非大量客戶上線後量測的平均結果。專家另估計,熟練使用者完成一項任務約需 30 至 40 分鐘。
速度與正確性也要一起閱讀。即使模型完成操作較快,仍可能漏掉分項要求。若後續必須由人檢查與修正,實際節省時間就會受到影響。
操作企業軟體需要保留人類判斷
合約流程涉及核准政策與業務規則,錯誤設定可能影響後續作業。研究強調人工監督仍然重要,企業不能只因為看到能力提升,就直接讓模型獨立處理所有正式流程。
我的看法是,這類分項評估比一段順利的示範更有參考價值。團隊能據此選擇範圍清楚、結果容易核對的任務,再逐步建立檢查方式。平均評分仍在 55% 的結果,也提醒匯入需要保守界定責任。
電腦操作讓模型面對真正的工作順序
一般聊天任務主要處理文字,企業軟體操作則需要在不同畫面之間移動,填寫內容並確認結果。一個步驟錯了,後面的狀態也可能改變,因此評估不能只看最後回答是否流暢。
Ironclad 的研究將工作轉成具體任務,並由熟悉業務的人定義條件。這樣模型需要符合實際規則,而不是只做出一段看起來像操作的示範,評估也能指出完成與遺漏的部分。
對企業而言,這種方法比只問模型「會不會用軟體」更有用。真正問題是某一項工作在指定條件下能完成多少、哪裡需要檢查,以及錯誤會帶來什麼後果。
我會把這份研究當成任務設計參考。它展示瞭如何讓工作更接近可量測物件,但並沒有證明所有企業軟體都能由代理獨立處理。
分項條件能把部分完成與全部合格分開
每項任務包含約八至五十個條件,意味著一項工作可能完成某些部分、遺漏其他部分。平均評分可以描述整體表現,但關鍵條件的重要性可能不同,不能只看總分決定是否採用。
例如一個設定任務可能同時要求名稱、規則與核准路徑正確。即使多數字段完成,若關鍵規則錯誤,仍可能不適合正式使用。這裡是理解評分的假設情境,不是報告中某個任務的完整清單。
企業做自己的評估時,可以先區分必須正確的條件與一般品質條件。前者決定是否能交付,後者幫助比較不同版本。清楚分類會比把所有專案平均後只看一個數字更貼近工作。
我認為分項方法的價值,是讓人知道該接手哪裡。模型不必被簡單貼上成功或失敗標籤,團隊可以看到具體能力,也能保留對重要錯誤的判斷。
55% 與 41.6% 的差異,要用正確單位表達
兩個平均分數相減是 13.4 個百分點。相對於 41.6%,提升約 32%。這兩個數字描述同一組結果的不同方式,不能寫成提高三十二個百分點,也不能當成任務成功率。
比較時還要看條件。報告使用 Astra 的 Max 推理與 Sol 的 High 推理,是各自在這組任務中較好的設定。結果反映這個配置,而不是在完全相同計算條件下只換模型名稱。
因此,新聞可以說模型表現更高,但應保留評估範圍與設定。若讀者要套用到自己的系統,仍需要新的任務與條件,不能直接搬用研究分數。
我會優先看分數背後的工作與評估方式。一個比較數字有助於理解進展,只有知道它量測什麼,才能決定它對實際匯入有沒有參考價值。
19.2 與 37 分鐘比較的是兩個模型
報告的時間表將 GPT-6 Astra 估計每次嘗試約十九點二分鐘,與 GPT-5.6 Sol 約三十七分鐘比較。約四十八百分比的減少,來自這兩項模型估計時間,不是直接對人工工作計算。
專家另估計熟練使用者每項任務約需要三十至四十分鐘,這提供任務複雜度背景,但不能把三十七分鐘那一列改寫成人工實測。不同資料的角色必須分開,才能避免得到錯誤效率結論。
也應注意每次嘗試與完整交付不同。一次嘗試結束後,可能仍需要檢查、修正或重新執行。企業關心的總時間應包含這些部分,而不是只記錄模型停止操作的時間。
我的判斷是,速度進步值得看,但必須與評分一起閱讀。更快完成部分工作有意義,是否能省下團隊時間,則要把遺漏和人工接手也算進去。
合成任務與公開資料,幫助評估保留可討論範圍
研究使用公開合約資料建立情境,並沒有使用客戶資料。這讓報告能說明任務方向,同時避免把真實客戶工作直接當成公開測試材料,但情境仍與實際公司內部流程不同。
企業匯入時可能有自己的欄位、角色與政策。模型在研究環境表現較好,不代表換到不同配置後同樣可靠。自己的任務仍需要按照當前系統設計與驗證。
可以先選擇不影響正式資料的測試環境,準備代表性任務,再比較結果。本文提供的是評估建議,沒有要求讀者直接把正式合約或客戶資料交給模型操作。
我認為公開研究的價值,是讓外界看見方法與限制。它可以幫助團隊設計自己的測試,但不能替代對內部系統、資料要求與責任的確認。
業務規則要能被明確描述,代理才有檢查依據
企業工作常依賴組織習慣,例如什麼情況需要誰批准、哪些欄位必填,以及例外怎麼處理。如果規則只存在員工記憶裡,代理就很難知道什麼才算正確完成。
在評估前,可以先整理必要規則與完成狀態。描述應夠具體,讓人和系統都能檢查。例如需要某種核准,不應只寫「按照一般流程」,因為不同組織的一般流程可能完全不同。
如果規則仍在討論,就應先由負責人員決定,不能讓模型自行補完業務政策。代理可以幫助整理選項,但正式規則的依據必須來自組織,而不是模型推測。
我會把規則整理視為匯入準備的一部分。即使最後沒有采用代理,這份資料也能改善交接與檢查。採用之後,則讓評估與修正更容易對準真正需求。
人工監督應安排在能看清結果的位置
報告提醒目前仍需要監督。監督不是只讓人站在旁邊看模型移動滑鼠,而是知道哪些結果需要核對、哪些動作需要明確決定,以及發現問題後如何處理。
可以把重要設定與最終狀態整理成檢查材料,讓負責人員逐項確認。若代理只交回一句完成說明,人就需要重新進入軟體找證據,檢查成本可能很高。
也應保留修改前後狀態,方便理解變化。部分任務適合先產生草稿或測試結果,再由人決定正式套用。具體能否這樣操作,要依軟體與任務條件,不宜替研究中的所有流程作同等保證。
我認為好的監督會讓人更容易接手,而不是增加模糊等待。代理能清楚交回證據,團隊才有機會同時使用速度與保留正確性。
企業評估可從一項可複核的任務開始
先選擇規則清楚、結果容易檢視的一項工作,定義輸入與合格條件,再在相同環境比較人工和代理。記錄完成、遺漏、檢查與修正時間,會比只看一段示範更能支援決定。
如果關鍵條件經常失敗,就先縮小範圍或改善說明,不必直接擴大任務。若結果穩定,再增加不同情境,逐步確認能力邊界。這樣的評估方法能避免一次順利就產生過度信心。
也要保留失敗資料。研究與匯入都需要知道哪裡不可靠,只有成功案例很難判斷真實使用風險。明確失敗位置,反而能幫助設計更合適的人機分工。
OpenAI 與 Ironclad 的合作顯示模型操作複雜軟體正在進步。對我而言,最值得帶走的是任務、分項條件與監督方法,讓企業以自己的證據決定可以交給 AI 的工作範圍。
研究中的高分模型,不等於已經推出相同服務
報告也提到用於 Astra 開發的內部模型,平均評分更高。它說明研究仍在繼續,但不能據此推論一般使用者已經取得相同版本或相同能力。公開模型、內部研究與未來目標應分別閱讀。
對企業匯入者,選擇可用模型之後仍要固定設定與任務。研究數字可以提供背景,自己的結果才會決定是否適合當前軟體。把不同版本成績混在一起,容易讓預期超過實際服務。
也不應把研究合作當成某個完整企業產品已經普遍上線。公告描述合作、評估與後續方向,正式可用功能仍需要相應產品說明。新聞應保留階段,讓讀者知道哪些已經觀察到,哪些仍是計劃。
我會持續關注公開評估與實際工作證據。當模型能力提高,同時留下更多可核對材料,企業就更有機會建立合理分工,而不是只依一個更高分數擴大代理權限。
Ironclad 電腦操作研究常見問題
55% 代表 55% 的任務完全成功嗎?
它是依分項條件計算的平均評分,不能當成完整任務成功率。要判斷可否匯入,還需要看自己任務的合格條件與錯誤影響。
時間減少 48% 是客戶實際使用成果嗎?
這是研究情境中 Astra 與 GPT-5.6 Sol 的估計時間比較。它提供參考,但不等同某家公司正式匯入後一定能節省同樣比例,也不能直接當作相對人工的節省比例。
結語:先找能核對結果的任務
OpenAI 與 Ironclad 的研究顯示,AI 已能在複雜企業介面中完成部分多步驟工作。真正值得帶回團隊的,是分項評估與人工核對的方法,讓匯入決策建立在自己可驗證的結果上。