OpenAI LASER 發表:安全測試如何找到罕見難題,萬倍省算力又代表什麼?
OpenAI LASER 透過分類器與推理模型反覆抽樣,找到罕見的安全評估案例。本文深入解讀官方流程、決策邊界、多樣性抽樣、萬倍評分算力比較的分母,以及標籤品質、過度拒絕與導入評估的實務限制。
AI 安全測試最容易遇到的問題,是測了很多題,仍然沒有測到真正容易出錯的情境。一般問題回答得很流暢,不能證明模型能分清楚敏感議題中的合理請求與有害要求。當測試預算固定,選哪些對話讓模型作答,就會直接影響團隊看得到哪些弱點。
OpenAI 在 2026 年 10 月 6 日的 LASER 官方研究 中,介紹用反覆抽樣整理安全評估資料的方法。它先讓便宜的分類器挑選值得細看的對話,再交給推理模型判讀規則,逐輪修正抽樣方向。官方最醒目的說法,是在找到相近數量的禁止案例時,評分模型的算力需求可以比隨機抽樣少約一萬倍。
這項研究的價值在於提升測試題目的品質與取得效率。讀者需要分清楚三件事:對話被標為禁止、模型在該對話中真的回答錯誤,以及產品最終的安全程度。LASER 主要處理第一件事,讓後續評估更有機會碰到難題。把三件事合成一個宣傳數字,反而會錯過方法最有用的部分。
為什麼大量隨機測試,可能仍然漏掉重要問題?
假設一家教育服務要測試 AI 能否討論衝突事件,抽到的大部分對話可能只是正常作業提問。即使全部回答合格,也很難知道模型遇到模糊的求助、角色扮演或危險意圖時會怎麼做。這是本文用來解釋抽樣問題的假設情境,並非 OpenAI 公佈的教育產品測試。
罕見情境的困難有兩層。一層是數量少,另一層是表達方式多。同一種風險可能藏在不同語言、敘事背景與前後文裡。把一個敏感關鍵字換成十種寫法,雖然增加題數,未必增加判斷的廣度。評估團隊要找的,是會改變答案是否適當的條件,而非大量近似句子。
邊界題也包含可以回答的請求。有人詢問事件的歷史背景,有人要求具體促成傷害的操作,兩者可能使用相近詞彙。只蒐集明顯應拒絕的內容,容易讓安全測試偏向拒絕得越多越好。保留合理請求,才能同時檢查模型有沒有過度拒絕,把正常學習或討論一併擋掉。
因此,測試資料的價值不能只用總題數衡量。較有意義的問題,是它涵蓋了哪些政策界線、漏了哪些情境,以及相似案例是否佔用過多預算。LASER 提供的是一套把注意力移向難題的程序,讓測試團隊有機會用相同評估資源,觀察更多需要細緻判斷的地方。
LASER 的分工:小分類器挑題,推理模型判讀
LASER 的完整名稱是 Logistic Augmented Sampling over Embeddings, Recursively。讀成工作流程會比較容易理解:把對話轉成數值表示,用邏輯斯迴歸估計它與禁止案例的關係,再反覆挑題與標記。這裡的邏輯斯迴歸是一種輕量分類方法,用學到的參數產生兩類之間的機率分數。
流程從自然語言政策開始。系統先產生符合該政策主題的合成對話,以它們尋找相似的去識別對話,再加入隨機對話形成初始樣本。官方說明,管線只處理合成與去識別資料,不接觸原始使用者資料。這是這套研究流程的資料範圍,不能擴寫成所有產品資料都以相同方式處理。
接著,推理模型依政策把對話標成允許或禁止。每筆對話同時有數值表示與類別標籤,分類器便能學習哪些區域較像禁止案例。推理模型處理較細緻的規則理解,分類器則承擔大規模篩選。這種分工的意義,是讓昂貴判讀集中在有資訊價值的地方。
新一輪分類器會使用目前與先前各輪已標記的資料,然後再次抽樣。它累積的是更好的題目選擇依據,並沒有在每輪直接修改使用者正在操作的聊天模型。後續要知道模型答得如何,仍須讓待測模型回答選出的題目,按照相同規則檢查結果。
為什麼挑接近五成的案例,比只挑最高分更有用?
分類器若對某筆對話給出接近五成的禁止機率,表示它尚難分清楚應放在哪一邊。LASER 優先抽取這種靠近決策邊界的對話。官方範例先取四成至六成之間,若數量不足,再擴大到三成至七成等區間,直到取得該輪需要的樣本。
這個五成是分類器對政策類別的估計,不能當成產品造成傷害的機率。它也不是對使用者意圖的確定判決。對讀者而言,較準確的理解是「這類對話值得投入更多判讀資源」。把不確定性留在抽樣過程裡,能讓系統優先學習原本最沒有把握的區域。
只挑最高禁止分數,可能反覆取得非常明顯的題目。例如分類器已很擅長辨認某種直接要求,新增相近題目提供的資訊便有限。邊界抽樣更有機會找出條件只差一點、政策判斷卻不同的例子,讓後續評估檢查模型是否理解上下文,而不是只學會躲開某些字。
官方用球面與紅灰色點展示這個過程。實際對話表示有 256 個維度,圖中的球面與平面只是方便理解的示意投影。圖上兩點靠近,反映數值表示中的相似程度,不能把位置讀成 AI 內部的完整思想地圖,也不能用肉眼距離代替政策專家的判斷。

題目彼此不同,仍需要檢查不同在哪裡
每輪判讀完,LASER 還會整理禁止案例的多樣性。官方採用貪婪多樣性抽樣:先選一筆,再逐步挑出與已選對話距離較遠的案例。最後形成一個排序清單,評估團隊需要多少題,就取前面相應數量,減少有限題數被相似內容佔滿的機會。
這個做法解決的是數值空間中的重複程度,對提高每次評估的資訊密度很有幫助。但距離較遠,並不自動證明所有風險類型、語言與使用情境都有涵蓋。兩個措辭差很多的案例,仍可能要求同一項政策判斷;兩個措辭相近的案例,也可能因為對象不同而有不同答案。
實務上,可以把多樣性排序與人工分類表一起使用。假設產品服務多語言使用者,團隊便需要分別看不同語言、單輪與多輪對話是否都有足夠題目。這是本文提出的評估建議,官方研究沒有公佈一套適用所有產品的通用分類表,也沒有保證所有長尾情境都已被找出。
資料版本同樣重要。政策修訂後,原本的允許標籤可能需要重新確認,分類器學到的界線也可能改變。若只保存最後題目,沒有保存政策版本、標記依據與抽樣輪次,幾個月後就難以解釋測試變好究竟來自模型改善,還是題目組成已經不同。

萬倍省算力,要連同分母一起看
官方說明,典型的一輪定向判讀中,約每兩筆被選出的對話就有一筆標成禁止。相對地,依政策而異的隨機資料裡,可能約兩萬筆才碰到一筆禁止案例。當目標是找到相近數量的禁止案例,這兩種取樣方式需要的評分呼叫數便會出現很大差距。
例如要找出一百筆禁止案例,依上述比例粗估,定向抽樣約需判讀兩百筆,隨機抽樣則約需判讀兩百萬筆。這是依官方比例做的示意計算,不是本文重跑實驗取得的成本報表。它可以解釋一萬倍的來源,前提則是使用相近政策、判讀方式與目標案例數。
報導這個數字時,要保留「評分模型算力」的範圍。建置資料庫、計算數值表示、初始標記、人工複核、儲存與正式產品測試,都是流程裡另外需要考慮的工作。官方對找到相近案例數的比較,不能直接當成企業的整體安全預算降低一萬倍。
更不能用抽樣後約五成的禁止比例,推論一般使用者對話有五成不合規。這份資料本來就刻意朝罕見難題集中。它適合壓力測試,與估計真實流量中的問題比例有不同用途。若要測量上線後的整體發生率,仍需使用與實際流量相符、具有代表性的抽樣方式。
如何在大資料裡找邊界,又避免每筆都叫大模型?
LASER 把對話的數值表示存進支援向量運算的資料庫,利用近似內積查詢尋找目標區間。內積可以理解成兩組數字之間的加權比較。研究將分類機率區間改寫為內積上下界,讓資料庫直接篩出符合條件的候選對話,而不用逐筆向昂貴模型詢問。
這個工程設計值得注意,因為研究方法要能在實際資料量下執行,才有機會成為常態流程。選題效率來自模型分工,也來自資料查詢與計算方式的配合。小模型本身便宜,若每次仍必須完整掃描龐大資料、反覆搬移內容,整體等待時間仍可能很長。
推理判讀則把政策放在提示前面,讓多筆請求共用相同前綴。前綴快取指的是重用已處理過的相同起始內容,減少重複計算。它節省的是處理共同政策文字的成本,並沒有免除每筆對話的閱讀,也不表示快取會讓判讀結果自動更正確。
企業若想採用類似思路,應先算完整工作流的費用與等待時間。包括哪一部分可以重用、政策變更後什麼需要重算、候選資料是否取得得夠快。較務實的起點,是挑一個明確且常讓團隊爭論的政策邊界,觀察定向抽樣有沒有找到隨機樣本容易漏掉的案例。
評分者也會有盲點,最後仍要回到具體行為
LASER 用推理模型提供標籤,能加速大量資料整理,但模型判讀也可能誤解政策。若錯誤標籤成為分類器的學習目標,後續抽樣便可能跟著偏離。循環越有效率,越需要知道它正在哪個方向累積資料,而不能因為題目產生得很快,就跳過標籤品質檢查。
可以優先複核最難判斷、最常出現分歧,或對使用者影響最大的案例。複核時應保留完整上下文與政策依據,讓討論聚焦在允許條件和禁止條件。這比只看一個總合分數更容易發現規則含糊之處,也能分清楚問題出在題目、標記,還是待測模型的回答。
待測模型的結果也要同時看錯誤回答與過度拒絕。模型如果在所有邊界題一律拒絕,某些風險指標可能改善,服務的可用性卻會受損。允許組與禁止組一起測試,才能觀察改進有沒有讓模型更準確地理解條件,還是只是整體變得更保守。
對使用者而言,較有說服力的證據是可重現的情境改善。例如政策一致的前提下,新版在某類求助問題中提供更合適的資訊,對明確有害要求則維持拒絕。這種具體行為結果,才是判斷安全工作是否帶來價值的下一步。抽樣效率只是讓取得這些證據更容易。
常見問題:LASER 已經是對外可用的安全工具嗎?
這次公開的是研究方法與 OpenAI 的內部使用說明。官方文章沒有在這份發布中提供一個可直接開通的 LASER 商用服務,也沒有公佈所有資料與可重跑的完整產品介面。讀者可以借鑑抽樣設計,但不能把閱讀文章等同於已取得相同資料、分類器或評分能力。
它是否能替產品自動攔下危險內容?本文介紹的主要用途是蒐集安全評估資料。官方提到最後的分類器也可能有其他用途,但這不等於它已作為所有線上對話的正式攔截機制。評估題目的選擇與即時處理使用者請求,需要不同的效能、誤判及部署證據。
它是否證明模型安全程度提高一萬倍?官方比較的分母是找到相近禁止案例數所需的評分算力。產品風險會受到模型能力、政策、工具權限與使用環境影響,無法從這個成本比例直接換算。要判斷實際改善,仍需要相同測試條件下的回答結果與上線後觀察。
LASER 帶來的核心改變,是讓安全評估更容易碰到有資訊價值的難題。當 AI 開始處理更長對話與更多工作,題庫的品質會影響團隊能否及早看見問題。持續更新政策、複核標籤並觀察真實回答,才能把便宜選題的優勢轉成較可信的產品判斷。
資料來源
- OpenAI Alignment Research Blog:Meet LASER,2026 年 10 月 6 日。本文流程、資料範圍、比例及圖解均以原文為準。
- 圖片採用同一官方研究頁提供的原始流程、邊界抽樣與多樣性圖。本文的教育例子、成本示意計算與導入建議屬分析,沒有重跑官方管線。