SGLang 讓 Qwen 做快速決策:AI 打贏寶可夢之後,分類工作可以怎麼用?
SGLang 用 Qwen 展示快速遊戲決策。看懂不生成文字的分類介面、未校準機率,以及開源部署需要的驗證。
讓 AI 玩遊戲的影片很容易吸引人,但 SGLang 這次展示的重點,是把模型用來做快速、有限選項的決策。官方在 X 表示,將 Qwen3.8-27B 用於多模態決策,從即時遊戲狀態做出低於一百毫秒的決定,並打贏《Pokémon FireRed》的四天王與冠軍。本次採集時,公告有超過七百個喜歡與接近四萬次瀏覽。
同一則公告介紹原生 /v1/decisions,讓語言與視覺語言模型用於分類和評分,也新增 /v1/systemone 的相容入口。這讓新聞不只是一段遊戲示範,而涉及開源模型服務可以如何交付固定形式的判斷。本文以官方主分支文件與程式碼核對介面,沒有宣稱已自行部署或重現遊戲通關。
我的看法是,它對工程團隊最有吸引力的部分,是把「請模型回答,再解析文字」縮成「在預定選項中取分數」。這可能減少輸出格式處理,也讓分類結果更容易接入流程。快速決策是否可靠、機率是否能當作自動放行標準,仍需要自己的標記資料與完整工作測試。
SGLang 在這裡扮演模型服務層
SGLang 是讓模型運行並提供推論服務的開源工具。模型推論可以理解成已訓練好的模型接收輸入、計算並產生結果的過程。大型語言模型主要處理語言,視覺語言模型則能把圖片與文字一起納入輸入,因此遊戲狀態也可以成為決策內容。
/v1/decisions 是這套服務新增的呼叫入口。API 是讓程式呼叫功能的介面,這裡可以送入資料與幾個有型別的問題,再取得各選項的機率。路徑包含 /v1,並不代表它就是 OpenAI 的標準介面,官方文件明確把它列為 SGLang 擴充,應依文件使用適當呼叫方式。
這也與換一個全新聊天產品不同。已有模型服務的團隊,可以研究如何在相同服務層提供聊天與決策工作。但版本、模型模板與服務設定會影響支援程度,不能只看到路徑名稱,就推定既有部署立即可以使用。
截至本次查核,主分支文件說明在正式版本尚未包含功能時,可以使用每日建置版本。每日建置是從持續更新的程式碼產生的套件,不一定具有與穩定版本相同的驗證範圍。準備導入時,應先確認自己的版本與支援條件,再依需求安排試行。

不生成回答,如何得到選項機率
一般聊天工作會讓模型逐步產生文字,再由程式讀取回答。固定分類如果只需要「技術問題、帳務問題、其他」其中一項,就可能不需要長篇解釋。SGLang 的決策介面利用答案位置的模型分數,讀出各個預定標籤的相對機率,不生成文字回答,也不需要解析生成的句子。
這裡仍有完整的模型計算。輸入要先被處理,服務才知道各標籤的分數。因此沒有輸出文字,不代表沒有運算成本,也不能直接推定不需要高效能硬體。它改變的是輸出路徑與使用方式,整體速度仍受模型、輸入與設備影響。
官方提供選項、評分與是非三種問題。選項問題回傳最高機率的選擇,評分問題可以依各等級機率得到加權結果,是非問題則提供兩種答案的分佈。工程團隊需要知道每種結果的意義,不能把它們全部當成相同的信心分數。
以三個程度等級為例,模型可能把機率分在中等與嚴重之間,加權分數便可能不是整數。這個數值反映目前等級設計下的分佈,不會自動等於業務上可接受的處置方式。等級名稱、順序與描述都需要由使用者設計,再用實際案例檢查。
有機率,不等於答案一定正確
模型在預定選項中偏向某一項,並不保證該項就是事實。官方文件明確提醒,這些機率沒有被校準成「決策正確的機率」。校準可以理解成讓某個機率數字與實際正確比例相對應,需要另外的資料與驗證。
假設模型對一批分類都給出很高的最高選項機率,實際卻經常分錯,這個數字就不適合直接當自動處理門檻。團隊需要先建立人工核對的案例,觀察不同分數區間的錯誤,再決定哪些結果可以自動接受,哪些需要交給人員。
官方還提供 label_mass,用來觀察模型在整個詞彙範圍中給答案標籤多少機率。這與只在幾個選項內重新整理的機率不同。若選項設計沒有涵蓋輸入,選項內仍可能出現一個看似很高的數字,因此需要理解數值是在哪個集合裡計算。
這可以用一個假設客服案例說明。如果系統只提供「帳務」與「技術」,卻收到一封合作提案,模型仍可能偏向其中一項。增加「其他」與人工處理路徑,可能比強迫每個輸入落進兩個分類更合理。分類設計本身,是結果可靠性的一部分。
寶可夢示範中的一百毫秒,涵蓋哪一段
官方貼文把低於一百毫秒描述為從即時狀態做決策的速度。這不能直接理解成整個遊戲流程、畫面擷取、資料傳輸、按鍵執行與狀態更新都在同一時間內完成。不同階段的時間應分開量測,再看使用者最終感受到的反應。
遊戲通關也需要很多次相依決策。單次決策快,並不保證長流程一直做對,通關成功則是一個具體示範,不能推廣成所有遊戲與所有現實工作都可靠。這兩個訊號各有價值:速度說明一段計算的表現,完整成果則提供特定任務的觀察入口。
若把相同方向用在手機或其他畫面操作,還要計入畫面取得與工具執行。即使模型很快選出下一步,App 可能正在載入,按鍵也可能沒有觸發預期結果。系統應讀回新狀態,才知道是否可以繼續。這和本文其他真機代理主題相呼應,但並不表示遊戲示範已驗證所有手機工作。
對企業分類,延遲也要按負載測試。單一請求與多個請求同時進來時,等待與處理可能不同。較長輸入、多個問題與不同快取狀態,都會影響結果。部署決策應以實際流量與任務長度為準,避免把演示中的單一數字當成固定服務承諾。
哪些工作適合先拿來評估
明確、可核對的分類是合理起點。比如把公開資料分成指定主題、將測試訊息安排到對應團隊,或判斷文件是否包含某種明確條件。輸入與選項的關係越清楚,就越容易建立已知答案與觀察錯誤。
評分也需要具體描述。如果只有「一到十分」,不同人可能有不同理解。把每個等級對應到可觀察條件,例如缺少必要欄位、資訊完整但有矛盾、或資料可直接核對,模型才有比較明確的依據。這些等級仍需要按工作驗證,不應假設越多等級就越精準。
多個問題可以在同一次工作中提出,但它們的答案不能自動當成一致的完整計畫。例如模型分別判斷是否緊急、由誰處理與資料是否完整,三個結果之間可能需要業務規則再檢查。決策服務提供分數,流程仍要處理衝突與相依關係。
失敗成本高的工作則需要更明確的控制。模型可以協助整理候選或提出判斷,但不宜只憑未校準的機率就直接做難以回復的決定。先把自動化放在可核對、可回復的步驟,更容易測出它對工作是否有幫助。
開源部署,仍要看模型與硬體條件
官方文件列出已驗證模型與設備,並對標籤、聊天模板與服務模式設定檢查。標籤要能在答案位置被模型當成合適的單一文字片段,模板也不能讓答案位置落在尚未結束的推理區塊。這些是介面運作條件,不能只因模型能聊天,就推定決策入口一定可用。
對初學者,模型服務需要處理的事情比一般網站多。模型載入、顯示卡記憶體、同時請求與運行設定,都可能影響可用性。文件中的資料中心硬體驗證不等於一般筆電保證能跑,導入前應依模型與服務文件確認。
開源也讓團隊可以觀察實作與自己控制部署,但人員仍要負責更新、監看與故障處理。若團隊沒有這些資源,應先估算維護工作,而不是隻比較模型呼叫費用。硬體、電力、管理與測試都屬於實際成本。
模型與版本更新後,原有門檻也可能需要重測。選項順序、提示文字與服務設定改變,都可能影響分數。保留輸入、設定與結果,讓同一組案例可以重新執行,才有機會知道更新帶來的是改善還是新的不穩定。
SGLang 官方遊戲示範。低於一百毫秒是公告中的決策延遲描述,不代表完整遊戲或所有外部步驟的端到端時間。 影片來源:SGLang 官方 X。
System One 相容入口,讓既有客戶端有另一種選擇
SGLang 同時提供 /v1/systemone,對應 System One 的請求與回傳形式,也讓 TypeSafe 的開發工具套件可以連到服務。開發工具套件是幫程式處理呼叫與結果的函式集合,能減少自行組裝請求的工作。
相容介面並不代表所有功能與行為完全相同。官方文件列出未支援項目與限制,因此使用既有客戶端時,應確認問題類型、模型選擇、回傳欄位與錯誤處理。從一個供應商切換到自架服務,也需要重新驗證分數門檻。
尤其是「信心」相關欄位,不應直接沿用其他服務的經驗值。不同模型、分數計算與標籤集合會影響數字。介面長得一樣,可以降低整合工作,卻不會自動建立相同的品質保證。
這篇搭配 SGLang 原始遊戲示範與官方資料,讓讀者看見快速決策的方向。影片可觀察特定任務成果,程式與文件則說明介面工作方式。正式導入仍需要自己的資料與測試,本文沒有把展示當成全面商用保證。
一次試行,如何得到可以比較的結果
可以先準備一組人工標記的任務,包含常見案例、邊界情況與不在選項內的輸入。固定模型、版本與提示,再記錄正確比例、處理時間、人工介入與分數分佈。比較候選方案時,應使用同一組資料與完成條件。
接著測試重複執行與多請求。若結果在不同快取或批次條件下有小幅變動,應觀察是否影響最終選項與門檻判斷。門檻附近的案例尤其值得保留,因為它們可能決定多少工作會被自動處理。
最後把完整工作成本算進去。模型決策、輸入處理、工具執行、失敗重試與人工核對共同決定收益。若分類更快、格式處理更簡單,而且品質符合要求,就有理由逐步擴大,若主要時間仍花在資料準備或人工修正,則應先改善那一段。
常見問題
decisions 路徑可以直接當成 OpenAI 標準功能呼叫嗎?
官方文件把它列為 SGLang 擴充,應依文件呼叫。相似路徑名稱不代表同一套標準或相同支援方式。
最高機率九成,表示九成機會做對嗎?
不能直接這樣理解。官方提醒分數未經正確率校準,門檻需要用自己的已知答案資料驗證。
不生成文字,表示運算免費或不需要顯示卡嗎?
仍需要模型處理輸入並計算分數。硬體與運行成本要依模型、服務設定與工作負載評估。
把快速判斷接到可靠的工作流程
SGLang 的新介面把開源聊天模型帶到分類與評分用途,提供不生成文字也能取得選項分數的路徑。寶可夢示範讓方向更具體,實際價值則要看自己的任務能否穩定完成。
先把問題、選項與驗證標準寫清楚,再測品質、速度與完整成本。當分數有合理的使用範圍、失敗也能交給人員,快速決策才會成為可維護的系統功能。