Unsloth 讓小模型學會做決策:4GB 顯示記憶體能訓練什麼,74.3% 又代表什麼?

Unsloth 公佈本地決策模型訓練,展示 Qwen3.5-0.8B 約 4GB 顯示記憶體的結果。本文解讀三項評估、LoRA 微調、資料品質、信心校準與部署限制,幫助團隊建立可驗證的分類 AI。

Share
Unsloth 桌面介面選擇決策模型訓練
Unsloth 官方文件畫面示範選擇決策模型訓練方式。 圖片來源:Unsloth。

企業要把郵件分流、客服問題分類,或判斷一段內容是否符合規則,未必需要模型寫出長篇回答。Unsloth 在 2026 年 10 月 7 日公佈本地訓練決策模型的功能與結果,讓開發者把既有文字模型微調成會為選項評分的模型。官方稱,小型 Qwen3.5-0.8B 在三項決策評估的整體準確率由百分之二十點七提高到七十四點三,訓練只使用約 4GB 顯示記憶體。

這則新聞的價值,是小團隊有機會用自己的資料建立專用分類元件。數字則有明確的測試範圍,不能理解成任何公司的工作都能達到相同準確率。選擇題怎麼設計、訓練答案是否可靠,以及模型信心如何校準,都會影響它能否真正接進工作流程。

決策模型把工作收斂到可處理的答案

Unsloth 的 官方訓練文件 說明,模型讀取輸入與問題後,為提供的選項評分,再回傳選擇及機率。這和一般聊天產品的差別在輸出方式。使用者如果只需要知道信件應交給哪個部門,固定的答案可以直接交給程式使用,不必再從一段說明中擷取部門名稱。

以客服分流為假設案例,可以把一封信當作狀態資料,列出帳務、配送與技術問題等選項,並附上各選項的定義。模型完成判斷後,後續軟體可以產生工單。若同一封信還需要判斷急迫程度,則可以增加另一個問題,讓模型在相同輸入上處理。這種設計適合範圍明確、答案可以被檢查的工作。

它也要求團隊先定義業務。假如「帳務」包括付款失敗,「技術」又包括付款頁錯誤,同一封信可能同時符合兩類。模型無法替團隊決定責任邊界,訓練資料也會因此產生互相矛盾的答案。建立模型前,把容易混淆的類別說清楚,通常比先換一個更大的基礎模型更有幫助。

決策輸出容易接入程式,不代表每個決策都應自動執行。團隊可以先讓模型給出建議分類,由人員選擇是否接受,再把確認結果整理成測試資料。這能觀察模型常錯在哪些類型,也能找出分類規則本身的問題。等品質穩定後,再逐步將低風險與高重複工作自動化。

四 GB 是訓練條件,不是所有電腦的保證

官方表格列出 Qwen3.5-0.8B 的訓練使用約 4GB 顯示記憶體、耗時四十二分鐘,測試準確率為百分之七十八。顯示記憶體是顯示處理器運算時使用的記憶體,不能直接當成整臺電腦的總記憶體需求。訓練時間也受硬體速度、資料數量與設定影響,其他設備未必能在相同時間完成。

官方展示的模型 顯示記憶體用量 訓練時間 表列測試準確率
Qwen3.5-0.8B 4GB 42 分鐘 78%
Qwen3.5-2B 8GB 40 分鐘 81%
Llama 3.2 3B 4.1GB 30 分鐘 79%
Gemma 4 E4B 14.4GB 49 分鐘 77%

這些資料來自 2026 年 10 月 8 日查閱的官方文件。表中的結果來自特定測試,不能把較高的百分比視為對所有業務更好的選擇。不同模型的資源用量與結果,提供的是起始比較。使用者仍要加入自己的資料、輸入長度與錯誤成本,才知道哪一個適合部署。

對已有消費級顯示卡的小團隊,低記憶體需求可以降低概念驗證門檻。不過,模型能訓練和能長期提供服務,是兩個階段。訓練完成後仍要保存模型、啟動服務、處理多個請求與記錄結果。若硬體同時負責其他工作,也要測試實際運作是否會互相干擾。

Unsloth 決策模型微調官方評估與前後結果
Unsloth 官方發布圖整理不同決策評估與訓練前後的展示結果。 圖片來源:Unsloth。

微調只更新部分參數,資料品質仍是關鍵

微調是讓已有模型透過新範例學習特定工作。Unsloth 文件採用 LoRA 方法,也就是在模型上訓練較小的可更新部分,降低需要調整的參數量。它再加入決策輸出層,為問題選項評分。這讓原本用來產生文字的模型,能以更適合分類流程的方式提供結果。

開發者不需要把所有資料都做成對話。官方格式包含狀態、需要決定的問題與標準答案。狀態可以是信件內容,問題可以是分流類別,標準答案則是經確認的選擇。這種格式的優點,是每一筆訓練資料都能清楚檢查輸入與目標,較容易找到標籤矛盾或錯誤示範。

資料量大不代表訓練一定更好。假如同一種信件在不同批次被標成不同部門,模型會學到不一致的規則。若資料中某個客戶名稱總是出現在退款類,模型也可能記住名稱,而沒有理解退款條件。準備資料時應檢查這些捷徑,讓答案由實際內容決定,而不是依賴偶然出現的字詞。

官方展示使用多個資料來源,並稱測試集已針對訓練資料進行去污染處理。去污染是盡量移除訓練與測試中重複或過度相似的案例,避免模型只是記住答案。企業自己的資料也需要這類檢查。同一串客服對話若同時出現在訓練與測試,得到的分數可能比實際新案件表現更樂觀。

三項評估的平均,不能替代業務通過率

百分之七十四點三來自官方社羣公佈的三項評估整體結果,包含 typed-decisions、BANKING77 與 CLINC150。官方文件另列出各項結果,以及留出資料的準確率。這些數字有不同計算口徑,讀者應保留來源所標示的範圍。不能把三項平均與另一個測試欄位直接當成同一個指標。

對採用團隊而言,首要問題是自己的重要案例有沒有被答對。假設大多數信件都屬於一般詢問,模型只要常選一般類別,整體準確率就可能很好看。但遇到付款重複扣款或帳戶被盜時,錯一次的代價可能大很多。評估應把這些關鍵案例分開,觀察是否被漏掉,以及是否被錯送到不適合的流程。

測試也應包含難以分類的輸入,例如同一封信同時談付款與配送、內容只有一句抱怨,或引用他人的問題。這些案例能顯示選項設計是否完整。若模型總是在模糊案例上給出過高信心,產品可能需要把這些情況交給人工,或要求補充資料,避免把不確定性藏在單一分類結果裡。

本文建議,把成功定義成後續流程能正確完成,而不只是模型選到某個標籤。工單送到正確部門後,是否還需要重新分類,是否減少等待時間,纔是工作改善的證據。模型分數可以幫助挑選候選方案,但實際服務指標決定它能否創造價值。

Unsloth 決策模型訓練進度與校準畫面示例
官方文件的訓練完成畫面示例,包含留出準確率與校準資訊。 圖片來源:Unsloth。

信心校準,讓機率更接近可用的資訊

官方流程提供校準與儲存模型的步驟。校準是用已知答案的資料,調整模型信心與實際正確率之間的關係。例如,一批信心接近百分之八十的判斷,若只有約一半答對,就代表這個分數過於樂觀。校準能改善分數的解讀,但其效果仍取決於資料是否接近實際使用情況。

團隊應區分訓練資料、校準資料與最終評估資料。模型可以從訓練資料學習,校準資料則用來調整信心。如果一再使用同一批最終測試資料挑選設定,測試也會逐漸失去獨立性。保留一批未用來做選擇的新案例,有助於判斷模型是否真的具備穩定能力。

信心門檻可以支持分流設計,但不要只設定一個適用所有類別的數字。對低風險資訊整理,可以接受較寬鬆的處理條件。對會改變帳務或權限的問題,則需要更可靠的判斷與其他確認。每一類錯誤的代價不同,門檻應反映業務需求,而非只追求讓自動通過率變高。

當資料或規則改變,校準也要重新檢查。產品增加新方案、客服分類調整,或使用者改用不同語言,都可能讓過去的信心關係失效。部署模型後可以保留人工抽查,觀察低信心與高信心案例各自的錯誤情況。這能幫助團隊知道問題來自模型能力,還是工作內容已經發生變化。

圖形介面降低門檻,重現結果仍要保存設定

Unsloth 文件提供桌面介面的訓練流程,也提供程式範例。使用者在訓練頁選擇模型與資料集,再指定以決策模型方式訓練。完成後可在設定中選用模型,透過 Decision API 提供服務。API 是讓軟體以固定格式呼叫功能的介面,便於把模型接入自己的應用。

官方展示的評估設定與文件推薦的起始設定並不完全相同。社羣貼文提到一輪訓練與較高 LoRA rank,文件也提供兩輪與另一組參數的起始範例。這表示讀者不應把不同段落的設定混成一份保證能重現全部結果的配方。採用者要記錄自己的設定與測試結果,再逐項比較。

保存資料版本、模型名稱、訓練參數與評估案例,比只保留最後一個準確率更有用。若某次更新後表現退步,這些資料能幫助確認是否換了基礎模型、增加了不同類型輸入,或意外改變訓練條件。桌面工具讓操作更容易,追查與重現的責任仍在使用者身上。

輸入長度也是實際限制。文件說明訓練長度由設定決定,過長內容會被裁切,而推論另外有讀取上限。若重要退款條件寫在信件尾端,裁切可能讓模型永遠看不到答案所需的資訊。團隊應先檢查資料長度分佈,必要時保留相關段落,避免單純增加樣本數卻持續餵入缺少關鍵內容的資料。

Unsloth Decision API 客服信件分類示例
官方 Decision API 畫面以客服信件示範選項評分,畫面數值屬文件示例。 圖片來源:Unsloth。

部署後先觀察,再擴大自動處理

訓練完成後,可以先讓模型在既有流程旁邊提供建議,不直接改變資料。這個階段能比較模型選擇與人員判斷,也能統計每類案例的錯誤。若人員之間也經常意見不同,應先改善分類規則,再決定模型表現是否合格。明確的標準答案,是評估可信度的基礎。

官方文件指出,本地 Decision API 第一次載入模型可能需要幾分鐘,而且同一顯示處理器正在訓練時,服務會等待訓練完成。這會影響產品安排。如果一臺設備同時負責訓練與客服分流,就需要規劃服務中斷與更新時段,不能只根據推論結果推定全天可用。

對小團隊而言,最好的起點是高重複、低風險、答案明確的一項工作。先建立可靠資料與可檢查的評估,再決定是否增加模型或硬體。Unsloth 的發佈把專用決策模型帶到較低的實驗門檻,但是否值得長期採用,最終仍要看它能減少多少人工重做與錯誤分流。

常見問題

只有 4GB 顯示記憶體就一定能訓練成功嗎?

官方展示有約 4GB 的結果,但使用者的模型、輸入長度與訓練設定都會影響需求。較長輸入與較大批次可能增加記憶體用量。應先以小規模資料確認環境,再逐步增加工作量。

百分之七十四點三適用我的客服資料嗎?

那是官方三項評估的整體結果,無法直接代表其他業務。應以自己的分類規則與新案例測試,並把重要錯誤類別分開檢查。模型是否能減少後續重做,也應納入評估。

決策模型會提供完整理由嗎?

其核心輸出是選項與分數。需要說明的產品,可以另外呈現來源資料或加入文字生成流程。這會增加運算與驗證工作,應根據使用者實際需要決定。

資料來源