Strands Decider 2B 開源:AI 不必每次寫長答案,小模型先替工具與選項做決策
AI 代理每走一步都生成一大段文字,可能讓簡單選擇變得又慢又貴。Strands Agents 在 2026 年 10 月 1 日推出開源的 Strands Decider 2B,讓小模型專門在給定選項之間做決策。對需要安排工具、分派任務或選擇下一步的系統,這是一個不同於聊天模型的設計方向。
AI 代理每走一步都生成一大段文字,可能讓簡單選擇變得又慢又貴。Strands Agents 在 2026 年 10 月 1 日推出開源的 Strands Decider 2B,讓小模型專門在給定選項之間做決策。對需要安排工具、分派任務或選擇下一步的系統,這是一個不同於聊天模型的設計方向。
本文會進一步說明代理的下一步,並分析實際使用條件與評估方法。

它先選路,不負責寫完整答案
官方介紹把 Decider 定義為決策模型:輸入情境和候選選項,輸出選擇與評分。2B 表示約二十億個參數,也就是模型內部學到的數值規模。它建立在 Qwen3.5 的模型結構上,再加上用來指向選項的輸出設計。
例如客服系統可以先判斷,問題應該交給訂單查詢、退款規則,還是人工支援。選好路之後,再讓其他工具查資料或生成回覆。這種分工有機會減少為了簡單分流而使用大型模型的次數。

百毫秒級速度,仍取決於任務與裝置
官方測試提供 NVIDIA RTX 3090 上中位數約 115 毫秒的決策延遲,另有 M3 Mac 的小型任務結果。這些是特定裝置與工作條件下的數字,不能當成每一臺電腦、每一種輸入都相同的速度。
輸入越長、選項越多,系統仍需要更多運算。對開發者來說,應該用自己的任務測試總時間,並加入後續工具執行的時間,才能知道整體流程有沒有變快。

選項品質,也會限制模型判斷
Decider 只能在提供的選項之間決定。如果正確工具不在候選清單裡,再好的決策模型也很難選對。選項文字寫得不清楚,也可能讓分類結果不穩定。
評分可以幫助系統設定轉人工或再次確認的門檻,但它需要在實際資料上校準,不能直接當成「答案有百分之多少一定正確」。官方基準測試的名次,也只適用於該組模型與任務的比較。
代理的下一步,很多時候只是從有限選項中選擇
代理系統常會面對選擇工具、分派任務或決定是否轉交的問題。這些問題未必需要一大段自由生成文字,如果候選選項已經清楚,專門做選擇的小模型就有發揮空間。Strands Decider 的方向,是讓模型直接對給定選項作判斷,減少先寫解釋再解析結果的步驟。
例如一個內部服務可以把請求分成文件查詢、訂單查詢與人工協助,再由決策模型選出適當入口。這是說明用途的假設情境,不是官方保證的分類表現。決策模型不負責完成訂單查詢,也不負責提供最終客服答案,它主要幫助系統決定下一步。
這種分工讓不同模型承擔不同工作。小模型負責明確選擇,大模型負責需要複雜理解或生成的部分,程式則負責實際執行。系統設計因此可以更細緻,但也需要清楚介面與驗收,避免把一個選項選擇正確,誤認為整段任務已經成功。
二十億參數的規模,適合評估本機路由用途
官方模型約有二十億參數,並以 Qwen 3.5 為基礎,增加專門的決策輸出設計。模型參數是訓練後保存的核心數值。較小規模有助於考慮本機或較低資源環境,但實際運行仍受到精度、輸入長度與軟體影響,不能只用參數量推論任何裝置都能達到相同速度。
官方程式碼庫提供模型與使用方法,讓開發者可以檢查如何輸入任務與選項。對評估者而言,開放實現比只有排行榜更有用,因為可以用自己的資料驗證。下載與運行之前,仍應確認具體版本、依賴與授權條件,避免把不同發佈內容混在一起。
本機部署的價值可能來自延遲與資料控制,也可能增加維護工作。團隊應先確認決策頻率與任務複雜度,再比較自行運行和遠端呼叫。若每天只有少數簡單選擇,維護一個模型未必划算。若每個代理步驟都會路由,則有必要測量完整成本。
選項設計會限制模型能夠作出的判斷
給定選項模式的優勢,是輸出範圍明確。限制則是正確答案如果沒有列出來,模型就無法選擇它。選項太相近、描述不清楚或重複,也會讓判斷變難。開發者需要先整理候選集合,再評價模型,而不是把所有錯誤都歸因於推論能力。
可以準備一組任務,檢查每個案例是否真的有適合的選項。如果問題需要更多資訊,候選集合應允許轉交或暫不決定,而不是強迫在兩個不合適的動作之間選擇。具體支持方式應依模型介面與應用設計,本文不把這項原則當成產品自動提供的所有功能。
選項順序與文字也值得測試。若同樣意思換一個說法就大幅改變結果,系統可能需要更穩定的描述。讓每個選項交代用途、輸入需求與限制,通常比只用一個短名稱更容易評估。決策模型的表現,與候選集合質量直接相關。

決策分數需要校準,才適合當成信心使用
模型提供分數,可以幫助判斷是否需要轉交,但高分不一定等於真實成功概率。校準是檢查模型的信心與實際正確程度是否相符。如果模型經常給出很高分卻選錯,應用就不能只依據分數自動執行重要動作。
官方圖表同時展示正確率與 Brier 分數。Brier 分數用來衡量預測信心與實際結果的差距,較低通常表示概率誤差較小。這個指標幫助讀者理解,決策品質不只在於選對多少次,也包括知道自己有多確定。圖表結果仍屬於官方訓練與評估條件。
企業可以用自己的標註樣本檢查不同分數區間的正確率,再決定轉交門檻。門檻改變會影響自動處理比例與錯誤數量,應該依任務後果取捨。一個簡單路由選擇與一個會修改正式資料的選擇,不能只因為分數相同就採用同樣動作。
百毫秒級延遲,必須放回輸入與硬體條件
官方報告 RTX 3090 上的中位數約一百一十五毫秒,M3 相關小型配置約一百五十三毫秒。這些數字說明指定條件下的決策時間,不能直接作為任何服務器或手機的速度保證。輸入越長、選項越多,實際時間也可能改變。
應用的端到端時間還包括準備選項、讀取資料與執行工具。如果決策只花一百多毫秒,但後端查詢花數秒,整體速度改善可能有限。開發者應測量完整步驟,知道模型優化的是哪一部分,再決定是否值得導入。
比較大模型與 Decider 時,也需要一致條件。一個系統先做了複雜的選項整理,另一個直接面對原始問題,不能只比較最後呼叫時間。把準備成本、選擇結果與後續失敗一起納入,才能判斷專門決策模型是否帶來實際效益。
榜單成績說明測試表現,不代表所有代理場景
官方提到在特定評測的二十億參數級別中排名,以及排除略高於該規模模型後的比較。這些說明有助於理解同類模型表現,但不是全部模型的統一排名。不同評測可能偏向不同任務,實際路由或工具選擇仍應使用自己的樣本。
任務分類也可能與正式流量不同。評測中的選項可能較清楚,真實使用者則會省略資訊或同時提出多項需求。系統需要處理模糊與複合任務,不能因為標準題表現好就直接擴展到所有請求。測試集合應包含正常案例與難以歸類的情況。
公開榜單最適合用來選擇值得嘗試的模型,再以實際任務決定採用。開發者應保留版本與結果,避免模型更新後無法比較。Strands Decider 的新聞價值在於一種專門化設計,採用依據仍是目標工作中的正確與穩定。
先做平行比較,可以觀察錯誤而不改變既有流程
導入路由模型時,可以先讓它產生建議,實際請求仍由既有規則處理。團隊記錄兩者差異,再由人工檢查哪一種更合適。這種平行測試有助於發現誤選類型,也能估計如果採用新模型,會有多少請求改變路徑。
檢查時應關注容易產生後果的差異。例如本來應該人工接手的任務被自動分派,或資料查詢被送到不適合的工具。單純總體正確率可能掩蓋少數重要錯誤。把錯誤按情境分類,比較容易決定是否需要改選項、補資料或提高轉交比例。
等建議穩定之後,再讓部分低影響任務使用新路由,並保留恢復方式。模型負責選擇,執行系統仍應檢查權限與輸入。這樣可以利用速度與成本優勢,同時把任務控制留在明確的工程流程中。
選項識別與後端動作,需要避免連接錯誤
決策模型選出一個項目之後,程式需要把它對應到真正的工具。若顯示名稱、識別碼與執行函式沒有一致,模型即使選對,也可能呼叫錯誤動作。開發者應把這段對應當成獨立檢查,不要只驗證模型輸出。
工具清單更新時,也需要同步更新選項描述與測試。某個選項被移除,或同名工具用途改變,舊結果可能不再適用。保存清單版本能協助追查問題,讓模型與執行系統使用相同條件。這類工程錯誤不會直接反映在官方模型排行榜上。
後端仍應檢查必要輸入與權限。如果資料不完整,可以回到使用者或人工處理,不能因為模型已作選擇就略過檢查。將選擇、參數驗證與執行結果分開,能讓系統找到真正出錯的環節,也讓小模型的速度優勢不會被錯誤動作抵消。
適合的選擇,是邊界清楚而且能反覆驗證
Strands Decider 特別適合候選集合明確、選擇頻繁且結果可檢查的任務。若問題需要開放創作、長篇解釋或全新方案,專門的選擇模型就不一定足夠。瞭解這個分工,能避免把小模型當成所有大模型工作的替代品。
對企業開發者,最有價值的試驗是建立一組代表性請求,固定選項與驗收標準,再比較延遲、正確率與人工接手。如果選擇速度改善,後續任務也穩定完成,纔有理由擴大。若選項本身經常不夠用,應先調整工作設計。
這次開源發佈顯示,代理系統正在把不同能力拆成更適合的模型。小模型可以讓簡單決策更有效率,完整任務仍需要資料、工具與驗收配合。把選擇與執行分開觀察,才能判斷 Strands Decider 是否真正改善你的系統。
實現與版本資料可查閱 Strands Decider 官方程式碼庫。
常見問題
可以把它當成一般聊天機器人嗎?
它主要輸出選擇與評分,適合用在流程決策。要生成完整解釋、文章或對話,通常還需要其他模型。
開源後能自己部署嗎?
官方提供 GitHub 與 Hugging Face 資源,包括下載模型權重,也就是訓練完成的核心參數,以及相關訓練程式和資料。實際使用仍要確認授權、裝置與部署條件。
先把簡單決策從長回答裡拆出來
Decider 的啟發是,AI 系統可以讓不同工具各做擅長的工作。若你的代理常花大量時間決定「下一步要找誰」,這類決策模型值得拿一組真實任務先試。