TOAST 1 是什麼?Mixedbread 用搜尋 Agent 降低 AI 查資料成本,價格與實測一次看
TOAST 1 把拆問題、搜尋文件與整理證據交給專門 Agent。本文解析效能、價格、限制,以及哪些企業知識庫值得先做 POC。
企業導入 AI Agent 時,成本不一定都花在最後那段推理。AI Agent 是能自行拆解任務並呼叫工具的 AI 系統。很多 token 與等待時間,其實消耗在反覆搜尋文件、打開來源、排除不相關內容,再把證據塞回模型上下文。Token 是模型計算文字用量的基本單位,也是多數 API 的計費依據。
Mixedbread 發布的 TOAST 1,就是專門處理這段工作的搜尋 Agent。它不急著取代 GPT-5.6 Sol、Claude 等通用模型,而是先把問題拆開、找出證據、檢查來源,再把整理好的資料交給主 Agent 回答。
這個方向值得關注。對法律、財務分析、企業知識庫與深度研究等文件密集型工作,專門化檢索有機會讓昂貴模型把算力用在真正需要推理的地方。不過,目前最亮眼的成績主要由 Mixedbread 自行測試。最實際的做法不是直接全面換掉既有搜尋,而是先拿公司的真實問題做一輪概念驗證(POC),確認方案在小範圍內是否有效。
TOAST 1 是什麼?
TOAST 1 是一個專門檢索 Agent,也就是負責「找資料與整理證據」的 AI 模型。它可以獨立執行深度搜尋,也能作為主 Agent 呼叫的子 Agent。
一般語意搜尋通常根據一個問題,從向量資料庫找出幾段意思相近的文字。TOAST 1 則會接手整個搜尋迴圈:
- 理解原始問題,拆成多個較容易查找的子問題。
- 對文件庫進行多次搜尋,蒐集候選證據。
- 檢查來源內容,排除看似相近、實際無關的結果。
- 整理出較精簡的證據包,再交回主 Agent 推理與回答。
例如,使用者問「公司被收購時,這份合約能不能轉讓?」普通搜尋可能只找出包含「轉讓」或「控制權變更」的段落。TOAST 1 會進一步把問題拆成轉讓條款、控制權變更、例外條件與通知義務,再把相關內容一起交給主模型判斷。
這種分工的重點不是讓搜尋 Agent 寫出最終答案,而是減少主模型自己在大量文件裡來回翻找。上下文更乾淨,通常也代表更少 token 與更低的誤判機會。
Mixedbread 以 Dwarkesh Podcast 逐字稿展示 TOAST 1 的深度搜尋流程。影片來源:Mixedbread 官方發布頁。
TOAST 1 和一般 RAG 有什麼不同?
RAG 是「檢索增強生成」的縮寫。白話來說,就是回答前先從指定資料庫找內容,再讓生成式 AI 根據這些資料作答。
傳統 RAG 常把搜尋當成一次性的前置步驟。問題送進去後,系統找出最相近的幾段文字,接著就交給大型語言模型。這種做法速度快、架構簡單,但遇到需要跨文件比對、條件很多或用詞不一致的問題時,第一次搜尋可能拿不到足夠證據。
TOAST 1 把檢索本身變成一個可以多步驟工作的 Agent。它會根據找到的內容調整下一次搜尋,因此更接近「研究員查資料」,而不是「搜尋框回傳前十筆結果」。
| 比較項目 | 一般語意搜尋/基礎 RAG | TOAST 1 | 通用前沿模型自行搜尋 |
|---|---|---|---|
| 搜尋方式 | 通常一次查詢後取回相似片段 | 拆子問題、多輪搜尋、檢查並整理證據 | 主模型同時負責搜尋與推理 |
| 優點 | 快、便宜、容易維護 | 複雜問題的證據較完整,可節省主模型上下文 | 彈性最高,能同時處理模糊需求與最終答案 |
| 代價 | 容易漏掉跨文件關係 | 比單次搜尋多一層 Agent 成本與延遲 | token 與每題成本通常最高 |
| 適合情境 | FAQ、單文件查詢、簡單知識庫 | 法律、財務、研究與企業內部文件 | 需求仍模糊、需要多種工具與高階判斷 |
我的判斷是,TOAST 1 最適合補在「基礎 RAG 不夠準,但每一題都用最貴模型搜尋又太浪費」的中間地帶。若問題只要查單一欄位,增加 Agent 反而會讓系統更慢;如果任務還需要做決策、寫報告或操作外部系統,TOAST 1 也不能取代主 Agent。
OfficeQA Pro V2:70% 正確率,每題約 US$1.15
TOAST 1 最吸睛的成績來自企業財務文件問答。OfficeQA Pro V2 是 Databricks 發布的企業推理標準化測試(benchmark),要求 Agent 從真實感較高的試算表、簡報與文件中找資料並回答問題。
Mixedbread 表示,讓 GPT-5.6 Sol 在 Codex 中呼叫 TOAST 1 子 Agent 後,答案正確率達到 70%,每個任務成本約 US$1.15。文章圖表把成本四捨五入為約 US$1.20。作為比較,Databricks 原評估中的 Claude Fable 5 搭配 Genie 為 60%,每題約 US$4;GPT-5.6 Sol 在 Codex 中沒有 TOAST 1 時,則為 33%。
這組結果支持一個重要觀察:更好的搜尋不只省錢,也可能提高最後答案品質。主模型若一開始拿到錯誤或不完整的證據,後面再強的推理也很難補救。
但這裡要分清楚資料來源。Databricks 提供 Genie 與其他模型的原始評估數字,Codex+TOAST 1 的測試則由 Mixedbread 執行。它是有參考價值的供應商測試,還不是第三方對 TOAST 1 的完整重現。企業評估時,應該用自己的 Excel、PDF、合約與常見問題再測一次。

法律文件測試:答案分數相同,token 降到約 3 分之 1
第二組測試更能看出 TOAST 1 的成本價值。Mixedbread 使用 Harvey LAB 的 Law Firm Knowledge benchmark,隨機選出 33 個任務,比較三種檢索配置。
| 配置 | 總 token | 平均每題 Agent 迴圈 | 任務分數 |
|---|---|---|---|
| Vanilla Agent | 80.6M | 21.7 | 55 |
| 加入 Mixedbread Search | 47M | 14.6 | 55 |
| 再加入 TOAST 1 子 Agent | 23M | 11.2 | 55 |
三組最後分數都是 55,代表這次比較沒有提高答案分數,而是在相同結果下減少搜尋消耗。從 80.6M 降到 23M,相當於使用約 3.5 倍更少的 token;Mixedbread 表示總成本降幅超過 60%。
這個結果對產品團隊比單純「模型更聰明」更實用。企業通常已經有可接受的答案品質,真正卡住的是每題太貴、等待太久,或上下文很快被文件塞滿。若專門檢索能維持相同結果,又把 Agent 迴圈從 21.7 次降到 11.2 次,才有機會把 POC 變成日常可負擔的功能。
限制也很清楚:這次只測 33 題子集,而且分數沒有上升。因此,它證明的是特定設定下的效率改善,不代表所有法律工作都能提高準確率。

TOAST 1 速度與每次查詢成本
Mixedbread 公布的深度搜尋測試中,標準 TOAST 1 每次查詢約 US$0.016~US$0.023,中位延遲為 8 秒;追求最高品質的 fusion 配置約 US$0.05~US$0.07,中位延遲為 11 秒。Fusion 可以理解成組合多種搜尋或排序結果,以較高成本換取更完整的證據。
在 Mixedbread 的評估裡,達到相近表現的 TOAST 1 配置便宜 7~11 倍。通用前沿模型的檢索 Agent 在相同評估中,需要 20 秒到 4 分鐘。
這些數字說明專門模型確實可能改善搜尋的成本結構,但不能直接拿「每次 US$0.016」估算整個產品。實際帳單還會受到輸入與輸出 token、搜尋次數、是否使用 rerank,以及主 Agent 最後推理成本影響。資料庫品質與文件切分方式,也會改變需要搜尋幾輪。
TOAST 1 API 價格怎麼算?
截至 2026 年 8 月 14 日,Mixedbread Pricing 將 TOAST 1 標示為 50% off 的 launch pricing:
| 計費項目 | 價格 |
|---|---|
| Input | 每 100 萬 token US$0.30 |
| Cached input | 每 100 萬 token US$0.04 |
| Output | 每 100 萬 token US$0.80 |
| TOAST 1 Semantic Search | 每 1,000 次查詢 US$1 |
| Rerank 加購 | 每 1,000 次查詢另加 US$1.50 |
Cached input 是系統重複讀取已快取內容時的費用,官方目前不收 cache write 費。Rerank 則是把初步搜尋結果再重新排序,讓最相關的內容排到前面。
評估成本時要把「模型 token」和「搜尋次數」分開計算。假設產品一次任務會拆出很多子查詢,搜尋費與 rerank 費可能比預期更快累積;如果大量文件能有效快取,token 成本則有機會下降。
目前價格是限時折扣,不適合直接寫進長期商業模型。POC 報告除了記錄當下帳單,也應以原價做一次壓力試算,避免正式上線後價格恢復就失去成本優勢。
可以接現有向量資料庫,不必先搬家
導入新檢索產品時,最昂貴的常常不是 API,而是重新匯入文件、改資料格式與重做權限。Mixedbread 表示,TOAST 1 雖然與自家 Search primitives 共同設計,但可接既有 retrieval index,不要求先把後端搬到 Mixedbread。
開發者可以透過 Chat Completions API,把 TOAST 1 當成現有 Agent 的檢索工具;Mixedbread 也提供公開的 toast-harness 作為整合範例。如果資料已經放在 Mixedbread Store,搜尋時開啟 agentic 選項即可使用。
這讓 TOAST 1 更適合小規模驗證。團隊可以保留原本的索引與權限架構,只替換檢索層,比較同一批問題的品質、成本與速度。不過,「能接既有索引」不代表零開發成本,還是要處理工具介面、錯誤重試、來源引用與觀測紀錄。
哪些團隊值得導入 TOAST 1?
TOAST 1 不是每個 AI 產品都需要。它的價值會隨問題複雜度與文件量增加。
較適合的情境包括:
- 法律合約、判例與內部規範,需要跨文件找條件與例外。
- 財務分析,要從試算表、簡報與報告拼出答案。
- 企業知識庫已有大量文件,但基礎 RAG 經常漏掉關鍵段落。
- 深度研究 Agent 的搜尋成本太高,主模型上下文常被原始資料占滿。
- 已有向量索引,希望先替換檢索 Agent,不想全面遷移資料。
不太需要的情境則包括:
- 單一 FAQ 或產品規格查詢,一次語意搜尋就能回答。
- 即時性比完整證據更重要,無法接受約 8~11 秒的檢索延遲。
- 資料量很小,直接放進模型上下文更簡單。
- 團隊尚未建立可量化的正確答案與引用驗收方式。
我的結論是中性偏多:有企業知識庫與複雜文件需求的團隊值得測,但不值得只看官方圖表就全面採用。真正的導入門檻不是 API 能不能呼叫,而是能否證明它在自己的資料上,以較低成本通過相同或更高的驗收標準。
最實際的 TOAST 1 POC 做法
先選 30~50 個平常真的會遇到的問題,保留目前搜尋流程作為對照組,再加入 TOAST 1 作為實驗組。問題應混合簡單查詢、跨文件比對、容易誤判的相似條款,以及找不到答案的案例。
每一題至少記錄五個指標:
- 答案是否正確。
- 引用來源是否真的支持答案。
- 總 token 與搜尋次數。
- 從提問到完成的時間。
- 每題總成本,而不是只看 TOAST 1 模型費。
如果 TOAST 1 只讓簡單問題變慢,卻沒有改善複雜題,就應該採條件式路由:簡單問題走原本搜尋,只有需要跨文件推理時,才啟用會自行拆解問題並多輪查找的 Agentic Search。這比把所有查詢一律送進深度搜尋更省,也更容易維護。
常見問題
TOAST 1 是大型語言模型嗎?
它是為深度搜尋訓練的專門模型,可以獨立執行檢索,也能作為其他大型語言模型的子 Agent。它的主要工作是找證據與整理上下文,不是取代通用模型完成所有推理與操作。
TOAST 1 可以取代 RAG 嗎?
不完全是。TOAST 1 仍然需要文件索引與搜尋後端,可以把它理解成 RAG 上方更主動的檢索層。簡單問題保留基礎 RAG 較省,複雜問題才啟用 TOAST 1 通常更合理。
TOAST 1 一定要使用 Mixedbread 的向量資料庫嗎?
不用。官方表示它可以接既有 retrieval index,不要求先遷移後端。不過,TOAST 1 與 Mixedbread Search 共同設計,官方認為搭配自家搜尋元件時能發揮最佳效果。
TOAST 1 每次查詢多少錢?
官方測試中的標準執行約 US$0.016~US$0.023,fusion 配置約 US$0.05~US$0.07。但實際成本要加上模型輸入、輸出、搜尋與 rerank,不能把測試平均值當成固定單價。
TOAST 1 適合一般聊天機器人嗎?
如果只是 FAQ 或短文件問答,通常不需要。TOAST 1 更適合跨文件、證據密集、基礎搜尋經常漏資料的任務。先做條件式路由,比所有問題都啟用深度搜尋更實際。
結語:更便宜的 AI,不一定要從主模型下手
TOAST 1 提出一個很實際的成本思路:不要讓最昂貴的模型包辦找資料、讀來源、推理與回答。把檢索交給專門 Agent,主模型只處理真正需要通用能力的部分,可能比單純更換便宜模型更有效。
OfficeQA Pro V2 的 70% 正確率,以及法律文件測試中 token 從 80.6M 降到 23M,都顯示這個方向值得繼續驗證。但這些數字仍不足以替任何公司直接做採購決定。
如果現有 RAG 已經能穩定回答大多數問題,就保留它;如果跨文件問題經常漏證據,再把 TOAST 1 放進困難題的路由。能在自己的資料上維持答案品質,同時降低總成本與等待時間,才是它真正值得上線的證據。