TOAST 1 是什麼?Mixedbread 用搜尋 Agent 降低 AI 查資料成本,價格與實測一次看

TOAST 1 把拆問題、搜尋文件與整理證據交給專門 Agent。本文解析效能、價格、限制,以及哪些企業知識庫值得先做 POC。

Share
Mixedbread Introducing TOAST 1 官方產品主視覺
TOAST 1 是 Mixedbread 推出的專門檢索 Agent,可把搜尋與證據整理工作從通用前沿模型中分離。圖片來源:Mixedbread 官方發布頁。

企業導入 AI Agent 時,成本不一定都花在最後那段推理。AI Agent 是能自行拆解任務並呼叫工具的 AI 系統。很多 token 與等待時間,其實消耗在反覆搜尋文件、打開來源、排除不相關內容,再把證據塞回模型上下文。Token 是模型計算文字用量的基本單位,也是多數 API 的計費依據。

Mixedbread 發布的 TOAST 1,就是專門處理這段工作的搜尋 Agent。它不急著取代 GPT-5.6 Sol、Claude 等通用模型,而是先把問題拆開、找出證據、檢查來源,再把整理好的資料交給主 Agent 回答。

這個方向值得關注。對法律、財務分析、企業知識庫與深度研究等文件密集型工作,專門化檢索有機會讓昂貴模型把算力用在真正需要推理的地方。不過,目前最亮眼的成績主要由 Mixedbread 自行測試。最實際的做法不是直接全面換掉既有搜尋,而是先拿公司的真實問題做一輪概念驗證(POC),確認方案在小範圍內是否有效。

TOAST 1 是什麼?

TOAST 1 是一個專門檢索 Agent,也就是負責「找資料與整理證據」的 AI 模型。它可以獨立執行深度搜尋,也能作為主 Agent 呼叫的子 Agent。

一般語意搜尋通常根據一個問題,從向量資料庫找出幾段意思相近的文字。TOAST 1 則會接手整個搜尋迴圈:

  1. 理解原始問題,拆成多個較容易查找的子問題。
  2. 對文件庫進行多次搜尋,蒐集候選證據。
  3. 檢查來源內容,排除看似相近、實際無關的結果。
  4. 整理出較精簡的證據包,再交回主 Agent 推理與回答。

例如,使用者問「公司被收購時,這份合約能不能轉讓?」普通搜尋可能只找出包含「轉讓」或「控制權變更」的段落。TOAST 1 會進一步把問題拆成轉讓條款、控制權變更、例外條件與通知義務,再把相關內容一起交給主模型判斷。

這種分工的重點不是讓搜尋 Agent 寫出最終答案,而是減少主模型自己在大量文件裡來回翻找。上下文更乾淨,通常也代表更少 token 與更低的誤判機會。

0:00
/0:00

Mixedbread 以 Dwarkesh Podcast 逐字稿展示 TOAST 1 的深度搜尋流程。影片來源:Mixedbread 官方發布頁

TOAST 1 和一般 RAG 有什麼不同?

RAG 是「檢索增強生成」的縮寫。白話來說,就是回答前先從指定資料庫找內容,再讓生成式 AI 根據這些資料作答。

傳統 RAG 常把搜尋當成一次性的前置步驟。問題送進去後,系統找出最相近的幾段文字,接著就交給大型語言模型。這種做法速度快、架構簡單,但遇到需要跨文件比對、條件很多或用詞不一致的問題時,第一次搜尋可能拿不到足夠證據。

TOAST 1 把檢索本身變成一個可以多步驟工作的 Agent。它會根據找到的內容調整下一次搜尋,因此更接近「研究員查資料」,而不是「搜尋框回傳前十筆結果」。

比較項目 一般語意搜尋/基礎 RAG TOAST 1 通用前沿模型自行搜尋
搜尋方式 通常一次查詢後取回相似片段 拆子問題、多輪搜尋、檢查並整理證據 主模型同時負責搜尋與推理
優點 快、便宜、容易維護 複雜問題的證據較完整,可節省主模型上下文 彈性最高,能同時處理模糊需求與最終答案
代價 容易漏掉跨文件關係 比單次搜尋多一層 Agent 成本與延遲 token 與每題成本通常最高
適合情境 FAQ、單文件查詢、簡單知識庫 法律、財務、研究與企業內部文件 需求仍模糊、需要多種工具與高階判斷

我的判斷是,TOAST 1 最適合補在「基礎 RAG 不夠準,但每一題都用最貴模型搜尋又太浪費」的中間地帶。若問題只要查單一欄位,增加 Agent 反而會讓系統更慢;如果任務還需要做決策、寫報告或操作外部系統,TOAST 1 也不能取代主 Agent。

OfficeQA Pro V2:70% 正確率,每題約 US$1.15

TOAST 1 最吸睛的成績來自企業財務文件問答。OfficeQA Pro V2 是 Databricks 發布的企業推理標準化測試(benchmark),要求 Agent 從真實感較高的試算表、簡報與文件中找資料並回答問題。

Mixedbread 表示,讓 GPT-5.6 Sol 在 Codex 中呼叫 TOAST 1 子 Agent 後,答案正確率達到 70%,每個任務成本約 US$1.15。文章圖表把成本四捨五入為約 US$1.20。作為比較,Databricks 原評估中的 Claude Fable 5 搭配 Genie 為 60%,每題約 US$4;GPT-5.6 Sol 在 Codex 中沒有 TOAST 1 時,則為 33%。

這組結果支持一個重要觀察:更好的搜尋不只省錢,也可能提高最後答案品質。主模型若一開始拿到錯誤或不完整的證據,後面再強的推理也很難補救。

但這裡要分清楚資料來源。Databricks 提供 Genie 與其他模型的原始評估數字,Codex+TOAST 1 的測試則由 Mixedbread 執行。它是有參考價值的供應商測試,還不是第三方對 TOAST 1 的完整重現。企業評估時,應該用自己的 Excel、PDF、合約與常見問題再測一次。

TOAST 1 搭配 GPT-5.6 Sol 在 OfficeQA Pro V2 的答案正確率與成本比較
Codex+TOAST 1 的測試由 Mixedbread 執行;其他 Genie 與 model provider harness 數字取自 Databricks。 圖片來源:Mixedbread 官方發布頁

法律文件測試:答案分數相同,token 降到約 3 分之 1

第二組測試更能看出 TOAST 1 的成本價值。Mixedbread 使用 Harvey LAB 的 Law Firm Knowledge benchmark,隨機選出 33 個任務,比較三種檢索配置。

配置 總 token 平均每題 Agent 迴圈 任務分數
Vanilla Agent 80.6M 21.7 55
加入 Mixedbread Search 47M 14.6 55
再加入 TOAST 1 子 Agent 23M 11.2 55

三組最後分數都是 55,代表這次比較沒有提高答案分數,而是在相同結果下減少搜尋消耗。從 80.6M 降到 23M,相當於使用約 3.5 倍更少的 token;Mixedbread 表示總成本降幅超過 60%。

這個結果對產品團隊比單純「模型更聰明」更實用。企業通常已經有可接受的答案品質,真正卡住的是每題太貴、等待太久,或上下文很快被文件塞滿。若專門檢索能維持相同結果,又把 Agent 迴圈從 21.7 次降到 11.2 次,才有機會把 POC 變成日常可負擔的功能。

限制也很清楚:這次只測 33 題子集,而且分數沒有上升。因此,它證明的是特定設定下的效率改善,不代表所有法律工作都能提高準確率。

Vanilla Agent、Mixedbread Search 與 TOAST 1 在法律文件測試的 token 用量比較
三組任務分數同為 55,加入 TOAST 1 後,總 token 由 80.6M 降到 23M。測試使用 Harvey LAB benchmark 的 33 題子集。 圖片來源:Mixedbread 官方發布頁

TOAST 1 速度與每次查詢成本

Mixedbread 公布的深度搜尋測試中,標準 TOAST 1 每次查詢約 US$0.016~US$0.023,中位延遲為 8 秒;追求最高品質的 fusion 配置約 US$0.05~US$0.07,中位延遲為 11 秒。Fusion 可以理解成組合多種搜尋或排序結果,以較高成本換取更完整的證據。

在 Mixedbread 的評估裡,達到相近表現的 TOAST 1 配置便宜 7~11 倍。通用前沿模型的檢索 Agent 在相同評估中,需要 20 秒到 4 分鐘。

這些數字說明專門模型確實可能改善搜尋的成本結構,但不能直接拿「每次 US$0.016」估算整個產品。實際帳單還會受到輸入與輸出 token、搜尋次數、是否使用 rerank,以及主 Agent 最後推理成本影響。資料庫品質與文件切分方式,也會改變需要搜尋幾輪。

TOAST 1 API 價格怎麼算?

截至 2026 年 8 月 14 日,Mixedbread Pricing 將 TOAST 1 標示為 50% off 的 launch pricing:

計費項目 價格
Input 每 100 萬 token US$0.30
Cached input 每 100 萬 token US$0.04
Output 每 100 萬 token US$0.80
TOAST 1 Semantic Search 每 1,000 次查詢 US$1
Rerank 加購 每 1,000 次查詢另加 US$1.50

Cached input 是系統重複讀取已快取內容時的費用,官方目前不收 cache write 費。Rerank 則是把初步搜尋結果再重新排序,讓最相關的內容排到前面。

評估成本時要把「模型 token」和「搜尋次數」分開計算。假設產品一次任務會拆出很多子查詢,搜尋費與 rerank 費可能比預期更快累積;如果大量文件能有效快取,token 成本則有機會下降。

目前價格是限時折扣,不適合直接寫進長期商業模型。POC 報告除了記錄當下帳單,也應以原價做一次壓力試算,避免正式上線後價格恢復就失去成本優勢。

可以接現有向量資料庫,不必先搬家

導入新檢索產品時,最昂貴的常常不是 API,而是重新匯入文件、改資料格式與重做權限。Mixedbread 表示,TOAST 1 雖然與自家 Search primitives 共同設計,但可接既有 retrieval index,不要求先把後端搬到 Mixedbread。

開發者可以透過 Chat Completions API,把 TOAST 1 當成現有 Agent 的檢索工具;Mixedbread 也提供公開的 toast-harness 作為整合範例。如果資料已經放在 Mixedbread Store,搜尋時開啟 agentic 選項即可使用。

這讓 TOAST 1 更適合小規模驗證。團隊可以保留原本的索引與權限架構,只替換檢索層,比較同一批問題的品質、成本與速度。不過,「能接既有索引」不代表零開發成本,還是要處理工具介面、錯誤重試、來源引用與觀測紀錄。

哪些團隊值得導入 TOAST 1?

TOAST 1 不是每個 AI 產品都需要。它的價值會隨問題複雜度與文件量增加。

較適合的情境包括:

  • 法律合約、判例與內部規範,需要跨文件找條件與例外。
  • 財務分析,要從試算表、簡報與報告拼出答案。
  • 企業知識庫已有大量文件,但基礎 RAG 經常漏掉關鍵段落。
  • 深度研究 Agent 的搜尋成本太高,主模型上下文常被原始資料占滿。
  • 已有向量索引,希望先替換檢索 Agent,不想全面遷移資料。

不太需要的情境則包括:

  • 單一 FAQ 或產品規格查詢,一次語意搜尋就能回答。
  • 即時性比完整證據更重要,無法接受約 8~11 秒的檢索延遲。
  • 資料量很小,直接放進模型上下文更簡單。
  • 團隊尚未建立可量化的正確答案與引用驗收方式。

我的結論是中性偏多:有企業知識庫與複雜文件需求的團隊值得測,但不值得只看官方圖表就全面採用。真正的導入門檻不是 API 能不能呼叫,而是能否證明它在自己的資料上,以較低成本通過相同或更高的驗收標準。

最實際的 TOAST 1 POC 做法

先選 30~50 個平常真的會遇到的問題,保留目前搜尋流程作為對照組,再加入 TOAST 1 作為實驗組。問題應混合簡單查詢、跨文件比對、容易誤判的相似條款,以及找不到答案的案例。

每一題至少記錄五個指標:

  1. 答案是否正確。
  2. 引用來源是否真的支持答案。
  3. 總 token 與搜尋次數。
  4. 從提問到完成的時間。
  5. 每題總成本,而不是只看 TOAST 1 模型費。

如果 TOAST 1 只讓簡單問題變慢,卻沒有改善複雜題,就應該採條件式路由:簡單問題走原本搜尋,只有需要跨文件推理時,才啟用會自行拆解問題並多輪查找的 Agentic Search。這比把所有查詢一律送進深度搜尋更省,也更容易維護。

常見問題

TOAST 1 是大型語言模型嗎?

它是為深度搜尋訓練的專門模型,可以獨立執行檢索,也能作為其他大型語言模型的子 Agent。它的主要工作是找證據與整理上下文,不是取代通用模型完成所有推理與操作。

TOAST 1 可以取代 RAG 嗎?

不完全是。TOAST 1 仍然需要文件索引與搜尋後端,可以把它理解成 RAG 上方更主動的檢索層。簡單問題保留基礎 RAG 較省,複雜問題才啟用 TOAST 1 通常更合理。

TOAST 1 一定要使用 Mixedbread 的向量資料庫嗎?

不用。官方表示它可以接既有 retrieval index,不要求先遷移後端。不過,TOAST 1 與 Mixedbread Search 共同設計,官方認為搭配自家搜尋元件時能發揮最佳效果。

TOAST 1 每次查詢多少錢?

官方測試中的標準執行約 US$0.016~US$0.023,fusion 配置約 US$0.05~US$0.07。但實際成本要加上模型輸入、輸出、搜尋與 rerank,不能把測試平均值當成固定單價。

TOAST 1 適合一般聊天機器人嗎?

如果只是 FAQ 或短文件問答,通常不需要。TOAST 1 更適合跨文件、證據密集、基礎搜尋經常漏資料的任務。先做條件式路由,比所有問題都啟用深度搜尋更實際。

結語:更便宜的 AI,不一定要從主模型下手

TOAST 1 提出一個很實際的成本思路:不要讓最昂貴的模型包辦找資料、讀來源、推理與回答。把檢索交給專門 Agent,主模型只處理真正需要通用能力的部分,可能比單純更換便宜模型更有效。

OfficeQA Pro V2 的 70% 正確率,以及法律文件測試中 token 從 80.6M 降到 23M,都顯示這個方向值得繼續驗證。但這些數字仍不足以替任何公司直接做採購決定。

如果現有 RAG 已經能穩定回答大多數問題,就保留它;如果跨文件問題經常漏證據,再把 TOAST 1 放進困難題的路由。能在自己的資料上維持答案品質,同時降低總成本與等待時間,才是它真正值得上線的證據。

資料來源