最強 AI 模型不一定答得最好:AlphaSense 實測揭露 Context、搜尋與模型路由的真正價值
AlphaSense 的 245 題金融研究測試顯示,企業 AI 的瓶頸不只在模型能力,而在 Context、搜尋、Harness 與模型路由。
每次新的 AI 模型發布,最容易比較的是排行榜分數、Token 價格與 Context Window 長度。但企業真正要買的不是模型規格,而是一個能穩定完成工作的答案。
金融研究平台 AlphaSense 在 2026 年 7 月做了一輪內部測試。他們讓不同模型回答 245 道多步驟金融研究題,並比較一般向量檢索與自家搜尋系統。結果顯示,同一個模型接上不同的搜尋與執行架構,答案品質和成本就可能出現明顯差距。
我的判斷是,這份測試最重要的結論不是「哪個模型第一名」,而是企業 AI 的競爭已經從單純選模型,轉向管理 Context。模型仍然重要,但資料找錯、來源排錯或塞入太多雜訊,再聰明的模型也只能在錯誤材料上推理。
AlphaSense 是什麼?這次測試想回答什麼?
AlphaSense 是提供企業與金融研究使用的市場情報平台,內容包含公司文件、法說會逐字稿、券商研究、專家訪談與產業資料。它面對的問題不是一般聊天,而是「找出最新一季數字、比較多家公司、確認來源,再整理成可引用結論」這類需要跨文件推理的工作。
因此,AlphaSense 想回答的問題很實際:如果前沿模型已經能讀取很長的內容,企業是否還需要投入搜尋、資料索引與工作流程設計?還是把文件交給最新模型就夠了?
AlphaSense 的答案很明確:不夠。該公司表示,在相同資料庫與模型下,使用自家搜尋及執行架構,單題成本約為一般向量檢索方案的三分之一,答案在成對比較中也更常被偏好。不過,這是 AlphaSense 針對自家金融研究場景的內部結果,不能直接當成所有產業都適用的模型排行榜。

Context 是什麼?為什麼比 Context Window 更重要?
Context 可以理解成「模型回答這一題時,眼前實際拿到的所有資訊」,包括使用者問題、系統指令、搜尋結果、文件片段、工具回傳內容與前面的對話紀錄。
Context Window 則是模型一次最多能容納多少 Token。Token 是模型切分文字後使用的基本單位,一個中文字可能對應一個或多個 Token。Context Window 很大,只代表桌面放得下更多資料,不代表桌上的資料都正確,也不代表模型能同樣準確地使用每一段內容。
這個差別很像請分析師寫報告。給他一間能放十萬頁文件的大辦公室,不等於報告會更好。真正影響成果的是,有沒有人先找出最新財報、排除重複新聞、標出資料期間,再把最重要的證據放到手邊。
Anthropic 將這類工作稱為 Context Engineering,也就是持續挑選、整理與維護模型當下最需要的資訊。相關研究「Lost in the Middle」也發現,當重要資訊藏在很長內容的中間時,模型表現可能下降。換句話說,能塞入更多內容,和能準確使用更多內容,是兩件不同的事。
為什麼前沿 AI 模型仍然不擅長搜尋?
AlphaSense 把失敗原因分成三類:搜尋問題寫錯、來源排序錯誤,以及不知道何時停止。
1. 使用者的問題,不等於搜尋引擎需要的查詢
金融問題常帶有期間換算、股票代號、人物身分與文件類型。例如「最新一季表現」可能指公司會計年度的季度,不一定是曆年季度。同一個縮寫也可能同時代表公司、產品或資料來源。
模型即使看得懂原問題,也未必會把它拆成正確的搜尋條件。第一步找錯,後面的推理再完整,也只是把錯誤資料整理得更像答案。
2. 語意相似,不代表來源同樣可靠
檢索增強生成(Retrieval-Augmented Generation,RAG)是先從外部資料找出相關片段,再交給模型回答的方法。常見的向量檢索會依文字在語意上的接近程度找資料,但法說會逐字稿、券商預測、新聞報導與公司申報文件,可能同時談到同一個數字。
對分析師來說,這些來源不能一視同仁。問題如果問已公布的營收,公司申報文件通常比市場傳聞更有權威。問題如果問投資人預期,券商報告又可能比財報更切題。搜尋系統必須同時理解主題、時間、來源角色與可信度,不能只看句子像不像。
3. 模型不知道什麼時候已經找夠了
AI Agent 是能自行呼叫搜尋、資料庫或其他工具,逐步完成任務的 AI 系統。它的常見問題有兩個極端:太早停止,拿舊資料回答最新問題;或不斷重搜,把重複文件與低價值片段塞滿 Context。
後者不只花更多 Token,也可能讓答案變差。因為模型必須在更長、更雜的內容裡重新判斷哪些資料可信。AlphaSense 的測試甚至出現新模型因為「抓太多資料」而比前一代更貴、分數更低的情況。這說明搜尋次數不是越多越好,關鍵是每一次搜尋能否提高證據完整度。
245 道金融研究題,AlphaSense 怎麼測?
AlphaSense 使用 245 道困難的多步驟金融問題,內容涵蓋公司研究、財務建模、財報事件、盡職調查、產業與總體經濟等情境。題目刻意加入時間限制、跨來源比較、錯字、股票代號與混合語言,讓測試更接近分析師實際輸入的問題。
每一道題在模型作答前,就先建立獨立評分規則。這些規則會指定必要公司、指標、期間、來源權威性、資料廣度與引用要求。先固定標準再看答案,可以降低評分者因模型寫得流暢,就跟著改變標準的風險。
檢索品質與最終答案品質則分開評分,並以一般向量 RAG 作為 1.0 的相對基準。這個設計的價值在於,它不只問「最後寫得好不好」,還能追查問題出在沒找到證據,或找到後沒有正確理解。
| 測試配置 | 成對比較的偏好結果 | 這個步驟增加了什麼 |
|---|---|---|
| 固定 Claude Opus 4.8,只把一般向量檢索換成 AlphaSense Search | 1.7:1 | 更適合金融資料的搜尋與排序 |
| AlphaSense Search 搭配單一表現最佳模型 | 1.8:1 | 更強的單模型推理能力 |
| 再加入查詢生成、規劃與搜尋分數傳遞 | 2.1:1 | 完整執行架構,也就是 Harness |
| 依任務類型選用不同模型 | 2.8:1 | 模型路由與分工 |
Harness 可以理解成包在模型外面的工作骨架。它負責拆解問題、選工具、控制搜尋、整理 Context,再把任務交給模型。這張表真正指出的是,模型只占整套系統的一部分。搜尋、流程與路由層層加入後,提升幅度比單純更換模型更明顯。

哪個模型表現最好?為什麼名次不是重點?
在 AlphaSense 2026 年 7 月這一輪測試中,單一模型以 GPT-5.6 Sol 的相對答案品質最高,分數為 1.73。Claude Opus 4.8 為 1.60,Kimi K3 為 1.44,Gemma 4-31B 與 Claude Sonnet 5 都是 1.34。
但這組數字不能被解讀成通用能力排名。所有模型都在 AlphaSense 的資料庫、搜尋架構與金融題目上測試,最適合簡報生成的模型,不一定最適合抽取財務指標。AlphaSense 也指出,沒有任何單一模型贏得過半題目,不同模型分別擅長數字擷取、篩選與長篇綜合分析。
因此,我不建議企業根據這張表就全面更換模型。比較實際的做法是,把自家最常見的 30 到 100 個真實任務整理成測試集,再觀察品質、速度、失敗類型與單題總成本。模型名稱會持續更換,但自己的驗收題目可以長期累積。

Token 單價便宜,為什麼整題反而可能更貴?
模型 API 是讓其他軟體呼叫 AI 模型的程式介面,通常按輸入與輸出的 Token 計價。但企業交付的是一份答案,不是一百萬個 Token。真正該看的指標,是完成一項任務總共用了多少搜尋、多少輸入、多少重試,以及最後是否需要人工重做。
AlphaSense 的測試中,Kimi K3 的單位 Token 價格比 GPT-5.6 Sol 低,單題總成本卻更高,原因是它為了組合 Context 使用更多 Token。另一個案例是 Claude Opus 5,因為抓取過多資料,答案品質低於 Opus 4.8,單題成本卻高出數倍。
這對產品經理很重要。只比較模型價目表,容易選到「每個零件便宜,但完成一次工作更貴」的方案。比較合理的成本公式應該是:
單題總成本=模型推理+檢索與工具呼叫+重試+人工校對與返工
如果搜尋系統能先刪掉重複與低權威資料,模型不只少讀一些內容,也可能少走幾輪錯誤路徑。AlphaSense 所說的三倍成本差距,反映的正是整個任務流程,而不是 API 公開價目表的差異。
對企業 AI 產品來說,真正值得投資的 5 個地方
1. 先建立來源層級,再談 RAG
文件進入資料庫前,就要知道它是官方申報、會議逐字稿、研究報告或新聞。來源日期、公司、期間與文件類型應該成為可搜尋欄位。否則 RAG 只是在一堆沒有身分的文字片段裡找相似句子。
2. 把 Context 當成有限預算
每次加入資料,都應該問它是否能提高答案品質。重複內容、過期版本與無法支持結論的片段,會占用模型注意力。Context Window 的上限可以很大,產品仍應追求「最小但足夠」的證據集合。
3. 用真實任務持續評測
模型發布時的公開 Benchmark 不一定代表產品內表現。企業需要保留常見問題、困難案例與曾經出錯的 Case,並在換模型、改 Prompt、調整搜尋或新增工具後重新測試。
OpenAI 對第三方評測的建議也指出,Agent 的表現不只取決於模型,還受到工具、環境與執行設定影響。這與 AlphaSense 的結果一致:要測整套系統,不能只測一個聊天視窗裡的回答。
4. 依任務路由,不要每題都叫最貴模型
數字抽取、文件分類、深度推理與簡報生成需要的能力不同。較小或開放權重模型可以處理高頻、規則清楚的子任務,前沿模型則負責規劃、複雜推理與最後整合。
模型路由的維護成本比「所有任務只用一個模型」高,所以 MVP 不需要一開始就建造複雜調度中心。最實際的順序是先用一個可靠模型跑通流程,再把成本最高、量最大或失敗最集中的一類任務拆出去。
5. 對重複問題預先計算
供應鏈關係、公司多空論點與固定財務指標,往往會被不同使用者重複查詢。與其每次都讓 Agent 從數百份文件重建答案,不如先整理成可更新的結構化資料,只在新文件進來時處理差異。
這種做法會增加資料管線與更新機制的維護成本,適合高頻且格式穩定的問題。低頻、探索性強的問題,仍然適合即時搜尋,不必為了理論上的效率把所有內容都預先建模。

這份 AlphaSense 測試有哪些限制?
第一,這是 AlphaSense 自行設計、執行與公布的內部 Benchmark,並非獨立第三方驗證。它能證明該公司在這組設定下觀察到差距,不能單獨證明產品在所有客戶情境都有相同比例的改善。
第二,所有配置使用同一套 AlphaSense 索引內容。這有助於隔離模型與檢索變因,卻沒有衡量資料庫本身相對於公開網路或其他供應商的優勢。
第三,題目集中在金融與企業研究。來源權威性、時間敏感度與跨公司比較在這個領域特別重要。客服摘要、創意寫作或程式開發可能得到不同結果。
第四,評分使用語言模型擔任 Judge。AlphaSense 用事前固定的評分規則降低偏差,也把檢索與答案分開評估,但自動評分仍不等於完整的人類專家審查。
所以,我對 AlphaSense 的核心主張偏正面,對具體倍數則保持保留。它提出的方向與長 Context 研究、Context Engineering 實務相符,但企業仍要用自己的資料與工作流程重測,不能直接套用 2.8 倍或三分之一成本。
企業現在該換模型,還是先整理 Context?
如果現有系統常找不到資料、引用過期來源、重複搜尋,或每題塞入大量文件,優先改善檢索與 Context。此時直接換成更強模型,可能只是用更高價格掩蓋資料流程問題。
如果檢索結果已經穩定,錯誤主要出在多步推理、數字計算或輸出格式,再測試更強模型才合理。若不同任務的成本與品質差異已經很明顯,下一步才是模型路由。
對多數團隊來說,最實際的 MVP 路線是:固定一個模型、整理 30 道真實題目、記錄來源與答案、加入可追蹤的檢索流程,再比較改搜尋和換模型各自帶來多少改善。這比一開始同時接五個模型,更快看出真正瓶頸,也比較容易維護。
常見問題
AlphaSense 的測試證明 GPT-5.6 Sol 是最強模型嗎?
沒有。它只顯示 GPT-5.6 Sol 在 AlphaSense 2026 年 7 月的 245 道金融研究題與指定系統配置中,單一模型相對分數最高。其他任務、工具、資料庫與成本條件都可能改變排名。
Context 越長,AI 回答就越準嗎?
不一定。長 Context 能放入更多資料,但重複、過期與不相關內容也會稀釋注意力。產品應該優先提高資料的相關性、權威性與新鮮度,再考慮增加長度。
RAG 和 Context Engineering 有什麼差別?
RAG 主要負責從外部資料找出內容,再交給模型回答。Context Engineering 的範圍更大,還包含系統指令、工具設計、歷史紀錄、資料壓縮、來源排序,以及每一步要保留或刪除哪些資訊。
為什麼最新模型可能比舊模型差?
模型能力與任務是配對關係。新模型可能更擅長某些推理或內容生成,卻在特定工具使用、搜尋停止或輸出格式上退步。沒有回歸測試,產品團隊可能在升級後才發現成本增加、品質下降。
中小團隊需要建立模型路由嗎?
一開始通常不需要。先用單一可靠模型跑通流程,找出高成本、高頻或容易失敗的任務,再針對那一小部分加入第二個模型。這樣能保留路由的效益,又不會過早增加維護成本。
結語:模型會換,Context 與評測能力才會累積
AlphaSense 這次測試提醒了一件常被模型排行榜掩蓋的事:企業 AI 的答案,是模型、資料、搜尋、工具與評測共同產生的結果。
最強模型仍然有價值,特別是在規劃、深度推理與複雜分析上。但如果搜尋系統找錯資料、沒有區分來源權威性,也不知道何時停止,增加模型能力只會讓錯誤流程跑得更昂貴。
因此,與其每次新模型發布就全面遷移,我會優先累積三項不容易過期的資產:可追溯的資料庫、貼近真實工作的測試集,以及能控制 Context 的執行架構。模型名次會一直變,這三項能力卻能讓團隊更快採用下一個真正適合的模型。