Apodex 1.1 是什麼?35B 開放權重模型、Agent Team 與 FrontierAgent 完整解析
Apodex 1.1 把 AI 的能力單位從回答問題改成完成工作。本文解析 35B Mini、非同步 Agent Team、FrontierAgent、實測成績與部署門檻。
AI 很會回答問題,不代表它能把工作做完。
一份研究任務可能同時包含搜尋資料、讀取 PDF、整理試算表、執行程式、修正錯誤與輸出報告。只要其中一個環節斷掉,最後那段寫得再流暢,也不能算完成。
Apodex 在 2026 年 8 月 24 日發布 Apodex 1.1,把這個差距稱為「working capability」,也就是 AI 能否在長時間任務中持續推進,並交出可檢查、可延續使用的成果。這次同步推出完整線上模型、35B 規模的 Apodex 1.1 Mini,以及開源執行框架 FrontierAgent。
先說結論:Apodex 1.1 最值得注意的不是某一項 benchmark 第一名,而是把模型、工具、檔案、多人協作與驗證放進同一套長任務流程。 對研究團隊、開發者與需要處理複雜文件的專業工作者,這個方向值得測試;對只需要問答、摘要或偶爾寫文案的人,部署成本與流程複雜度可能高過實際收益。
另一個必須保留的判斷是,現有成績主要來自 Apodex 自己發布的技術報告。它證明團隊提出了一套完整方法與可重現入口,但還不能直接等同於第三方已經證實 Apodex 全面領先其他模型。
Apodex 1.1 官方發布影片。影片來源:Apodex 官方 YouTube 頻道。
Apodex 1.1 是什麼?
Apodex 1.1 是一套為複雜、長時間工作設計的 AI 模型與執行系統。它不只產生答案,也能在同一個任務裡操作檔案、搜尋資料、執行程式、調整計畫、分派子任務,最後輸出文件或其他可驗收成果。
一般聊天模型的工作單位通常是「一個 Prompt 對應一個回答」。Apodex 則把工作單位改成「完成一項任務」。兩者的差別可以簡化如下:
| 比較項目 | 一般 AI 問答 | Apodex 1.1 的長任務模式 |
|---|---|---|
| 主要目標 | 產生一段合理回答 | 完成一項可驗收工作 |
| 可處理內容 | 文字與當次上傳內容 | 檔案、搜尋結果、程式、資料與工作成果 |
| 任務狀態 | 對話越長越容易遺漏早期限制 | 用工作區與任務狀態保存進度 |
| 遇到錯誤 | 可能重新回答或從頭開始 | 保留有效成果,再修正失敗分支 |
| 使用者介入 | 常要停止後重新下指令 | 執行中可加入需求,系統再調整後續計畫 |
| 最終交付 | 文字答案 | 報告、試算表、程式碼、圖表與可追溯紀錄 |
這裡的「可驗收」不是保證結果永遠正確,而是系統必須留下足夠的資料、計算與工作紀錄,讓人能看出它做了什麼,也能回頭檢查錯在哪裡。
Apodex 1.1 的產品線可分成三個部分:
- Apodex 1.1 完整模型:透過官方線上 workbench 使用,代表這次發布的最高能力版本。
- Apodex 1.1 Mini:35B 規模的開放權重模型,可自行部署並串接工具。
- FrontierAgent:讓模型實際讀檔、執行指令、分派 Subagent 與保存成果的開源執行框架。
模型負責判斷下一步要做什麼,FrontierAgent 提供能動手做事的環境。少了模型,框架不會自己推理;少了框架,模型也比較像會規劃的頭腦,無法穩定操作真實工作區。
這次更新的核心不是聊天,而是把工作做完
Apodex 技術報告把「working capability」定義為:朝真實世界目標持續、可驗證地推進。白話來說,一個 AI 不只要知道答案,也要能把中間工作一路完成。
例如,要分析一家公司是否值得投資,光搜尋新聞和寫摘要還不夠。系統可能需要讀財報 PDF、把多季數字整理進試算表、執行估值計算、核對引用,再把結論做成一份能交給同事審查的文件。任何一步的錯誤都可能推翻最後判斷。
Apodex 1.1 用兩條路提升這種能力:
- Environment Scaling:增加模型訓練時接觸的檔案、搜尋與程式執行環境,讓它學會在工具真的會失敗、資料真的會變動的情況下工作。
- Agentic Coordination Scaling:讓模型學會拆解長任務、分派平行工作、接收非同步結果,再依新證據重排計畫。
Environment Scaling 可以理解成「讓 AI 練習更多真實工作場景」。Agentic Coordination Scaling 則是「讓 AI 學會怎麼組織工作,而不是只把更多模型同時叫出來」。
我的判斷是,後者比「同時開很多 Agent」更重要。多開幾個模型並不難,真正困難的是避免重複研究、讓結果持續回到同一份任務狀態,並在某一條路走錯時保留其他有效成果。

Asynchronous Agent Team 如何運作?
Agent Team 是 Apodex 1.1 的多 Agent 協作模式。主 Agent 先把目標拆成多個有邊界的子任務,再交給不同 Subagent 平行處理。
ReAct 則是另一種較簡單的模式,名稱來自 Reason 與 Act。它由單一 Agent 反覆進行「判斷下一步、使用工具、讀取結果、再決定下一步」,適合範圍較集中、依賴關係清楚的任務。
| 模式 | 適合情境 | 優點 | 主要代價 |
|---|---|---|---|
| ReAct | 單一研究題、讀檔、程式庫分析 | 流程較簡單,成本較容易控制 | 工作大時容易變成單一路線排隊 |
| Agent Team | 多來源研究、跨檔案分析、可平行驗證 | 能同時探索不同證據與做法 | 需要更多模型呼叫、協調與驗證成本 |
Apodex 所說的「非同步」,代表主 Agent 不必等所有分支一起結束。只要其中一個 Subagent 先回傳有用結果,主 Agent 就能吸收資訊、更新任務狀態,甚至重排還沒完成的工作。
使用者也能在執行過程補上新檔案或要求。例如一項合約審查做到一半,使用者新增另一份附件,系統應保留沒有受影響的分析,只重做與新資料有關的部分,而不是整個任務歸零。
對 UX 來說,這比單純縮短等待時間更重要。當任務需要跑數十分鐘,使用者要看得見目前計畫、完成項目、失敗原因、交付檔案與需要確認的地方。Apodex 顯示的是可操作的任務狀態,而不是直接公開模型內部冗長的思考文字。
Statement Review 能消除 AI 幻覺嗎?
Apodex 1.1 在交付前加入 Statement Review,讓另一個驗證流程檢查關鍵主張是否真的有來源、引用是否對得上、計算結果是否符合程式輸出,以及證據不足時有沒有過度下結論。
這種設計比讓同一個 Agent 在結尾說「我已檢查」更有價值,因為產生內容與檢查內容至少在流程上被拆開。FrontierAgent 也會保存任務工作區、操作紀錄、產出檔案與變更,使用者能進一步人工核對。
但 Statement Review 不能被解讀成「零幻覺」。驗證 Agent 仍可能使用相近的模型、取得相同的不完整資料,或一起漏掉同一個前提。尤其在醫療、法律與金融情境,系統內部通過檢查不代表專業責任已經轉移給 AI。
比較實際的用法是,把它當成多一層品質關卡:先由系統抓引用錯置、證據不足與計算矛盾,再由具備責任與專業資格的人做最後核准。

Apodex 1.1 Mini 是開源模型嗎?
更精確的說法是:Apodex 1.1 Mini 是 Apache 2.0 授權的開放權重模型,FrontierAgent 則是 Apache 2.0 授權的開源框架。
開放權重代表開發者可以下載已訓練完成的參數,在自己的環境執行、量化或整合。這不等於訓練資料、完整訓練程式與每一項資料清理流程都已公開,因此不宜只用「完全開源」概括整套模型。
Apodex 1.1 Mini 以 Qwen3.5-35B-A3B-Base 為基礎,Hugging Face 顯示模型約有 36B 參數;技術報告以 35B 規模稱呼。官方同時提供原始權重,以及 FP8、NVFP4 與 GPTQ-Int4 等不同精度版本。
量化是用較少位元儲存模型參數,換取更低的顯示記憶體需求。代價是輸出品質、速度或工具呼叫穩定度可能改變,因此不能直接假設量化版會完整重現官方 benchmark。
Mini 支援 262,144 tokens 的建議最大上下文設定,也支援原生 function calling。Function calling 是模型依照開發者提供的工具格式,輸出結構化呼叫,讓程式知道它要搜尋、讀檔或執行哪一個功能。
本地部署不等於一般筆電就能順跑
「可以本地部署」最容易讓人誤會成一般 MacBook 或消費級顯示卡下載後就能直接使用完整版本。實際硬體門檻高得多。
FrontierAgent 本身可以在 macOS 或 Linux 執行,並連接相容 OpenAI API 格式的遠端模型端點。API 是讓兩套軟體依照既定格式交換指令與結果的介面。但若要把 35B 模型也放在本機,原始 BF16 權重大約需要 70 GB,還要加上 KV cache、執行框架與長上下文所需的額外記憶體。
官方文件對消費級 NVIDIA GPU 的說明很保守:
| 硬體起點 | 可行方向 | 限制 |
|---|---|---|
| RTX 4090 24 GB | 4-bit 量化版本 | 官方列為需要測量限制的候選設定 |
| RTX 5090 32 GB | GPTQ-Int4 等 4-bit 版本 | 才能在單卡留下部分執行空間 |
| 兩張相同 NVIDIA GPU | 量化模型搭配 tensor parallelism | 仍要驗證卡間連線、上下文與並發設定 |
| macOS | 執行 FrontierAgent,連接託管端點(由雲端保管並執行模型)或遠端端點 | 官方 NVIDIA SGLang 容器不能直接使用 Apple GPU |
KV cache 是模型保存先前文字與注意力計算結果的記憶體區域。上下文越長、同時執行的 Agent 越多,需要的記憶體就越高。因此,支援 262K tokens 不代表每一台機器都能用滿 262K。
對多數個人開發者來說,最實際的 MVP 不是先買硬體,而是先在 FrontierAgent 接一個託管模型端點(由雲端業者代為執行模型),驗證工作流是否真的有價值。只有需要資料留在內部、任務量穩定,而且已經算清楚 GPU 成本的團隊,才值得進一步部署 Mini。
Benchmark 成績怎麼看?
Apodex 1.1 技術報告涵蓋專業工作、金融研究、科學研究、一般推理、數學、搜尋與程式開發。最一致的結果不是每一項都拿第一,而是 Agent Team 在多個測試中高於同一模型的 ReAct 模式。
| Benchmark | Apodex 1.1 ReAct | Apodex 1.1 Agent Team | Agent Team 增幅 |
|---|---|---|---|
| GDPVal | 69.5 | 78.8 | 9.3 |
| APEX-Agents | 34.4 | 38.5 | 4.1 |
| FrontierFinance | 48.7 | 54.3 | 5.6 |
| FrontierScience-Research | 55.0 | 63.3 | 8.3 |
| BioMysteryBench Human-difficult | 23.5 | 35.3 | 11.8 |
| Humanity’s Last Exam | 53.2 | 56.1 | 2.9 |
這些數字真正支持的主張是:在 Apodex 的測試設定裡,額外的協調與平行運算通常能提高完成品質。它們不能單獨證明 Agent Team 比其他產品更省錢、更快,因為多 Agent 本來就會增加推論次數與工具成本。
Mini 的結果也值得看。35B Mini 在 FrontierFinance 從 ReAct 的 40.0 提升到 Agent Team 的 50.2,在 FrontierScience-Research 從 45.0 提升到 51.7。這顯示較小模型也能從協作框架受益,而不是只有完整旗艦模型有效。

不過,閱讀排行榜時要保留三個限制:
- 主要資料由 Apodex 團隊發布。 技術報告已交代部分評測方法,但仍需要更多第三方重跑與真實專案比較。
- 模型與執行框架一起影響分數。 不同系統使用的 Agent harness、工具、時間與額外計算量不完全相同,不能只用一個分數判定裸模型誰更強。
- 最難的完整科學工作仍遠未解決。 在團隊自建的 FrontierResearchBench 中,Apodex 1.1 Agent Team 的完整通過率為 12.4%。這反而是很有價值的誠實訊號:即使是現有前沿系統,要把每個步驟與成果一次交齊仍然很困難。
因此,我對 Apodex 1.1 的評價是「方法中性偏正面,市場領先結論維持中性」。如果後續第三方能在相同預算、相同工具與相同任務下重現結果,這個評價才會進一步轉為正面。
FrontierAgent 可以做什麼?
FrontierAgent 是 Apodex 隨 1.1 一起公開的 Agent runtime、終端機介面與評測套件。Runtime 可以理解成讓 Agent 實際運作的執行層,負責工具、檔案、任務狀態、權限與結果保存。
它提供兩種原生工作流:
react:一個具狀態的 Agent 逐步研究、讀檔、執行指令並產出成果。agent_team:由 coordinator 維護任務看板,再把有邊界的工作交給多個 Subagent。
專案還把工作區分成三個區域:唯讀輸入、可修改工作區與最終輸出。互動模式下,寫入、刪除、安裝套件與高風險指令會顯示差異並要求批准,工作變更也能透過 /revert 回復。
這些設計對企業導入比漂亮的聊天介面更重要。Agent 一旦能操作檔案與執行指令,權限邊界、操作紀錄、可回復性與輸出位置就會直接影響安全與維護成本。
但開源框架不等於拿來就能上正式環境。團隊仍要自行決定模型端點、搜尋服務、憑證管理、網路權限、沙箱方式、資料保留政策與人工核准點。真正的導入成本通常在這些系統邊界,而不是把 repository clone 下來的那幾分鐘。
哪些人值得試 Apodex 1.1?
Apodex 1.1 最適合的不是所有 AI 使用者,而是工作本身已經具備長流程、檔案與驗收條件的團隊。
值得測試的族群
- 需要同時處理論文、資料集、程式與報告的研究團隊。
- 會把財報、合約、試算表與內部文件放進同一個分析流程的專業工作者。
- 想研究多 Agent、任務狀態與可驗證交付的 AI 開發者。
- 有資料留存或內部部署需求,也具備 GPU 與維運能力的企業。
不必急著導入的族群
- 只需要日常問答、翻譯、摘要與短文生成的人。
- 沒有明確驗收條件,只想靠多 Agent 自動把模糊需求變正確的人。
- 沒有能力管理模型權限、執行環境與敏感檔案的小團隊。
- 因為 benchmark 排名就準備替換現有正式流程的公司。
我的建議是先挑一個「人工完成需要 2 至 4 小時、資料不敏感、成果可以明確檢查」的任務做測試。比較 ReAct、Agent Team 與既有人工流程的完成率、時間、模型成本與人工修正次數,再決定是否擴大。
Apodex 1.1 的主要風險與限制
1. 多 Agent 會增加成本,不是免費加速
平行執行可以縮短部分等待時間,但每個 Subagent 都會消耗 token、搜尋與工具資源。若任務無法有效拆解,多 Agent 可能只是讓多個模型重複查相同資料。
2. 驗證流程仍在同一個系統裡
Statement Review 能降低明顯錯誤,卻不是外部獨立審計。高風險結論仍要保留原始證據、計算與人工簽核。
3. 本地部署需要硬體與維運能力
35B 模型即使量化後,仍不是一般筆電的輕量應用。長上下文、多 Agent 與工具服務會進一步推高記憶體、儲存與穩定性要求。
4. 公開 benchmark 與真實工作仍有距離
Benchmark 能比較特定能力,無法完整反映公司內部資料品質、權限、系統整合與員工 Review 成本。企業導入應該以自己的任務集驗收,而不是只看總分。
5. 隱私政策依使用方式不同
Apodex 的隱私政策指出,消費者產品內容可能用於模型改善,除非使用者選擇退出;API 與商業服務預設不把客戶內容用於基礎模型訓練,但免費、試用或促銷方案另有條件。要處理公司或個人敏感資料,不能只看「有本地模型」四個字,還要確認實際使用的是線上服務、API 還是完整自管環境。
結論:Apodex 1.1 值得看的,是完成工作的方法
Apodex 1.1 沒有解決所有長任務問題,也沒有足夠的外部證據讓我們直接宣布它取代現有前沿模型。
但這次發布抓到一個真正重要的產品方向:AI 的下一個競爭單位,不只是誰在單題回答得更好,而是誰能在檔案、工具、錯誤與使用者介入都存在的情況下,把工作推進到可驗收的成果。
完整模型讓使用者在線上 workbench 體驗這套流程,35B Mini 提供自行部署的入口,FrontierAgent 則把任務狀態、Agent Team、檔案操作與交付框架開放出來。三者放在一起,才是 Apodex 1.1 的完整價值。
我的立場是中性偏正面:研究與開發團隊值得用真實任務測試,但不值得只因官方 benchmark 就直接遷移正式工作。最能改變這個判斷的證據,會是第三方在相同工具、成本與硬體條件下重現成績,以及企業實際導入後能否降低人工返工,而不是單純增加更多 Agent 呼叫。
常見問題
Apodex 1.1 可以免費使用嗎?
Apodex 官網提供線上使用入口,但訂閱與 credits 仍依帳號方案計算。官方定價頁指出,每次任務消耗的 credits 會依模型 token 與工具呼叫成本動態計算。Apodex 1.1 Mini 與 FrontierAgent 採 Apache 2.0 授權,可免費下載,但 GPU、儲存、搜尋 API 與維運仍會產生成本。
Apodex 1.1 Mini 可以在 MacBook 執行嗎?
FrontierAgent 可以在 macOS 執行並連接遠端或託管模型端點。官方本地 GPU 部署文件以 Linux 與 NVIDIA SGLang 為主,Apple GPU 不能直接使用該 NVIDIA 容器。社群可能提供 MLX 等量化格式,但不應把社群轉檔視為官方已驗證的完整效能。
Agent Team 一定比單一 Agent 好嗎?
不一定。官方 benchmark 顯示 Agent Team 在多項長任務中高於 ReAct,但它同時需要更多運算與協調。範圍集中、必須依序完成的任務,用單一 ReAct Agent 通常更簡單;只有能清楚拆成獨立工作流的任務,平行 Agent 才容易帶來實際收益。
Statement Review 是否代表答案不會出錯?
不是。Statement Review 會檢查關鍵主張、來源與計算,但驗證流程仍可能漏掉錯誤。它比較像內建品質檢查,不是醫師、律師、會計師或研究審查者的替代品。
Apodex 1.1 Mini 和完整 Apodex 1.1 有什麼差別?
完整 Apodex 1.1 是官方線上 workbench 使用的最高能力版本。Mini 是 35B 規模的開放權重版本,方便開發者自行部署與整合。官方沒有表示 Mini 與完整模型能力相同,兩者的 benchmark、硬體與使用方式也不應混為一談。