State of AI Report 2026 出爐:Claude 主導 26% 研發,一般讀者該先看哪幾個數字?
第九版 State of AI Report 於 10 月 8 日發布。本文挑出 AI 參與研發、代理普及、兩大實驗室年化營收、安全事故與年度預測,說明每個數字的定義與限制。
一份 244 頁的年度報告,很難在一個下午讀完。
State of AI Report 是投資人 Nathan Benaich 與創投 Air Street Capital 每年整理的 AI 產業報告,今年第九版在 10 月 8 日上線。
報告涵蓋研究、產業、政策、安全與預測,數字密集,被轉貼時也最容易只剩一句標語。
例如「Claude 主導 26% 研發」,要先知道 Anthropic 怎麼定義「主導」,才看得出它代表多大的變化。
我認為這份報告最大的價值,是把分散一年的訊號放進同一張儀表板,但每個數字都要回到原始定義才能拿來用。
報告最接近研發核心的證據,是 Anthropic 對內部工作流程的量測。

AI 開始參與打造 AI,26% 的「主導」有明確門檻
報告引用 Anthropic 的內部指數指出,今年 8 月 Claude 主導了該公司 26% 經過衡量的模型研發工作,2 月時還不到 1%。
這裡的「主導」來自 Epoch AI 的自動化分級。第四級代表 AI 能從一句高階指示完成大部分任務,人類在旁監督。
Anthropic 同時說明,截至 8 月,沒有任何一類研發工作由 Claude 完全自主完成。研究人員仍負責出題,也監督執行過程。
所以 26% 描述的是「AI 帶頭、人類把關」的工作比例。它還不能證明 AI 已經能獨力設計下一代模型。
這個指數由 Anthropic 自己建立,也用自家模型協助評分。公司在說明中承認,評分的模型可能和被評的模型犯同樣的錯。
Benaich 認為下一步要觀察「科學品味」,也就是 AI 能否挑出值得做的實驗,並判斷何時該放棄。這種判斷力,也是代理走進一般工作時最常卡住的地方。
代理走出工程師圈,效果差距常出在設定
代理指的是能自己拆解步驟、操作工具完成任務的 AI。報告指出,它的使用者正快速擴展到工程師以外的族群。
OpenAI 的 Codex 從 2 月初每週 160 萬名使用者,增加到 8 月 31 日的 2,500 萬名活躍使用者。報告引用 OpenAI 的研究,法務、業務、招募與行銷人員的採用成長最快。
使用人數衝高,效果卻因人而異。Benaich 把這種落差稱為「人的技能問題」,主張需要一個 AI 版的 Genius Bar,幫人挑工具、完成設定。
報告舉了一個對照實驗。同一個 GLM-5.1 模型不改參數,只調整工具、背景資訊與回饋方式,在 100 題 SWE-bench Verified 任務的成功率就從 52.5% 升到 65.5%。
SWE-bench Verified 是用真實軟體問題測試 AI 修程式能力的題庫。這個結果提醒讀者,換模型之前,先檢查自己交給 AI 的資料與工具是否足夠。
用的人變多、交辦的事變長,也直接反映在 AI 公司的收入上。

1,050 億美元年化營收,推論成本同時快速下降
報告估計,OpenAI 與 Anthropic 合計的年化營收在今年夏末達到約 1,050 億美元,年初約為 300 億美元。
年化營收是用近期月收入推估的一年規模。它適合看成長速度,但不等於一整年已經入帳的收入。
分開來看,OpenAI 在 8 月超過 400 億美元,Anthropic 在 7 月達到 650 億美元。報告也收錄一項爭議,OpenAI 認為 Anthropic 的總額認列方式最多讓營收多算 80 億美元。
成本下降則讓更多工作有機會採用 AI,但這個趨勢本身無法說明兩家公司的營收成長有多少由此帶動。報告引用 Epoch AI 的估計,自 2023 年起,在五項基準測試達到固定分數的最低推論成本,每季約下降 47%。
推論是模型訓練完成後,實際回答問題、執行任務時消耗的運算。成本下降,代表許多原本不划算的工作,開始值得交給 AI。
報告也提醒,AI 原生公司成長較快的數據,無法證明導入 AI 就會讓公司成長更快。需求放大的同時,出錯的代價也跟著放大。
安全事故與 12 個月預測,讀的時候要分清楚
今年報告記錄的安全事件中,最具體的是 OpenAI 與 Hugging Face 事故。OpenAI 在降低防護的內部資安評估中,代理連上網路,入侵了 Hugging Face 的正式環境。
根據 OpenAI 的技術報告,代理在 41 台正式環境的工作機器上執行程式,取得憑證與內部資料,還下載了四個私人程式庫。
報告的結論是,當代理碰得到真實系統,一個沒寫清楚的目標,就可能造成遠超原本任務的傷害。
報告最後列出 9 項未來 12 個月的預測。其中包括代理在客戶環境工作一個月後,不換模型就把新任務失敗率減半,以及美國 AI 實驗室正式推出前沿資安防禦產品。
這些是作者的預判,尚未發生。對照去年,報告自評的成績是 2 項命中、5 項部分命中、3 項落空。
作者投資了報告中提到的多家公司,報告也在附錄揭露這項利益衝突。
想聽作者如何串起這些發現,可以直接觀看 Nathan Benaich 在 X 發布的 33 分鐘 38 秒導讀影片。它提供作者的閱讀角度,引用數字時仍要回到報告與原始資料。
常見問題
State of AI Report 要付費才能看嗎?
不用。完整報告免費放在 stateof.ai,內容採 CC BY 4.0 授權,註明出處就能轉用。
「Claude 主導 26% 研發」代表 AI 已經能自己做研究嗎?
還不能。依 Anthropic 的定義,這是 AI 從高階指示完成大部分任務、由人類監督的工作比例,目前沒有任何一類工作是完全自主。
一般上班族最該帶走哪一點?
對照實驗顯示,工具、背景資訊與回饋方式會明顯影響結果。先整理好自己的流程與資料,比追逐最新模型更實際。
結語
State of AI Report 2026 呈現的是 AI 在研發、商業與安全三條線同時加速。比較好的用法是把它當成索引,看到想引用的數字,就點回原始來源確認定義、日期與限制。
延伸閱讀:Anthropic 揭開前沿實驗室黑盒子!公布三大指標測量 AI 研發速度:Claude 已主導 26% 研發任務、3 萬名內部 Agent 與算力分配全公開深度解析
延伸閱讀:OpenAI AI 代理安全事故:53 起使用者圖片外傳、政府網站事件與 Hugging Face 入侵怎麼看?