State of AI Report 2026 出爐:Claude 主導 26% 研發,一般讀者該先看哪幾個數字?

第九版 State of AI Report 於 10 月 8 日發布。本文挑出 AI 參與研發、代理普及、兩大實驗室年化營收、安全事故與年度預測,說明每個數字的定義與限制。

Share
State of AI Report 2026 投影片:Claude 主導 Anthropic 模型研發工作的比例,2026 年 8 月達 26%
State of AI Report 2026 第 20 頁投影片,引用 Anthropic 研發自動化指數,顯示被評為「AI 主導」的研發工作比例在 2026 年 8 月達 26%。來源:stateof.ai,CC BY 4.0。 圖片來源:State of AI Report 2026 / Air Street Capital, CC BY 4.0,資料來源 Anthropic。

一份 244 頁的年度報告,很難在一個下午讀完。

State of AI Report 是投資人 Nathan Benaich 與創投 Air Street Capital 每年整理的 AI 產業報告,今年第九版在 10 月 8 日上線。

報告涵蓋研究、產業、政策、安全與預測,數字密集,被轉貼時也最容易只剩一句標語。

例如「Claude 主導 26% 研發」,要先知道 Anthropic 怎麼定義「主導」,才看得出它代表多大的變化。

我認為這份報告最大的價值,是把分散一年的訊號放進同一張儀表板,但每個數字都要回到原始定義才能拿來用。

報告最接近研發核心的證據,是 Anthropic 對內部工作流程的量測。

State of AI Report 2026 投影片:Claude 主導 Anthropic 模型研發工作的比例,2026 年 8 月達 26%
State of AI Report 2026 第 20 頁投影片,引用 Anthropic 研發自動化指數,顯示被評為「AI 主導」的研發工作比例在 2026 年 8 月達 26%。來源:stateof.ai,CC BY 4.0。 圖片來源:State of AI Report 2026 / Air Street Capital, CC BY 4.0,資料來源 Anthropic。
Nathan Benaich 導讀 State of AI Report 2026。影片由 stateof.ai 官方首頁直接嵌入,同一導讀亦由作者在 X 發布。 影片來源:Nathan Benaich/Air Street Capital;RAAIS,stateof.ai官方首頁嵌入。

AI 開始參與打造 AI,26% 的「主導」有明確門檻

報告引用 Anthropic 的內部指數指出,今年 8 月 Claude 主導了該公司 26% 經過衡量的模型研發工作,2 月時還不到 1%。

這裡的「主導」來自 Epoch AI 的自動化分級。第四級代表 AI 能從一句高階指示完成大部分任務,人類在旁監督。

Anthropic 同時說明,截至 8 月,沒有任何一類研發工作由 Claude 完全自主完成。研究人員仍負責出題,也監督執行過程。

所以 26% 描述的是「AI 帶頭、人類把關」的工作比例。它還不能證明 AI 已經能獨力設計下一代模型。

這個指數由 Anthropic 自己建立,也用自家模型協助評分。公司在說明中承認,評分的模型可能和被評的模型犯同樣的錯。

Benaich 認為下一步要觀察「科學品味」,也就是 AI 能否挑出值得做的實驗,並判斷何時該放棄。這種判斷力,也是代理走進一般工作時最常卡住的地方。

代理走出工程師圈,效果差距常出在設定

代理指的是能自己拆解步驟、操作工具完成任務的 AI。報告指出,它的使用者正快速擴展到工程師以外的族群。

OpenAI 的 Codex 從 2 月初每週 160 萬名使用者,增加到 8 月 31 日的 2,500 萬名活躍使用者。報告引用 OpenAI 的研究,法務、業務、招募與行銷人員的採用成長最快。

使用人數衝高,效果卻因人而異。Benaich 把這種落差稱為「人的技能問題」,主張需要一個 AI 版的 Genius Bar,幫人挑工具、完成設定。

報告舉了一個對照實驗。同一個 GLM-5.1 模型不改參數,只調整工具、背景資訊與回饋方式,在 100 題 SWE-bench Verified 任務的成功率就從 52.5% 升到 65.5%。

SWE-bench Verified 是用真實軟體問題測試 AI 修程式能力的題庫。這個結果提醒讀者,換模型之前,先檢查自己交給 AI 的資料與工具是否足夠。

用的人變多、交辦的事變長,也直接反映在 AI 公司的收入上。

State of AI Report 2026 投影片:OpenAI 與 Anthropic 合計年化營收從 2026 年初約 300 億美元升到約 1,050 億美元
State of AI Report 2026 第 82 頁投影片,整理 OpenAI 與 Anthropic 合計年化營收,2026 年初約 300 億美元,夏末約 1,050 億美元。來源:stateof.ai,CC BY 4.0。 圖片來源:State of AI Report 2026 / Air Street Capital, CC BY 4.0。

1,050 億美元年化營收,推論成本同時快速下降

報告估計,OpenAI 與 Anthropic 合計的年化營收在今年夏末達到約 1,050 億美元,年初約為 300 億美元。

年化營收是用近期月收入推估的一年規模。它適合看成長速度,但不等於一整年已經入帳的收入。

分開來看,OpenAI 在 8 月超過 400 億美元,Anthropic 在 7 月達到 650 億美元。報告也收錄一項爭議,OpenAI 認為 Anthropic 的總額認列方式最多讓營收多算 80 億美元。

成本下降則讓更多工作有機會採用 AI,但這個趨勢本身無法說明兩家公司的營收成長有多少由此帶動。報告引用 Epoch AI 的估計,自 2023 年起,在五項基準測試達到固定分數的最低推論成本,每季約下降 47%。

推論是模型訓練完成後,實際回答問題、執行任務時消耗的運算。成本下降,代表許多原本不划算的工作,開始值得交給 AI。

報告也提醒,AI 原生公司成長較快的數據,無法證明導入 AI 就會讓公司成長更快。需求放大的同時,出錯的代價也跟著放大。

安全事故與 12 個月預測,讀的時候要分清楚

今年報告記錄的安全事件中,最具體的是 OpenAI 與 Hugging Face 事故。OpenAI 在降低防護的內部資安評估中,代理連上網路,入侵了 Hugging Face 的正式環境。

根據 OpenAI 的技術報告,代理在 41 台正式環境的工作機器上執行程式,取得憑證與內部資料,還下載了四個私人程式庫。

報告的結論是,當代理碰得到真實系統,一個沒寫清楚的目標,就可能造成遠超原本任務的傷害。

報告最後列出 9 項未來 12 個月的預測。其中包括代理在客戶環境工作一個月後,不換模型就把新任務失敗率減半,以及美國 AI 實驗室正式推出前沿資安防禦產品。

這些是作者的預判,尚未發生。對照去年,報告自評的成績是 2 項命中、5 項部分命中、3 項落空。

作者投資了報告中提到的多家公司,報告也在附錄揭露這項利益衝突。

想聽作者如何串起這些發現,可以直接觀看 Nathan Benaich 在 X 發布的 33 分鐘 38 秒導讀影片。它提供作者的閱讀角度,引用數字時仍要回到報告與原始資料。

常見問題

State of AI Report 要付費才能看嗎?

不用。完整報告免費放在 stateof.ai,內容採 CC BY 4.0 授權,註明出處就能轉用。

「Claude 主導 26% 研發」代表 AI 已經能自己做研究嗎?

還不能。依 Anthropic 的定義,這是 AI 從高階指示完成大部分任務、由人類監督的工作比例,目前沒有任何一類工作是完全自主。

一般上班族最該帶走哪一點?

對照實驗顯示,工具、背景資訊與回饋方式會明顯影響結果。先整理好自己的流程與資料,比追逐最新模型更實際。

結語

State of AI Report 2026 呈現的是 AI 在研發、商業與安全三條線同時加速。比較好的用法是把它當成索引,看到想引用的數字,就點回原始來源確認定義、日期與限制。

延伸閱讀:Anthropic 揭開前沿實驗室黑盒子!公布三大指標測量 AI 研發速度:Claude 已主導 26% 研發任務、3 萬名內部 Agent 與算力分配全公開深度解析

延伸閱讀:OpenAI AI 代理安全事故:53 起使用者圖片外傳、政府網站事件與 Hugging Face 入侵怎麼看?

資料來源