Judith Dada 畫出 AI 能力地圖:為何判斷推理已超越人類,記憶仍落後?

投資人 Judith Dada 在 X 發布前沿 AI 能力雷達圖,認為數學與推理已超越熟練人類,長期記憶與即時學習仍落後。本文整理 12 項能力與成本圖,以及方法限制與網友質疑。

Share
前沿 AI 能力雷達圖,紅色尖角表示 AI 相對熟練人類的能力,藍色圓圈為人類基準
Judith Dada 的能力雷達圖:比較 2025 與 2026 年 10 月前沿 AI,作者註明半徑為依評測結果的判斷式換算。來源:Judith Dada 在 X 發布的圖表。 圖片來源:Judith Dada。

AI 現在到底有多強?一張像珊瑚的雷達圖,最近在 X 上累積超過 27 萬次瀏覽。

作者 Judith Dada 在個人簡介中寫自己是 Langdock 共同執行長,也是創投 visionaries.vc 的資深合夥人。

她比較 2025 年 10 月與 2026 年 10 月的前沿 AI,結論是 AI 變得更「尖」,而不是更「圓」。

意思是強項越來越強,弱項卻沒有跟著補上。她用一句話總結:AI 是超人等級的專家,卻不太會管理自己。

我認為這張圖適合當成理解 AI 強弱的入門地圖,前提是先知道它的數字來自作者判斷,不是正式測驗分數。

前沿 AI 能力雷達圖,紅色尖角表示 AI 相對熟練人類的能力,藍色圓圈為人類基準
Judith Dada 的能力雷達圖:比較 2025 與 2026 年 10 月前沿 AI,作者註明半徑為依評測結果的判斷式換算。來源:Judith Dada 在 X 發布的圖表。 圖片來源:Judith Dada。

這張雷達圖量的是什麼?

圖中藍色圓圈代表熟練人類的基準,設為 1。紅色尖角往外伸越長,代表前沿 AI 在該項能力超越人類越多。

尖角的寬度代表這項能力涵蓋的範圍。虛線則是一年前的位置,用來看進步幅度。

圖下的小字寫明,半徑是「依評測結果所做的判斷式換算」。也就是說,作者參考了各種測驗,再自行換算成圖上的長度。

在這兩則貼文中,她沒有附上完整評測清單與換算方式。所以這張圖適合看方向,不適合拿來比精確倍數。

圖把不同任務放在同一個人類基準周圍,能幫讀者注意落差,但並未交代每個尖角對應哪款模型或哪種工作。把尖角面積加起來,也得不到可取代多少人的結論。圖的用途是拆開各項能力,看清強項之外還缺什麼。

強項與弱項:12 項能力一次看

Dada 在圖上標了 12 項能力,以及各自過去一年的變化。流體推理是遇到陌生問題時找出規律,後設認知是知道自己哪裡不懂、何時應該檢查,即時學習則是邊工作邊學會新東西。

下表依她的標註整理,相對人類的位置同樣屬於作者對評測的解讀:

能力 圖上標註 相對熟練人類
量化推理 快速上升 超越
應用專業知識 大幅上升,部分飽和 超越
流體推理 大幅上升,已飽和 超越
知識 接近飽和 超越
語言 較早就飽和 超越
工具使用 上升,接近人類 接近
規劃與堅持 上升 低於
即時學習 快速上升 低於
後設認知 緩慢 低於
視覺空間推理 緩慢 低於
感覺運動技能 停滯 低於
長期記憶 停滯 低於

從表中可以看到,落後的多半是「長時間獨立做事」需要的能力,例如記住前情、自我檢查與持續規劃。

Dada 認為這些缺口不是預算問題。她寫道,人類等級的記憶、自我監控與長期規劃,目前花再多錢也買不到。

能力之外,她還畫了第二張圖,比較的是價格。

前沿 AI 成本雷達圖,圓圈外尖角長度表示比人類便宜的倍數
Judith Dada 的成本圖:圓圈外表示達到人類品質,尖角長度為比人類便宜的倍數,作者註明部分數值為估計。來源:Judith Dada 在 X 發布的圖表。 圖片來源:Judith Dada。

成本圖:一旦超越人類,價格就快速下滑

第二張圖把「達到人類品質」後的成本差距畫成倍數。依她的估計,語言約比人類便宜 3,000 倍,知識約 1,000 倍。

流體推理約便宜 425 倍,應用專業知識約 100 倍,量化推理約 30 倍。其餘 7 項則標示為尚未達到人類品質。

她的觀察是幾乎沒有中間地帶。能力一跨過人類水準,成本常常很快降到人類的百分之一以下。

即使能力不再進步,價格仍會繼續下降。她舉的例子是語言與知識看起來已經飽和,價格卻還在掉。

圖下同樣註明,部分數值是估計。這些倍數適合用來理解趨勢,不能當成採購報價。

網友質疑與經濟學家的解讀

這張圖也引來不少反駁。有人認為新模型在視覺空間推理進步很大,圖上低估了。Dada 回覆歡迎提供基準測試,並表示會更新。

也有人批評尖角之間的凹陷畫得太深,讓 AI 看起來比實際更參差。她承認這是合理批評,並另外貼出修正版的扇形圖。

經濟學家 Robin Hanson 則引用這張圖表示,如果趨勢延續,AI 會自動化部分、而非全部人類工作,經濟仍會留在我們熟悉的樣貌。

「參差前沿」這個說法,最早來自 2023 年哈佛商學院等學者與 BCG 合作的實驗。

實驗中 758 名顧問使用 GPT-4 後,在 AI 能力範圍內的任務多完成 12.2%,範圍外任務答對的機率則比未使用 AI 的組別低 19%,這是相對差異,並非直接少 19 個百分點。

實驗說明的是特定顧問任務與 GPT-4 的搭配,不能替 Dada 的 2026 年能力倍數背書。但它提供了一個讀圖的方向:同樣的工具,在不同任務上可能幫忙,也可能讓答案變差。

三年後,Dada 的圖把同一個概念從單一任務放大到整體能力。要用在工作上,仍得回到自己要完成的任務,檢查是否有相應證據。

常見問題

這張圖的數字可以直接引用嗎?

不建議當精確數據。作者註明半徑是依評測結果做的判斷式換算,部分數值是估計,也未公開完整方法。

AI 推理超越人類,代表可以取代專家嗎?

依這張圖的判斷,長期記憶、規劃與後設認知仍低於人類,長時間獨立工作仍需要人設定目標與檢查結果。

為什麼記憶和即時學習特別難?

Dada 認為這不是花錢就能解決的缺口。她沒有說明原因或提出時程。回覆區有人主張需要新的模型架構,這屬於網友意見。

結語

這張圖最有用的地方,是提醒我們別用「AI 有多聰明」一個數字來看事情。挑選 AI 工具時,先問任務需要的是推理與知識,還是記憶與長期規劃,會比看總分更準。

延伸閱讀:AI 十年內替代 5% 任務?Acemoglu 觀點再掀討論,別把任務比例當失業率

延伸閱讀:OpenAI 與 Ironclad 測試 AI 操作企業軟體:11 項任務仍需人工把關

資料來源