AI 好奇心是什麼?Schmidhuber 壓縮進步理論為何再成 X 話題

Schmidhuber 的好奇心理論近期在 X 再受討論。本文從 2009 年原始論文解釋壓縮進步、內在獎勵與探索,說明可學習的新資訊為何比單純驚訝更有價值。

Share
Schmidhuber 2009 年原始論文首頁,依期刊 PDF 轉為閱讀預覽。
Schmidhuber 2009 年原始論文首頁,依期刊 PDF 轉為閱讀預覽。 圖片來源:https://www.jstage.jst.go.jp/article/sicejl/48/1/48_21/_article

AI 好奇心通常指讓系統主動探索的內在獎勵:即使外部沒有立刻給分,模型仍會因為學到新規律而獲得訓練訊號。Jürgen Schmidhuber 的壓縮進步理論,將這個想法連到預測能力的改善。

這篇舊研究近日由 David Ha 在 X 分享,查詢時已有超過 9 萬次瀏覽。原始理論早在 2009 年的期刊文章中就已發表,這次的新聞價值是它再次進入 AI 社群討論。日期需要和近期模型發布分開理解。

Schmidhuber 2009 年原始論文首頁,依期刊 PDF 轉為閱讀預覽。
Schmidhuber 2009 年原始論文首頁,依期刊 PDF 轉為閱讀預覽。 圖片來源:Schmidhuber/計測與制御期刊。

壓縮進步,衡量的是學會了多少

資料壓縮是用更精簡的描述表示資訊。若一段資料有規律,例如重複出現的節奏,就能用規則代替逐一記錄。好的預測模型,也能讓原本難以解釋的資料變得更容易描述。

依原始期刊論文與作者整理,有趣的資訊和模型的改善有關。當系統發現新的規律,壓縮能力變好,這個進步就能形成內在獎勵。

重點是「進步」。已經熟悉的規律,雖然容易壓縮,卻可能不再帶來學習。完全隨機的雜訊,雖然讓人驚訝,也可能找不到可學習的結構。

為什麼困惑不一定等於好奇心

可以用學習音樂的例子理解:初學者聽到簡單節奏,很快抓到重複規則。稍難的曲子帶來新的理解。毫無規律的噪音則可能一直難以預測。

資訊類型 對模型的狀態 可能的學習價值
已熟悉的規律 已能預測 新增進步有限
尚能學會的新規律 預測逐漸改善 有機會產生內在獎勵
無法學會的隨機雜訊 持續難以預測 驚訝高,進步未必高

這個區分能避免把探索等同於追逐刺激。系統應關注是否形成更好的世界模型,而不能只因輸入很奇怪就一直投入資源。

內在獎勵與外部任務如何配合

外部獎勵由任務提供,例如機器人成功拿起物品,或遊戲角色完成關卡。內在獎勵則來自系統自己的學習變化,讓它在尚未成功之前,也有理由探索環境。

設計者需要決定兩者的比重。探索太少,可能找不到有效做法。探索太多,則可能偏離使用者真正想完成的事情。尤其在能使用工具的代理中,新增探索行為仍需要遵守操作範圍與權限。

理論提供衡量探索的方向,實際應用還要解決模型誤差、計算成本與獎勵穩定性。觀察到預測改善,也需要確認它能否轉化成任務能力。

舊理論如何幫助理解今天的 AI

現在的 AI 討論常把主動探索、創造力和自主研究放在一起。壓縮進步理論提醒我們,可以先問一個更具體的問題:系統是否因為某次行動,學到可重複使用的規律?

我的判斷是,這個問題適合用來評估探索型產品的設計。讓學習者或代理不斷收到新內容,未必會增加能力。安排能看見進步的挑戰,才比較容易形成可持續的學習循環。

常見問題

AI 有好奇心,代表它有感受嗎?

這裡的好奇心是訓練目標與行為描述。理論沒有因此證明模型具有人的主觀感受。

壓縮進步就是答案越短越好嗎?

壓縮談的是模型對資訊的表示與預測能力。簡短答案如果遺漏內容,不能因此算學習進步。

這是 2026 年的新發現嗎?

相關理論已發展多年。這次社群分享讓它重新受到關注,文章依 2009 年原始論文解讀。

結語:把探索連到理解的改善

AI 好奇心最值得討論的地方,是如何分辨有用的探索和持續的困惑。壓縮進步提供了一個明確方向:觀察系統能否學到規律,再看這份理解是否幫助它完成任務。

官方資料來源