AI 好奇心是什麼?Schmidhuber 壓縮進步理論為何再成 X 話題
Schmidhuber 的好奇心理論近期在 X 再受討論。本文從 2009 年原始論文解釋壓縮進步、內在獎勵與探索,說明可學習的新資訊為何比單純驚訝更有價值。
AI 好奇心通常指讓系統主動探索的內在獎勵:即使外部沒有立刻給分,模型仍會因為學到新規律而獲得訓練訊號。Jürgen Schmidhuber 的壓縮進步理論,將這個想法連到預測能力的改善。
這篇舊研究近日由 David Ha 在 X 分享,查詢時已有超過 9 萬次瀏覽。原始理論早在 2009 年的期刊文章中就已發表,這次的新聞價值是它再次進入 AI 社群討論。日期需要和近期模型發布分開理解。

壓縮進步,衡量的是學會了多少
資料壓縮是用更精簡的描述表示資訊。若一段資料有規律,例如重複出現的節奏,就能用規則代替逐一記錄。好的預測模型,也能讓原本難以解釋的資料變得更容易描述。
依原始期刊論文與作者整理,有趣的資訊和模型的改善有關。當系統發現新的規律,壓縮能力變好,這個進步就能形成內在獎勵。
重點是「進步」。已經熟悉的規律,雖然容易壓縮,卻可能不再帶來學習。完全隨機的雜訊,雖然讓人驚訝,也可能找不到可學習的結構。
為什麼困惑不一定等於好奇心
可以用學習音樂的例子理解:初學者聽到簡單節奏,很快抓到重複規則。稍難的曲子帶來新的理解。毫無規律的噪音則可能一直難以預測。
| 資訊類型 | 對模型的狀態 | 可能的學習價值 |
|---|---|---|
| 已熟悉的規律 | 已能預測 | 新增進步有限 |
| 尚能學會的新規律 | 預測逐漸改善 | 有機會產生內在獎勵 |
| 無法學會的隨機雜訊 | 持續難以預測 | 驚訝高,進步未必高 |
這個區分能避免把探索等同於追逐刺激。系統應關注是否形成更好的世界模型,而不能只因輸入很奇怪就一直投入資源。
內在獎勵與外部任務如何配合
外部獎勵由任務提供,例如機器人成功拿起物品,或遊戲角色完成關卡。內在獎勵則來自系統自己的學習變化,讓它在尚未成功之前,也有理由探索環境。
設計者需要決定兩者的比重。探索太少,可能找不到有效做法。探索太多,則可能偏離使用者真正想完成的事情。尤其在能使用工具的代理中,新增探索行為仍需要遵守操作範圍與權限。
理論提供衡量探索的方向,實際應用還要解決模型誤差、計算成本與獎勵穩定性。觀察到預測改善,也需要確認它能否轉化成任務能力。
舊理論如何幫助理解今天的 AI
現在的 AI 討論常把主動探索、創造力和自主研究放在一起。壓縮進步理論提醒我們,可以先問一個更具體的問題:系統是否因為某次行動,學到可重複使用的規律?
我的判斷是,這個問題適合用來評估探索型產品的設計。讓學習者或代理不斷收到新內容,未必會增加能力。安排能看見進步的挑戰,才比較容易形成可持續的學習循環。
常見問題
AI 有好奇心,代表它有感受嗎?
這裡的好奇心是訓練目標與行為描述。理論沒有因此證明模型具有人的主觀感受。
壓縮進步就是答案越短越好嗎?
壓縮談的是模型對資訊的表示與預測能力。簡短答案如果遺漏內容,不能因此算學習進步。
這是 2026 年的新發現嗎?
相關理論已發展多年。這次社群分享讓它重新受到關注,文章依 2009 年原始論文解讀。
結語:把探索連到理解的改善
AI 好奇心最值得討論的地方,是如何分辨有用的探索和持續的困惑。壓縮進步提供了一個明確方向:觀察系統能否學到規律,再看這份理解是否幫助它完成任務。