Project Panama 是什麼?Anthropic 為何買下數百萬本書、切書脊訓練 Claude

Anthropic 曾買下數百萬本實體書,切除書脊、掃描成 AI 訓練資料。真正造成 15 億美元和解的,卻是另一座盜版電子書資料庫。

Share
Anthropic 執行長 Dario Amodei 官方照片
Anthropic 執行長 Dario Amodei。圖片來源:Anthropic 官方 press kit。

Anthropic 曾把數百萬本實體書買進倉庫,切掉書脊,再把一頁頁紙送進工業掃描設備。掃描完成後,紙本被回收,數位檔則進入公司的研究資料庫,部分內容再用於訓練大型語言模型。

這項內部計畫叫做 Project Panama。一份在訴訟中解封的規劃文件,甚至把目標形容為「以破壞式掃描處理全世界所有書籍」。

但如果只把事件濃縮成「Claude 靠摧毀數百萬本書訓練」,會漏掉整起案件最重要的法律分界。法院認為,Anthropic 買下紙本後,以一份數位檔取代一份紙本,符合本案的 fair use;公司先前從 LibGen、PiLiMi 等盜版來源取得的數百萬本電子書,卻沒有得到同樣保護。

真正的問題不只是 AI 有沒有讀書,而是這些書從哪裡來、公司留下幾份複本,以及數位資料庫還被拿去做了什麼。

Project Panama 是什麼?

Bartz v. Anthropic 法院命令記載購買、裁切與掃描數百萬本紙本書
法院命令記載,Anthropic 購買數百萬本紙本書,再由服務商拆除裝訂、裁切、掃描,並丟棄紙本原件。圖片來源:美國加州北區聯邦地方法院,Bartz v. Anthropic,Document 231,第 4 頁。

Project Panama 是 Anthropic 在 2024 年大規模推進的實體書數位化計畫。根據 2025 年 6 月 23 日的法院命令,Anthropic 在 2024 年 2 月找來曾參與 Google Books 合作業務的 Tom Turvey,負責取得大量書籍。

法院文件顯示,Anthropic 花費數百萬美元購買數百萬本紙本書,許多是二手書。外部服務商拆除裝訂、裁切頁面,再把整本書掃描成帶有可機器讀取文字的 PDF。完成轉檔後,紙本原件被丟棄或回收。

整個流程可以簡化成:

步驟 實際做法 目的
買書 從商業市場大量購入實體書,許多為二手書 先合法持有一份紙本
切書 拆除裝訂、切掉書脊並整理頁面 讓紙張能高速進入掃描機
掃描 產生頁面影像與可搜尋文字的 PDF 把紙本轉成機器可處理的資料
建庫 加入書名、作者、ISBN 等書目資料 建立可搜尋的內部研究資料庫
訓練 從資料庫挑選、清理並轉成 token 供大型語言模型學習文字規律
回收 掃描完成後處理紙本 維持一份紙本對一份數位檔的替代關係

Token 是 AI 模型處理文字時使用的小單位,可以是一個字、詞的一部分或標點。把書籍轉成 token 後,模型不是把圖書館當成搜尋引擎逐頁翻閱,而是反覆學習不同文字片段之間的統計關係。

《華盛頓郵報》查閱解封文件後報導,Project Panama 的完整數量與成本在文件中被遮蔽,但一家參與提案的掃描服務商,曾規劃在 6 個月內處理 50 萬至 200 萬本書。報導也指出,Anthropic 實際購入數百萬本書,總支出達數千萬美元。

這個規模說明,Project Panama 不是臨時補資料的掃描工作,而是一套工業化的 AI 資料供應鏈。

Anthropic 為什麼願意花大錢搶實體書?

書籍對大型語言模型的價值,不只在於字數多,而是內容通常經過作者、編輯與出版流程整理。相較大量零碎網頁,書籍較容易提供完整論述、長篇敘事、專業知識與一致的語言品質。

法院文件記載,Anthropic 認為書籍是打造世界級大型語言模型最具成本效益的資料來源。公司特別看重事實經過整理、分析具有結構,以及故事能吸引讀者的作品,也就是編輯會認可的「好文字」。

這會直接影響模型的兩種能力。第一是長篇內容中的前後關係,模型要學會一個觀點如何被建立、補充與推進。第二是寫作風格與資訊組織,模型需要的不只是正確單句,也要知道怎麼把多個段落組成可讀的答案。

法院甚至指出,訓練一個大型語言模型需要數十億字。如果只用書籍,單一模型可能需要數百萬本;即使混合其他文字,仍可能使用數十萬本書。這就是 AI 公司會把實體書重新視為戰略資源的原因:公開網路資料逐漸被大量重複內容、SEO 文章與 AI 生成文字稀釋,而出版品仍保有相對穩定的品質訊號。

不過,「書的品質較高」只能解釋公司為什麼想要這些資料,不能自動解決取得方式與著作權問題。

Project Panama 與盜版書資料庫,其實是兩件事

Anthropic 的書籍資料並非全部來自 Project Panama。在購入紙本之前,公司已經從 Books3、LibGen 與 PiLiMi 等來源取得大量電子書。

法院命令記載,Anthropic 在 2021 年取得約 19.7 萬本 Books3 書籍,之後又從 LibGen 下載至少 500 萬本,並從 PiLiMi 取得至少 200 萬本,合計超過 700 萬份盜版書籍複本。這些檔案被放入公司的中央研究資料庫,即使部分書籍後來不再用於模型訓練,仍可能被長期保留。

兩條資料路徑的差別如下:

資料路徑 Project Panama 盜版電子書資料庫
原始來源 商業市場購入的實體書 Books3、LibGen、PiLiMi 等線上資料集
是否支付書本成本 有,但二手書交易通常不會讓作者再次取得收入 沒有向權利人支付購書或授權費
複本關係 紙本被銷毀,由一份數位檔取代 直接新增並保留電子複本
法院在本案的 fair use 判斷 一對一紙本轉數位獲得肯定;特定訓練複本另獲 fair use 認定 建立中央盜版資料庫未獲肯定
後續結果 不在 15 億美元和解的核心賠付範圍 成為集體訴訟與和解核心

這個差異也解釋了 Project Panama 為什麼必須切書、掃描再回收。對 Anthropic 來說,這套昂貴又麻煩的流程,不只是取得文字,也是在建立一條比直接下載盜版檔案更能通過法律檢驗的來源鏈。

法院到底判了什麼?三個結論不能混在一起

Bartz v. Anthropic 法院命令說明模型訓練、紙本轉數位與盜版資料庫的 fair use 結論
法院把三種用途分開處理:特定訓練複本與一對一紙本轉數位獲得 fair use 認定,盜版中央資料庫則沒有。圖片來源:美國加州北區聯邦地方法院,Document 231,第 31 頁。

2025 年 6 月,時任美國加州北區聯邦地方法院法官 William Alsup 對 Bartz v. Anthropic 案作出部分 summary judgment。Summary judgment 是法院認為某些爭點不必進入完整審判,就能先依現有事實與法律作出裁定。

法院把 Anthropic 的複製行為拆成三種用途,而不是用一句「AI 訓練合法或違法」全部處理。

1. 用書籍複本訓練大型語言模型:本案認定屬 fair use

Fair use,也就是美國著作權法的合理使用制度,會綜合檢查使用目的、作品性質、使用份量與市場影響。它不是只要宣稱研究或 AI 訓練就自動成立。

在這起案件中,原告沒有主張 Claude 對外輸出過可追溯至涉案書籍的侵權內容。法院因此認為,模型訓練是高度轉化性的用途,沒有讓 Claude 直接成為原書的替代品,判定特定訓練複本屬 fair use。

這項裁定很重要,但範圍也很窄。如果未來案件能證明模型大量重現原作、輸出可替代作品,或採用不同的資料保存與商業方式,法院仍可能得到不同結論。

2. 買下紙本後一對一轉成數位檔:本案認定屬 fair use

法院認為,Anthropic 已合法持有紙本,轉檔後沒有多保留一份紙本,也沒有把數位檔對外販售或散布。這使整個過程更接近「以較省空間、可搜尋的數位版本,取代原本的紙本館藏」。

法官特別強調,這是紙本與數位檔的一對一替代。若公司同時保留原書、製造額外複本,或把檔案提供給外部使用者,這個理由不一定適用。

3. 從盜版來源建立中央資料庫:Anthropic 沒有取得 fair use 保護

法院認為,未來可能把某些書拿去做轉化性訓練,不代表公司可以先從盜版網站免費複製整座圖書館。建立並長期保留一個通用中央資料庫,是與模型訓練不同的用途,需要獨立的法律理由。

程序上,法院是拒絕 Anthropic 對這部分提出的 summary judgment,並原定就盜版複本與損害賠償進入審判。因此,較準確的說法不是「法院判 Anthropic 侵權並罰款 15 億美元」,而是盜版資料庫沒有取得 fair use 保護,Anthropic 隨後選擇以 15 億美元和解,避免案件繼續審判。

15 億美元和解已獲最終批准,Project Panama 並不是賠款主因

2026 年 7 月 20 日 Anthropic 15 億美元集體訴訟和解最終批准命令
2026 年 7 月 20 日的最終批准命令確認 15 億美元和解,並記載作品申請率達 91.3%。圖片來源:美國加州北區聯邦地方法院,Document 680,第 5 頁。

2026 年 7 月 20 日,聯邦法官 Araceli Martínez-Olguín 正式批准 15 億美元集體訴訟和解。法院資料顯示,和解清單共有 482,460 部作品,其中 440,490 部、約 91.3% 已有人提出權利申請。預估每部作品可分得約 3,000 美元,實際金額仍依分配規則與費用計算。

最終批准代表這起集體訴訟依和解條款結束,不代表法院在完整審判後判決 Anthropic 應賠 15 億美元,也不代表 Anthropic 承認所有指控。

另一個限制是,這仍是一家聯邦地方法院對特定事實作出的裁定。Anthropic 選擇和解後,案件不會經由上訴法院進一步檢驗。它會成為其他 AI 著作權案件的重要參考,但不是全美所有法院必須照單全收的普遍規則。

這也是為什麼必須把兩件事分開:

  • Project Panama 的核心是買下實體書、破壞式掃描,再以數位檔取代紙本。
  • 15 億美元和解 的核心是 Anthropic 先前從盜版來源取得並保存的大量電子書。

把兩者混成「Anthropic 因切書訓練 Claude 被罰 15 億美元」,雖然很適合社群標題,卻不是法院文件呈現的因果關係。

為什麼 Project Panama 最近又爆紅?

Project Panama 並不是 2026 年 8 月才開始的新計畫。它在 2024 年大規模推進,2025 年的法院命令已透露 Anthropic 買書與掃描的做法。到了 2026 年 1 月,更多訴訟資料解封,《華盛頓郵報》才進一步揭露計畫名稱、內部說法與工業掃描細節。

2026 年 7 月 20 日,15 億美元和解取得最終批准,相關報導又把「合法購書掃描」與「盜版資料庫」重新帶回新聞。8 月初,多家科技與文化媒體再用「AI 公司摧毀數百萬本書」的角度報導,才形成這一波社群討論。

Anthropic 向 Tom's Guide 回應,公司從一般商業市場取得書籍,沒有購買並銷毀稀有書或古籍。公開法院資料沒有列出 Project Panama 的完整書目,因此外界目前無法獨立核對每一本被掃描的書。

合法不等於沒有代價:Project Panama 真正改變了什麼?

Project Panama 對 AI 產業最直接的啟示,是訓練資料的「來源證明」正在變成競爭門檻。模型公司不只要蒐集文字,也要能回答資料怎麼取得、原始複本是否保留、誰能存取,以及是否曾被用於其他目的。

這會提高 AI 開發成本。直接下載現成資料集又快又便宜,購書、物流、裁切、掃描、OCR、清理與建立書目資料卻需要完整供應鏈。但與 15 億美元等級的訴訟風險相比,這些成本可能反而是更便宜的風險管理。

對作者與出版社來說,結果沒有那麼單純。法院在本案接受紙本轉數位的做法,卻沒有要求 Anthropic 為 AI 訓練另外取得授權。尤其大量採購來自二手市場時,作者通常不會因每一次轉售再次取得收入。AI 公司付了買書與掃描成本,不代表創作者因此參與了模型創造的價值。

文化保存也是另一個問題。Anthropic 表示不會摧毀稀有書與古籍,但完整掃描清單並未公開。只要商業公司開始大量收購絕版、冷門或館藏稀少的書,供應量、公共可近性與保存責任就不再只是物流問題。

我的判斷是,Project Panama 不是一個可以簡單歸類為「合法洗白」或「摧毀文化」的故事。它比較像 AI 訓練資料從網路拓荒期進入工業化採購期的轉折點:公司願意花數千萬美元取得更乾淨的來源鏈,卻仍沒有回答創作者應不應該分享 AI 模型價值,以及私人資料庫應承擔多少文化保存責任。

結論:AI 公司搶的不是紙,而是高品質語言

Project Panama 最吸睛的畫面,是書脊被切掉、紙張被送進高速掃描機。但 Anthropic 真正想取得的,不是那些紙,而是書籍裡經過整理的知識、論述與寫作方式。

法院在 Bartz v. Anthropic 案劃出的界線是:特定模型訓練與一對一的紙本轉數位可以是 fair use,但不能因為最終用途可能合法,就回頭替最初的盜版取得方式辯護。

這條界線未必是 AI 著作權爭議的終點,卻已經改變資料競賽的成本結構。接下來真正值得觀察的,不只是其他 AI 公司會不會跟進買書,而是出版商是否建立可規模化的 AI 授權市場,以及未來法院會不會繼續接受「訓練用途」與「資料取得方式」分開判斷。

常見問題

Project Panama 是 Anthropic 的新計畫嗎?

不是。Project Panama 在 2024 年已大規模推進,相關做法在 2025 年法院命令中出現。計畫名稱與更多內部細節是在 2026 年 1 月法院文件解封後受到廣泛報導,2026 年 7 月和解取得最終批准後再次引發討論。

Anthropic 真的銷毀了數百萬本書嗎?

法院文件顯示,Anthropic 購入數百萬本實體書,由服務商拆除裝訂、裁切、掃描,再丟棄紙本原件。《華盛頓郵報》報導掃描後的紙張由回收業者處理。確切總數與完整書目在公開文件中仍被遮蔽或沒有公開。

Project Panama 掃描的書全部用來訓練 Claude 嗎?

不能這樣斷言。紙本掃描檔先進入 Anthropic 的中央研究資料庫,法院文件顯示其中至少部分內容被選入模型訓練資料。公開資料沒有證明每一本掃描書都進入每一代 Claude,也沒有提供逐本、逐模型的完整對照。

法院是否判定所有 AI 書籍訓練都是 fair use?

沒有。法院只在 Bartz v. Anthropic 的特定事實與訴訟紀錄下,判定涉案訓練複本屬 fair use。其他案件若涉及可替代原作的輸出、不同取得方式、額外散布或不同市場證據,仍可能得到不同結果。

Anthropic 為什麼支付 15 億美元?

和解主要處理 Anthropic 從 LibGen、PiLiMi 等來源取得並保存盜版電子書的爭議,不是因為 Project Panama 切掉合法購入書籍的書脊。這筆金額是雙方和解,不是法院審判後判定的罰款。

資料來源

本文整理公開法院文件與新聞報導,不構成個別法律意見。