AI 尚未橫空出世前的書最值錢!科技公司大舉掃貨 2022 年前出版著作訓練模型引發爭議
AI 公司蒐集訓練資料的方式再次引發爭議。近期,X(前 Twitter)帳號 hedgie 發文指出,部分 AI 公司正透過專門供應商大量收購紙本書籍,以高速掃描設備切除書脊、數位化內容後直接銷毀原書,其中甚至包含存世數量極少的珍稀古籍。
該貼文迅速在社群媒體發酵,截至截稿前已累積 2,047 萬次瀏覽。
事件曝光後,特斯拉與 SpaceX 執行長馬斯克(Elon Musk)也公開回應,表示已要求 SpaceX AI 團隊,對圖書館中的珍稀書籍採用不破壞原書的方式進行數位化,而非直接切除書脊掃描。
AI 公司大量收購紙本書,高速掃描後直接銷毀
書籍資料庫服務 ISBNdb 可協助客戶一次採購高達 100 萬本書,並提供匿名採購及保密協議(NDA)等服務,降低外界追蹤買家的可能性。
取得書籍後,這些書會送入高速掃描設備。由於傳統書籍無法快速平整翻頁,因此機器會先將書脊切除,再以高速自動翻頁完成掃描,最後將實體書直接粉碎回收。相較人工逐頁翻拍,這種方式能大幅提升效率,也降低建立大型語料庫的成本。
為何 AI 公司偏愛 2022 年前出版的書?
報導指出,2022 年以前出版的書籍如今成為 AI 公司眼中的高價值資料來源。
原因在於生成式 AI 尚未普及,這些內容幾乎完全由人類創作,不含 AI 生成文字,因此可避免模型反覆學習 AI 自己產生的內容,降低資料污染(data contamination)與模型退化(model collapse)的風險。
對於大型語言模型而言,品質穩定的人類原創文本已成為愈來愈珍貴的訓練資源。
美國法院:拆書掃描屬合理使用
更具爭議的是,美國聯邦法院認為,此類作法可構成合理使用(Fair Use)。
法官指出,由於掃描流程會直接銷毀實體書,因此並不存在同時保留紙本與數位版本、形成額外流通副本的情況,法院因此認定相關數位化流程符合合理使用的法律原則。
這項判決也被視為 AI 公司未來取得紙本訓練資料的重要法律依據。
Anthropic 曾希望取得「世界上所有的書」
報導同時指出,Anthropic 為了建立龐大的訓練資料庫,曾聘請前 Google Books 合作業務負責人加入團隊。
據悉,公司內部甚至提出希望取得 「世界上所有的書(all the books in the world)」 作為 AI 訓練資料,反映大型模型開發者對高品質文字資料的高度需求。
近年包括 OpenAI、Anthropic、Google、Meta 等 AI 公司,都持續尋找新的合法資料來源,以因應模型規模快速成長。
真正引起外界反彈的,並不是大量印刷的商業書籍,而是那些已幾乎絕版、存世數量極少的珍貴文獻。
部分稀有古籍已流入這條供應鏈,其中甚至包含全世界僅剩極少數存本的作品。
批評者認為,這些書籍歷經數百年戰爭、火災與歷史變遷才得以保存至今,如今卻可能因 AI 訓練需求而被永久拆解銷毀。
相較於網站內容可重新發布、暢銷書可以重新印刷,若一部十八世紀植物學文獻或其他珍稀典籍僅剩數本,其文化價值一旦隨實體遭粉碎便難以挽回。
馬斯克:要求 SpaceX AI 採用不破壞方式掃描
針對此事,馬斯克在 X 上回應:「我已要求 SpaceX AI 團隊,對圖書館中的任何珍稀書籍,都應以保留原書的方式掃描,而不是直接切除書脊後掃描。」
目前尚不清楚 SpaceX AI 是否已建立相關數位化流程,但馬斯克的表態,也反映 AI 產業內部對於資料取得方式開始出現不同看法。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。


