目錄
2026 年 8 月404 Media 公開一場很有戲劇性的調查:記者和一名書商合作,把 AirTag 藏進一批約 1,000 本書中的其中一本,再一路追蹤這批書最後去了哪裡。訊號從加州出發,經過威斯康辛州與科羅拉多州,最後停在 Amazon 位於拉斯維加斯的 LAS8 倉庫,而且不是一般的按需印刷區,而是北側一個代號 VGT3 的獨立作業區。404 Media 根據 Amazon 員工在內部論壇的描述指出,這裡會接收大量紙本書、裁掉裝訂,再進行掃描,實體書也會因此被破壞。隔天 Ars Technica 等媒體跟進,才讓「一顆 AirTag 追進 Amazon 倉庫」迅速變成這週科技圈最受討論的 AI 資料新聞之一。
404 Media 將 VGT3 描述為 Amazon 的 AI training facility,也認為現有證據強烈指向 AI 訓練用途;Amazon 本身並沒有確認這個說法。公司對 404 Media 與 GeekWire 的回應只有表示,Amazon 會透過商業管道購買書籍,用於開發與改善客戶使用的產品與服務,沒有進一步說明 VGT3 掃描出的文字最後進入哪一套模型或資料集。
所以,這篇真正能確認的不是「Amazon 已承認把這一千本珍本全部拿去訓練某個 AI 模型」,而是另一件已經很具體的事:大量紙本書正在被買進 Amazon 設施,員工描述的作業包含裁書與掃描,而這種作業方式會破壞原本的實體書。至於掃描資料最後如何使用,Amazon 至今沒有公開完整答案。
AirTag怎麼追出Amazon的掃書設施?原始調查其實來自404 Media
一筆約1,000本書的匿名訂單,最後進了Las Vegas的Amazon LAS8
這次調查不是記者隨便挑一本舊書寄出去。404 Media 先從長期追蹤二手書異常大宗採購的書商取得線索。一名賣家透過 Biblio 收到一筆大約 1,000 本書的訂單,買方身分並不透明,而且這類訂單近幾個月開始頻繁出現在二手書市場。書商同意讓 404 Media 提供一顆 AirTag,藏進其中一本書裡,再觀察整批貨物最後去哪裡。
AirTag 最後一路抵達 Amazon 位於 Las Vegas 的 LAS8。這個地點原本讓記者很困惑,因為 LAS8 大部分業務是 Print-on-Demand,也就是有人下單後才印書,和大量裁書剛好是完全相反的方向。真正讓線索接起來的是 AirTag 最後的位置:不是一般按需印刷區,而是倉庫北側代號 VGT3 的另一套作業。
依 Amazon 員工在工作論壇上的描述,VGT3 會收到大量紙本書,有人負責切書,有人負責接收與掃描。404 Media 的調查則進一步指出,書的裝訂會被裁掉,以便更快速掃描,實體書也會在這個過程中被破壞。VGT3 入口還有自己的標誌:一隻露出牙齒、手裡拿著書的暴龍。原稿寫成「正要吞掉書本」稍微加戲了,現有照片與描述比較接近「拿著一本書的暴龍」。
這批書可以叫rare books,但不是全部都是孤本或頂級古籍
404 Media 自己把這批貨稱為 rare books,調查合作方也是稀有書市場的賣家。不過,「rare」放進中文很容易讓人直接想到博物館等級的孤本、初版本或幾百年前的古籍,實際情況沒有這麼單一。
GeekWire 整理 404 Media 的調查時特別提到,書商觀察到這些大量採購反而沒有包含「最稀有」的那一批,也就是老到甚至沒有 ISBN 的書。這讓書商懷疑,買方可能是在依 ISBN 等出版資料系統化地尋找尚未數位化的出版品。
因此,文章比較適合寫成「稀有、冷門或難取得的舊書」,而不是把整批都描述成全球僅存數冊的珍貴古籍。文化保存的問題仍然存在,但程度要依每一本書的版本、存世量與實體特徵個別判斷。
AI公司為什麼重新盯上實體書?重點是乾淨而且還沒數位化的文字
舊紙本被資料供應商當成「沒有AI生成內容」的來源
早在這次 AirTag 調查前一個月,404 Media 就報導過另一條供應鏈。書籍資料公司 ISBNdb 當時向 AI 客戶推銷大量取得實體書的服務,核心賣點之一就是舊書產生於生成式 AI 大量出現以前,因此內容不會混入近年快速增加的 AI-generated text。ISBNdb 當時甚至把紙本書描述成經過編輯、結構完整、具有領域知識的資料來源。
所以,原稿「實體書是少數還沒被抽乾的高品質語料」方向可以留下,但不要寫成已經有一個公認的「網路資料快耗光」臨界點。現在比較能確認的是,AI 資料供應鏈確實開始積極尋找兩種東西:一是還沒有被數位化的文字,二是生成式 AI 普及以前產生的人工文本。
對模型開發商來說,這類書還有另一個現實優勢。一本冷門的地方史、老技術手冊或絕版專業書,在一般二手市場可能沒多少買家,但如果內容從來沒有出現在 Common Crawl 或大型電子書資料庫裡,它對訓練資料集的價值和二手書售價並不是同一套計算方式。
裁掉書背再掃描並不是Amazon發明的
Destructive scanning 本身不是新技術。需要大量掃描裝訂書時,把書背裁掉,就能把散開的頁面送進高速掃描設備,不必逐頁翻頁。真正重新引起注意的,是生成式 AI 公司開始大量採購紙本書,把這套原本就存在的數位化方法放大到模型資料取得。
Anthropic 就是目前已有法院文件完整記錄的案例。2025 年的 Bartz v. Anthropic 裁定記載,Anthropic 購買紙本書後拆除裝訂、逐頁掃描,把書轉成可搜尋的數位版本,再從自己的中央資料庫挑選內容訓練 Claude。法院文件也明確寫到,紙本來源在轉換過程中被銷毀。
所以,Amazon 這次並不是第一個出現 destructive book scanning 爭議的 AI 業者。不同的是,Anthropic 的做法是在著作權訴訟 Discovery 過程中被公開;Amazon 這次則是靠一名書商與一顆 AirTag 把貨物流向追了出來。
Amazon真的承認拿這些書訓練AI嗎?目前沒有
Amazon承認購書,但沒有確認VGT3的掃描資料用途
這是整篇最需要保留的不確定性。404 Media 的調查標題直接稱目的地為 Amazon AI training facility,而且從舊書採購模式、VGT3 作業方式、Amazon AI 業務與其他 AI 公司既有做法來看,這個推論有不少旁證。Amazon 的正式回應卻停在更廣的範圍,只表示會透過商業管道購買書籍,用於開發和改善客戶使用的產品與服務。GeekWire 直接向 Amazon 詢問是不是為了訓練模型,Amazon 仍沒有確認。
因此,原稿的「Amazon 過去曾否認這類作法」建議整句刪掉。目前查不到 Amazon 先前公開否認 VGT3 或類似內部掃書計畫的可靠紀錄。容易混淆的是,前幾週確實有其他公司否認相關事情:例如 Zoom Books 表示自己不會把書數位化後銷毀;Anthropic 也曾表示自己的資料取得計畫不會購買並銷毀 rare or antiquarian books。那不是 Amazon 的說法。
比較準確的問題不是「Amazon 為什麼說謊」,而是:Amazon 已經承認購書是為了改善產品與服務,404 Media 又找到了實際裁書掃描的 Amazon 作業區,但兩者中間那一段資料最後進了什麼系統,公司目前沒有公開。
買下實體書之後可以直接掃描嗎?所有權與著作權其實是兩件事
首賣原則允許處分那一本書,不代表自動取得內容的重製權
原稿把這段寫成「合法購得的書屬於買方財產,拆毀不當然違法」方向沒問題,但要把後半段分開。
美國著作權法第 109 條的 First Sale Doctrine,處理的是某一本合法取得的實體副本。持有人原則上可以把那一本書轉售、借出或處分掉;著作權人不能一直控制同一個實體副本後續怎麼流通。
但掃描一本書會另外產生複製,因此不是「買下書=取得掃描權」。是否能在沒有作者授權的情況下複製,還要再看 Copyright Act 的其他規則,包括 Fair Use。這也是為什麼目前 AI 訓練爭議沒有辦法只靠「公司有付錢買紙本」結束。
Anthropic曾在特定案件中勝訴,但不能寫成美國已全面認定AI訓練合法
2025 年 Bartz v. Anthropic 的聯邦地方法院裁定,把涉案書籍拿來訓練 Claude 屬於 Fair Use;法院也另外認為,Anthropic 將合法購買的紙本書轉為數位館藏,在該案件的特定做法下屬於 Fair Use,其中一個考量就是原本紙本被銷毀,沒有額外留下第二套可流通副本。
同一份裁定也拒絕替 Anthropic 從盜版網站取得並永久保存的書籍開脫,將「合法購買後掃描」和「先從盜版來源取得」分開分析。
因此,截至 2026 年,比較安全的寫法是:美國已有聯邦地方法院在 Anthropic 與 Meta 的特定案件紀錄下認定 AI training 可以構成 Fair Use,但這不等於所有模型、所有資料來源、所有取得方式都已經被法院一律認定合法。個案中的資料來源、市場影響、模型輸出與使用目的仍然會影響判斷。
書被掃完後為什麼還要銷毀?法律理由和文化保存理由不能混在一起
Destructive scanning追求的是掃描效率,不是保存實體
從目前公開資料能確認的是,裁掉裝訂可以提高掃描效率;在 Anthropic 案件中,「紙本被數位版本取代」甚至成了法院分析該次數位化是否 Fair Use 的一部分。
至於 Amazon 為什麼不把 VGT3 的書重新裝訂、捐給圖書館或長期保存,公司沒有公開解釋。原稿把原因直接寫成倉儲、溫濕度、保險與人力成本,雖然在實務上合理,現階段仍屬推論,不適合包裝成 Amazon 的決策原因。
比較能確定的是,如果一套流程的目標只是大量取得文字,裁書、掃描、處理下一本會比把每一本實體書重新整理成可收藏狀態快很多。這就是 destructive scanning 的效率來源,也是保存團體最在意的地方。
數位文字可以留下,但一本特定的書不只剩文字
對一般量產二手書來說,損失可能就是少了一個紙本副本;但如果書本身具有版本、特殊裝訂、簽名、藏書章、書店標記或讀者手寫註記,掃出文字並不能保存全部資訊。
這也是為什麼「rare books」三個字需要特別小心。這次調查沒有證明 VGT3 正在大量摧毀孤本級文化資產,但只要採購流程以 ISBN 與文字取得為主要目標,就有可能把「這本書作為文本是否有用」放在「這一冊實體本身是否值得保存」之前。前者適合模型資料庫,後者則是圖書館、檔案館與古籍市場在意的問題。
Amazon不是第一家公司掃書,這次真正的新東西是供應鏈被追到了
Anthropic 的 Project Panama 已經透過訴訟文件曝光,法院紀錄顯示公司曾大量購買、拆解並掃描紙本書。近幾個月,英國、愛爾蘭與澳洲的二手書商也陸續回報異常的大量訂單:主題沒有明顯關聯、數量很大、買方對價格相對不敏感,目的地有時又是轉運倉。部分書商因擔心書籍最後會被 destructive scanning,開始拒絕某些訂單。
這次 Amazon 調查真正多出來的,是一條可以一路追蹤的實體物流鏈。大約 1,000 本書從賣家出去,AirTag 最後進入 Amazon LAS8/VGT3,而 VGT3 員工又描述了拆書與掃描工作。以前的疑問是「到底誰在大量買這些書」,這次至少有一批訂單找到了具體終點。
所以,比較適合下的結論不是「整個 AI 產業都在秘密摧毀珍本」,而是 destructive scanning 已經不只是 Anthropic 訴訟裡的一個特殊案例。現在至少又有一場獨立調查,把類似作業追到了 Amazon 的實際設施。
Flock的12萬台車牌辨識器,提供的是另一種「規模問題」對照
同一週 Flock Safety 也因為全美自動車牌辨識網路受到大量批評,宣布縮短資料保存期限、強制使用異常搜尋稽核工具,並要求執法人員把搜尋綁定案件編號。Flock 的系統目前遍及美國 49 州,規模超過 12 萬台攝影機。
這和 Amazon 掃書不是同一種法律問題,也不適合直接說「拍一張車牌和掃一本書都是合法的,所以乘上十萬就變不合法」。自動車牌辨識的合憲性與資料使用本來就有持續訴訟,各州規則也不同。
比較有參考價值的是規模效應。單獨一台 ALPR 拍到一台車,和 12 萬台攝影機形成可搜尋的跨地區移動資料庫,治理問題完全不同;同樣地,一家公司自己掃描幾本書做內部搜尋,和建立大規模紙本收購、裁書、掃描供應鏈,也不是同一種資料取得能力。
這個對照比較能說明現在的爭議:很多技術動作本身已經存在很多年,真正改變環境的是自動化、資料庫與規模把它們連在一起後,能一次處理多少東西。
這件事對網站創作者有什麼關係?紙本書只是比較昂貴的那條資料管道
實體書至少還需要取得一本紙本、運送、拆解與掃描。公開網站則沒有這些物流成本。只要頁面可以公開讀取,取得文字的成本通常低得多。
因此,部落格、電子報、公開資料庫或其他網站內容面對的是另一種資料供應鏈。robots.txt 可以告訴爬蟲哪些路徑不希望被存取,但 IETF 的 Robots Exclusion Protocol 本身就明確提醒,它不是有效的內容安全措施,也不能替代真正的 Access Control。
這不代表 robots.txt 沒必要。它仍然是一個標準化的爬蟲政策表達方式,對願意遵守的搜尋引擎與 AI crawler 有作用;只是不適合把它理解成技術上的防盜鎖。
對內容經營者來說,比較實際的是分層處理:希望被搜尋的公開文章可以維持正常 Crawling;不希望任意取得的會員內容應該透過登入、權限與伺服器端控制限制;使用第三方平台發布的內容,則需要另外確認平台條款與是否提供 AI training opt-out。單一 robots.txt 很難同時解決這幾種問題。
創作者現在比較值得做的,不是把全部內容藏起來
先確認每個發布平台怎麼處理AI訓練資料
同一篇文章放在自架 WordPress、社群平台與電子報服務上,適用的是不同規則。平台是否取得內容訓練授權、是否能退出、退出只影響未來資料還是包含既有內容,都需要分開確認。
這一步很無聊,但比在作品底下放一句「禁止 AI 訓練」後就當作完成實際得多。聲明可以留下作者立場,真正的存取與授權還要看網站控制方式、平台條款與適用法律。
自有網站把robots.txt當政策層,不要當安全層
robots.txt 可以持續設定,尤其已知 AI crawler 有明確 User-Agent 時,可以直接表達站方政策。但 RFC 9309 已經說得很清楚,它不是內容安全機制。真的不希望公開取得的資料,需要 Authentication、Authorization 或其他伺服器端控制。
因此,公開 SEO 文章與私人資料不用採同一套策略。希望 Google 找得到的文章,本來就需要讓搜尋爬蟲存取;付費教材、內部檔案或真正不能外流的內容,就不應該只靠 Disallow。
把一手資料和查核過程留在自己的系統裡
實地照片、採訪錄音、測試紀錄、原始試算表、購買證明與版本歷史,價值不只在「比較難被 AI 複製」。它們還能回答一個生成文字很難回答的問題:這個資訊是怎麼得來的。
公開文章可以被爬走,句型也可以被模仿;原始採訪檔與實測紀錄卻仍然掌握在資料產生者手裡。對需要長期建立可信度的內容網站來說,這種 provenance 比刻意把文章寫得「不像 AI」實際很多。
公開文章把已確認與尚未確認的地方分開寫
這次 Amazon 事件本身就是很好的例子。目前可以確認 AirTag 到了哪裡、員工怎麼描述 VGT3、Amazon 如何回應;不能確認的則是掃描資料到底進入哪一個模型、總共處理多少書,以及這批資料現在被哪些 Amazon 產品使用。
把這兩層分開寫,讀者比較知道哪裡是調查結果、哪裡是合理推測。AI 生成內容變多之後,這種寫法不需要額外發明什麼「真人感」,單純把證據邊界標清楚就已經差很多。
這次 AirTag 調查最有意思的地方,不只是那隻 VGT3 暴龍。真正做調查的 404 Media 原本面對的是一條很難直接看到的資料供應鏈:書商知道有人大量買書,外界也知道 Anthropic 曾經 destructive scan,但到底是哪一家企業在接收某一批書,沒有答案。最後靠一顆藏在紙本裡的追蹤器,把其中一批貨一路送到了 Amazon。
但證據到這裡就該停。Amazon 還沒有確認 VGT3 的掃描內容就是特定 AI 模型的 training set,也沒有公開這項計畫的規模。404 Media 的調查提供了很強的線索,並且確認實體裁書掃描作業確實存在;下一步需要的仍然是 Amazon 更完整的說明,而不是把剩下的空白直接補成定論。
對內容創作者來說,這件事也不用變成「以後什麼都不能公開」。比較現實的提醒只有一個:文字一旦放進公開流通系統,後續可能怎麼被取得、轉換與再利用,已經不能只用傳統的「有人閱讀這篇文章」來理解。平台設定、網站爬蟲規則、授權條款與原始資料保存,都開始變成內容工作的一部分。
常見FAQ
Q1:Amazon真的承認買舊書來訓練AI嗎?
目前沒有完整承認。404 Media 調查把一批約 1,000 本書追到 Amazon LAS8/VGT3,並取得員工對裁書與掃描工作的描述;Amazon 則只表示會透過商業管道購書,以開發與改善客戶使用的產品與服務,沒有確認 VGT3 掃描資料具體用於哪一套 AI 模型。
Q2:被Amazon掃描的都是非常珍貴的古籍嗎?
不能這樣說。404 Media 將調查對象稱為 rare books,但書商也表示大量買家沒有鎖定連 ISBN 都沒有的最稀有古籍。比較準確的描述是稀有、冷門、舊版或尚未廣泛數位化的紙本出版品。
Q3:買下實體書後,把它裁開掃描就是合法的嗎?
拆毀或處分那一本合法購買的實體書,和重製書中受著作權保護的內容是兩個問題。美國 First Sale Doctrine 讓合法副本持有人可以處分那份實體副本,但掃描所涉及的重製仍要另外分析。2025 年 Bartz v. Anthropic 的特定案件中,法院認定 Anthropic 的訓練與合法購買紙本後的特定數位化方式屬 Fair Use,但不能因此推成所有 AI 訓練資料取得方式都已一律合法。
Q4:為什麼AI公司會想買舊的紙本書?
目前資料供應商的一個明確賣點,是生成式 AI 普及以前出版的書不會混入近年大量增加的 AI-generated text,而且許多冷門作品尚未完整出現在網路資料集中。404 Media 7 月的調查就記錄到書籍資料商以這個理由向 AI 客戶推銷舊紙本。
Q5:Amazon是第一家使用destructive scanning的AI公司嗎?
不是。Anthropic 的訴訟文件已經記錄公司大量購買紙本書、拆除裝訂、掃描後建立數位資料庫的作法。Amazon 這次的特別之處,是 404 Media 透過實體追蹤器把一批書的物流終點直接追到了 Amazon VGT3。
Q6:部落格設定robots.txt就能阻止AI公司取得文章嗎?
不能保證。robots.txt 是標準化的爬蟲規則,但 IETF 明確指出 Robots Exclusion Protocol 不能取代真正的內容安全措施。它適合表達 crawler policy;真正不能公開取得的內容,仍需要登入、權限或伺服器端存取控制。