社會觀察

【投書】從 Anthropic 拆書訓練模型看 AI 時代的著作權考驗

Anthropic 掃描二手書後銷毀,到底有沒有違法?美國法院給出的答案是…… Anthropic 掃描二手書後銷毀,到底有沒有違法?美國法院給出的答案是…… 圖片來源:Vasilyev Alexandr/Shutterstock

當全球將大型語言模型的競爭焦點放在算力、參數規模與推理能力時,Anthropic 的「巴拿馬計畫」(Project Panama)卻讓外界重新把目光拉回 AI 發展所依賴的基礎資料。模型愈來愈強,背後所依賴的知識內容從何而來,以及企業如何取得這些資料,開始成為新的治理課題。

依公開訴訟文件與相關報導,Anthropic 為建立模型訓練資料,透過中介大量購買實體書籍,並將書籍內容轉換為可供機器處理的數位文本。為完成大規模數位化作業,相關流程採行切除書脊、逐頁掃描的方式,並於掃描後將紙本回收。

破壞性掃描並非新技術,圖書館與大型數位典藏計畫早已使用多年;差別在於,這項技術如今被大規模導入生成式 AI 訓練,使書籍不僅是閱讀媒介,也成為模型建構語言能力的重要資料來源。

隨著大量作品轉換為可運算的數位文本,討論焦點也隨之轉變。過去,著作權爭議多半圍繞作品是否遭到重製;如今,人們開始追問資料如何取得、如何利用,以及權利人是否仍能掌握作品後續的流向。企業購買書籍取得的是實體物所有權,並不當然取得作品的重製權,因此,整本書是否可以數位化並投入模型訓練,成為這起事件最受關注的法律問題。

生成式 AI 訓練仍受既有著作權法拘束

美國法院在 Bartz v. Anthropic 一案中,並未對 AI 訓練作概括性合法或違法判斷,而是依據資料來源與利用方式分別處理。就合法購買的實體書而言,法院於 2025 年 6 月的簡易判決認為,在特定事實背景下,掃描後作為模型訓練使用具有高度轉化性,因而可成立合理使用;至於未經授權取得的盜版電子書,法院則認為,即使後續用途是模型訓練,也不足以排除非法取得資料所衍生的法律責任。

這項判決沒有替 AI 訓練建立全面性的豁免,而是再次確認著作權法仍以資料來源與利用方式作為判斷基礎。合法取得的資料,可能因模型訓練具有不同於傳統閱讀的利用功能,而進入合理使用的討論;若來源本身存在違法問題,則不會因後續用途是模型訓練,而改變原有的法律評價。至於合理使用是否成立,最後仍須依個案事實,綜合衡量利用目的、著作性質、使用範圍,以及對既有或潛在授權市場的影響,而非僅因資料被用於 AI 訓練,就當然受到法律保護。

美國並未因生成式 AI 的出現而另行建立專屬的著作權規則。法院仍沿用既有的合理使用架構,由個案逐步累積判準,檢視資料來源是否合法、利用目的是否具有轉化性,以及模型訓練是否對原作品或授權市場造成實質影響。模型訓練因此並未被視為獨立的法律例外,而是回到既有著作權法體系接受檢驗。

這種作法保留了相當大的彈性,使司法能隨技術演進持續修正判斷標準,但也相對提高法律適用的不確定性。大型科技公司通常擁有完整的法務團隊與資料治理能力,可以透過資料清查、授權協商及訴訟策略分散風險;相較之下,新創公司、研究機構與中小企業則未必有能力承擔相同成本。當判準仍需透過司法實務逐步形成時,法規的不確定性便可能轉化為市場競爭門檻。

合理使用是否成立,最後仍須依個案事實,綜合衡量利用目的、著作性質、使用範圍,以及對既有或潛在授權市場的影響,而非僅因資料被用於 AI 訓練,就當然受到法律保護。圖片來源:Jure Divich/Shutterstock

AI 訓練規範三條路:美國、歐盟與日本制度比較

歐盟採取不同的制度路徑,除了著作權制度,也將資料治理納入 AI 法制。《人工智慧法》要求通用型 AI 模型供應者建立技術文件、提出訓練內容摘要,並制定符合著作權法的合規政策;《數位單一市場著作權指令》則建立文字與資料探勘制度,在特定條件下允許資料分析,同時保留權利人以機器可讀方式表示保留權利的機制。相較於著重事後侵權判斷,歐盟更要求企業在模型開發階段即建立可追溯的資料來源、完整的治理程序與透明揭露機制,使資料治理逐步成為法律上的合規義務。

日本採取相對開放的制度設計。著作權法第 30 條之 4 針對資訊分析設有例外規定,只要利用目的在於資訊分析、機器學習或資料探勘,而非欣賞作品本身,原則上即可不經授權利用著作,以降低 AI 研發初期的法律摩擦並提高法規的可預測性。不過,這並不表示著作權保障因此退居次要地位;當利用方式對權利人利益造成不合理損害,或模型功能已實質轉向替代作品,而非單純資訊分析時,相關利用仍須回到著作權法的規範與檢驗。

三個法域採取不同制度選擇,面對的卻是相同挑戰。生成式 AI 大幅改變文本利用方式,也讓著作權法首次面對大規模模型訓練所帶來的新情境。美國選擇透過司法累積判準,日本以立法降低資訊分析的法律障礙,歐盟則將透明、紀錄與資料治理納入法制設計。制度內容雖然不同,但都在重新尋找創新發展、權利保障與市場秩序之間的平衡點。

生成式 AI 大幅改變文本利用方式,也讓著作權法首次面對大規模模型訓練所帶來的新情境。圖片來源:FAMILY STOCK/Shutterstock

生成式 AI 時代,台灣如何兼顧模型創新與內容產業?

台灣目前仍未針對 AI 訓練資料建立專門規範。依現行《著作權法》第 65 條第 2 項,利用受保護著作訓練模型,多半涉及重製行為;至於是否合法,仍須回到該條所列因素,由法院綜合利用目的及性質、著作之性質、所利用之質量及其在整個著作所占比例,以及利用結果對著作潛在市場與現在價值的影響,逐案認定。

然而,這套制度原本主要對應引用、評論、新聞報導與教育利用等傳統情境。生成式 AI 出現後,作品可能在訓練階段被大量複製,卻未必以相同形式出現在輸出結果中,使合理使用面臨過去少見的判斷難題。未來司法實務究竟應更重視訓練過程、模型功能的轉化程度,還是授權市場的影響,目前仍有相當大的發展空間。

若要求開發者事前取得所有權利人的授權,高昂的交易成本將提高模型開發門檻。對台灣而言,繁體中文及法律、醫療、金融等專業文本本就相對有限,若取得成本持續增加,本土模型發展恐將受限。市場也可能更傾向採用境外基礎模型,再以少量本地資料微調,使資料治理與模型研發能力更難在國內累積。

反過來說,若完全依賴合理使用處理模型訓練,創作者、出版社與新聞媒體等內容產業也可能逐漸失去授權與議價空間,長期削弱高品質內容的生產誘因。真正需要思考的,不是哪一方應該退讓,而是如何在降低創新成本的同時,維持內容產業的持續發展。

文字與資料探勘例外、集體授權、法定補償、權利保留、資料來源紀錄與透明義務,都是可供選擇的制度工具,分別對應不同的治理需求。未來修法若能配合台灣產業規模、內容市場與司法實務建立適當制度,將有助於AI發展與著作權保護形成較為穩定的平衡。

(作者為大專院校兼任教師)

 

分享圖文請註明出處,未經本站同意不得轉載

瀏覽次數:1289

獨立評論

每週四,精選觀點直送信箱!現在就訂閱獨立評論電子報

編輯推薦

延伸閱讀

「獨立評論@天下」提醒您:
1.本欄位提供網路意見交流平台,專欄反映作者意見,不代表本社立場
2.發言時彼此尊重,若涉及個人隱私、人身攻擊、族群歧視等狀況,本站將移除留言。
3.本留言板所有言論不代表天下雜誌立場。

分享圖文請註明出處,未經本站同意不得轉載