社群網路

歐盟人工智慧法案上路,能緩解生成式AI對著作權的衝擊嗎?

世界首部直接規範人工智慧的法案《人工智慧法案》能否緩解AI對著作權帶來的衝擊? 世界首部直接規範人工智慧的法案《人工智慧法案》能否緩解AI對著作權帶來的衝擊? 圖片來源:Bas Nastassia/Shutterstock

AI雖帶給人們極大便利,卻也引發諸多爭議,例如捏造事實、侵犯著作權及隱私權等社會倫理及法律議題。經過數年研議後,歐盟終於在2024年3月13日正式通過《人工智慧法案》(Artificial Intelligence Act,簡稱AI法案)。這是世界首部直接規範人工智慧的法案,彰顯歐盟試圖主導全世界AI技術發展的決心。

如同《時代雜誌》報導,這部法案依照風險程度,將不同的人工智慧系統分級管理──風險愈高,受到的監管就愈嚴格;而像社會評分、預測罪犯行為等直接侵犯人民基本權利的系統,則被明文禁止。另外,政府只能在特定的重大犯罪案件,例如涉及恐怖攻擊時,才能使用AI加持的臉孔掃描技術來監控人民[1] 。

考量「能力越大、責任越大」,有了前述的分級管理,才能預防AI造成難以預測的風險,例如侵犯隱私、種族歧視、大規模網路攻擊等。以下本文將聚焦在「著作權」的問題,藉此談談本法案能否緩解AI對此帶來的衝擊。

被低估的著作權問題

隨著AI輸出的文字、圖片、影片品質愈來愈高,甚至開始威脅原本人類的工作,許多創作者開始質疑AI使用資料、訓練模型時,是否確實詢問過創作者的意願?這是否是對著作權赤裸裸的侵害?當AI公司以創新之名賺進大把鈔票時,可曾考慮過他人的權益?

試想,若有一個AI系統違反了規範,頂多是服務被勒令停止,但如果AI模型本身侵害了著作權,則會影響到所有使用此AI模型的服務,故筆者認為這是AI產業最大的一顆未爆彈。

話雖如此,即使初期有AI開發商不幸夭折,整個AI產業也一定會繼續發展。就如同大家熟悉的音樂產業,雖然帶領網路下載音樂的Napster已死[2] (註二),線上音樂仍以串流的商業模式蓬勃發展。現今的AI公司中,誰將成為過往的Napster,誰又能成為現在當紅的Spotify呢?

隨著AI輸出的文字、圖片、影片品質愈來愈高,甚至開始威脅原本人類的工作,許多創作者開始質疑AI使用資料、訓練模型時,是否確實詢問過創作者的意願?圖片來源:Bangkok Click Studio/Shutterstock

公開透明,是避免侵權的防腐劑

依照歐盟AI法案,AI模型的開發商必須說明哪些資料被用於訓練AI模型,並提供「足夠詳盡的摘要」(sufficiently detailed summary),例如:列舉用於訓練模型的主要資料集、提供其他資料來源的敘述性說明等。

在最初的立法草案中,其實只有要求公佈受著作權保護的資料即可,不過最終版本則擴大要求揭露所有訓練資料,以便第三方行使權利。根據AI法案,新成立的人工智慧辦公室(AI office)將會提供摘要的範本給外界參考。

對AI公司來說,雖然只被要求提供摘要,而非窮盡說明所有訓練資料,但由於大型AI模型往往使用數以億計的作品進行訓練;所以即便是摘要,對企業的負擔也十分巨大。另外,由於許多資料集是由第三方提供,AI公司可能永遠無法確認它們的原始來源及正確性。

這還不打緊,更嚴重的問題是,許多資料來源幾乎可以確定是非法的,例如OpenAI用於訓練ChatGPT的Books2資料集,被強烈懷疑來自俗稱「盜版書天堂」的影子圖書館,如Libgen genesis;而Meta用以訓練LLaMA模型的Books3資料集,內容也是滿滿侵權書籍。

主動公開這些資料,不只會遭到輿論撻伐,也等於是把侵權證據向著作權人雙手奉上。這或許才是AI公司一直閉口不提訓練資料來源的真正理由。

我相信當初開發AI的研究人員可能沒想太多,或完全輕忽了著作權的風險。就算撇開著作權不談,創作時如果參考了他人的內容或想法,也該列出出處以表揚有貢獻的創作者。這不只是約定成俗的慣例,也是基本的禮儀。即使生成式AI在技術上無法做到這點,起碼應該讓公眾知道產出的內容「可能」參考了哪些作品吧?OpenAI及Meta如果直接使用盜版內容來訓練AI,又以窒礙難行當作藉口拒絕提供資訊,或是以阻礙創新為由威脅監管機構,可能難以服眾。

著作權人有說「不」的權利

除了前述規範AI法案還要求開發商必須遵守歐盟《數位單一市場著作權指令》第4條第3款。這個條款,讓第三方在進行「文字和資料探勘」(Text and Data Mining)時,不必擔心侵害著作權;但前提是,如果著作權人主動表示要「退出」(opt-outs),不想讓自己的創作被利用,AI公司就必須尊重其意願。

法案採取這樣的作法,是很重要的決定,代表歐盟為了不阻撓AI產業的發展,允許廠商在符合法規的前提下,能用前述方式訓練模型。

過往當AI公司被質疑擅自使用他人創作時,最常見的抗辯就是「向如此多的著作權人取得授權,是不可能的事」。但即使是為了追求創新,也至少該做合理的努力。圖片來源:NicoElNino/Shutterstock

不過下一個問題是:訓練AI模型涉及到成千上萬的著作權人,每個人表示「退出」的方式或許各有不同,而目前也不知道哪些「退出」方式是符合標準的,所以還須等待進一步的指引。

不過在AI法案中,已經明文要求開發商使用「最先進的技術」來辨識、尊重著作權人的退出要求(也許在網頁放置一段簡單的文字就足夠了?)。這似乎意味歐盟傾向把責任交給AI公司,畢竟他們才是現在佔人便宜的那一方,對吧?

過往當AI公司被質疑擅自使用他人創作時,最常見的抗辯就是「向如此多的著作權人取得授權,是不可能的事」。但即使是為了追求創新,也至少該做合理的努力。舉例來說,OpenAI提供了完整的說明,讓著作權人在網站使用robots.txt的標記,以避免被OpenAI的網路爬蟲給索引。這是所有 AI 廠商最起碼應該嘗試去做的。或許政府應該說:「嘿!已經給了你們不少時間,是時候約束一下自己了。」

有人認為,AI反而鬆綁著作權的桎梏?

事實上,許多開放文化的愛好者十分歡迎生成式AI的到來。目前大多數國家認定只有人類創作的內容可以享有著作權,所以如果可以將原本帶有著作權的內容藉由AI轉化,並以新的形式出現,藉此逃脫現行著作權法的限制,就可以成為打開創作自由,甚至是言論自由的突破口。別忘了,在訓練完成的語言模型中,單一的訓練資料無法與其他內容區分開來,所以產出的內容也幾乎不可能追溯是源自何處。

而為了鼓勵開發商將AI模型開源,AI法案提供了額外的豁免。如果是開放給公眾自由存取、修改和發布的AI模型(例如Meta的LLaMA模型),就不需要揭露訓練資料的內容。當然,只是標註「開放原始碼」肯定是不夠的。由於軟體業界對於「開源」有不同的標準,我們也期待未來的 AI 監管單位能盡快讓公眾知道要使用何種授權條款,才能符合 AI 法案所定義的開源模型。

然而,AI工具已開始威脅到許多職業,如果連模型也被科技巨獸所壟斷並攫取所有的商業利益,顯然令人難以接受。相較之下,生成式AI運用人類的集體智慧來產生更多有價值的內容,這與開源軟體的精神不謀而合。這些將成果貢獻給公眾的開源模型,任何人都能使用,即使同樣存在爭議,至少是「大家的模型」,聽起來是不是真的比較討人喜歡?

人工智慧如同疫情期間的半導體,已經成為國安議題,沒有任何國家敢在賽道中落後。圖片來源:thanmano/Shutterstock

科技巨頭及國家間的博弈

人工智慧如同疫情期間的半導體,已經成為國安議題,沒有任何國家敢在賽道中落後。2023年,法國總統馬克宏直言:擔心歐盟在AI領域的競爭能力落後美國與中國,就是最真實的寫照。

雖然歐盟不斷強調AI法案的重點是讓人工智慧更安全、可信賴,但真實的目的還是是想把歐盟打造成一個最有利於AI發展的環境。

筆者認為,AI對社會及文化的衝擊還只在很初期的階段,如果不提前設定好框架而放任AI恣意發展,日後一定會造成社會對立,最終傷害到AI產業,所以歐盟的確踏出了重要的第一步。

歐盟已經決定在既有的著作權框架下管理AI,而暫時不對著作權法進行大刀闊斧的改革。而其他國家是否會選擇與歐盟相同的管理框架呢?

過去歐盟已經透過極為嚴格的《一般資料保護規則》(GDPR)管制個人資料的利用,影響了所有大型企業雲端服務的發展,其他世界強權是否能接受歐盟再次於AI領域設定國際標準?

OpenAI執行長之前曾表示,如果無法完全符合歐盟規範,有可能導致ChatGPT這家美國公司退出歐盟市場。我一向不喜歡陰謀論,不過這或許是歐盟暗自期待的結果之一?

對AI新創企業,例如專精於圖像生成的Midjourney來說,要謹記Napster的教訓,只要一有閃失,就會消失在科技的洪流中。即使對資源充裕的科技巨頭來說,違反規定所衍生的成本,可能也是切膚之痛。例如Meta在2023年,就因違反前述的歐盟《一般資料保護規則》,而被愛爾蘭政府處以高達12億歐元的罰款。

關於透明度要求,筆者認為揭露訓練資料是相當合理的,也難以想像有什麼正當理由不去配合。即便對AI公司來說是個龐大負擔,但在「AI是否會毀滅人類」都成了要嚴肅回答的話題時,試問誰能忍受、放任AI模型永遠是個黑盒子?更別說科技巨頭早以透過AI開始獲利,實在沒有裝聾作啞的權利,也必須站出來面對潛在使用盜版內容的問題。

不過,由於AI法案提供了著作權人拒絕提供訓練資料的管道,如果許多擁有大量高品質內容的公司選擇不與AI公司合作(例如已經與OpenAI對簿公堂的紐約時報),可能造成訓練資料中低品質內容的比例上升,而使生成式AI所產生內容的品質及正確度下降;又或是AI公司須付出更高的費用來取得授權,使目前的 AI 商業模式無法持續。

紐約時報》主張OpenAI與Microsoft侵害其著作權,並提起訴訟。圖片來源:Tada Images/Shutterstock

在風風雨雨中,AI法案應該算是歐盟給人工智慧產業的合理方案。如果AI公司還不買單,很容易就會被解讀為利用法律的漏洞謀利,而遭致更大的批評。

值得注意的是,完全開源的AI模型可以承受較低的監管壓力,這是否會促使更多業者跟隨美國的Meta、法國的新創Mistral AI採取開源路線?或是雙線並行,像Google一樣同時開發私有的Gemini及開源的Gemma模型?而在圖像生成領域,Stable diffusion早已是最佳選擇之一,與Midjourney及DALL·E分庭抗禮。

筆者猜測,未來會有更多AI模型選擇開源,不過無論我的猜測是否準確,AI的巨大浪潮都不會停歇,即使要花費鉅資多方押寶,也一定要站在浪頭之上。

(作者為對智財有著無限熱情、喜歡攪動同溫層的年幼大叔。台灣大學植病所碩士、倫敦大學智財管理碩士。曾任上市醫材公司法務主管、英國顧問公司產業分析師、科技業專利工程師。台灣專利師。近期興趣是研究 LLM 以彌補讀不到法學碩士的遺憾。)


[1] 其實,歐盟早在 2021 年,就啟動了 AI 法案的倡議。只是在當時,人工智慧仍被視為小眾領域,關注的應用主要也侷限在文字、影像辨識等。然而 2022 年底 OpenAI 推出 ChatGPT 後,這個看似萬能的聊天機器人震驚了全世界,其展現的強大能力及泛用性,也讓歐盟的 AI 法案備受各方囑目。

[2] 若要更明瞭著作權對新興產業的潛在威脅,我們可以重回1999年,一個名為Napster的公司曾經橫空出世,讓全球用戶能夠輕易地下載、聆聽他人所收藏的音樂。這個服務在幾個月內橫掃音樂產業,在極盛時期有高達8千萬註冊用戶,所佔用的網路頻寬甚至癱瘓了多個大學宿舍的網路。但就是因為侵犯著作權,Napster在誕生後2年後就被勒令停業,曾經輝煌的獨角獸在轉瞬間化為泡影。換言之,從約1995年開始,MP3格式的音樂開始流行,並隨著網路的快速發展不斷擴散。Napster進一步利用P2P技術,突破了音樂難以被搜尋到的瓶頸,宣告線上音樂正式起飛。但當時的音樂產業及著作權法規,還未能完全跟上此一變化,因此導致一連串的音樂著作權訴訟問題。這聽起來是否與現今的AI產業有點類似?那個時期,美國通過了《數位千禧年著作權法案》,以平衡創作者的權益、公眾利益和新興產業的發展。同樣的,現在世界各國都急於建立的AI監管方案,也是在為人工智慧產業的未來發展鋪路,以免國內的AI產業落到國際的後段班,甚至如同Napster般急速殞落。

分享圖文請註明出處,未經本站同意不得轉載

瀏覽次數:3197

獨立評論

每週四,精選觀點直送信箱!現在就訂閱獨立評論電子報

編輯推薦

延伸閱讀

我們是一群致力散播法治種子的法律人,為了喚醒台灣人的權利意識,共同創立媒體公司。對一般人而言,明明法律與社會的律動息息相關,但多半選擇迴避該議題。從這個糾結出發,我們不斷努力讓法律被大眾理解;期盼透過化繁為簡的書寫,讓大眾願意接觸法律,進而慢慢主動對各種制度提出自己的想法,親手參與改變自己的生活環境!
「獨立評論@天下」提醒您:
1.本欄位提供網路意見交流平台,專欄反映作者意見,不代表本社立場
2.發言時彼此尊重,若涉及個人隱私、人身攻擊、族群歧視等狀況,本站將移除留言。
3.本留言板所有言論不代表天下雜誌立場。
我們是一群致力散播法治種子的法律人,為了喚醒台灣人的權利意識,共同創立媒體公司。對一般人而言,明明法律與社會的律動息息相關,但多半選擇迴避該議題。從這個糾結出發,我們不斷努力讓法律被大眾理解;期盼透過化繁為簡的書寫,讓大眾願意接觸法律,進而慢慢主動對各種制度提出自己的想法,親手參與改變自己的生活環境!

分享圖文請註明出處,未經本站同意不得轉載