首頁 〉AI拿整本有著作權的書去訓練,不一定侵權?
AI拿整本有著作權的書去訓練,不一定侵權?

Anthropic訓練Claude時,使用大量書籍作為訓練資料。
其中有些是自己買來的紙本書,拆書、掃描成電子檔;另一些則直接從LibGen等盜版書庫下載。
美國法院把兩件事情分開看。
合法取得的書籍拿來訓練LLM,美國法院認為不是讓使用者「看這本書」,而是讓模型學習語言規律、生成新的文字,具有高度轉化性,因此可能構成合理使用。
但從盜版網站下載數百萬本書,再建立永久保存的中央書庫,就不一樣。
美國法院認為每一份盜版副本都可能直接替代正版,而且永久保存已經超過訓練所必要,因此不屬合理使用。
所以AI訓練的著作權問題,要問 「資料怎麼取得?拿來做什麼?會不會取代原作市場?」
同樣是拿書訓練AI,來源與利用方式不同,法律結果可能完全不同。
林更盛、李智威,論訓練大型語言模型所涉及的著作權問題
其中有些是自己買來的紙本書,拆書、掃描成電子檔;另一些則直接從LibGen等盜版書庫下載。
美國法院把兩件事情分開看。
合法取得的書籍拿來訓練LLM,美國法院認為不是讓使用者「看這本書」,而是讓模型學習語言規律、生成新的文字,具有高度轉化性,因此可能構成合理使用。
但從盜版網站下載數百萬本書,再建立永久保存的中央書庫,就不一樣。
美國法院認為每一份盜版副本都可能直接替代正版,而且永久保存已經超過訓練所必要,因此不屬合理使用。
所以AI訓練的著作權問題,要問 「資料怎麼取得?拿來做什麼?會不會取代原作市場?」
同樣是拿書訓練AI,來源與利用方式不同,法律結果可能完全不同。
林更盛、李智威,論訓練大型語言模型所涉及的著作權問題