索尼與華納查佩爾起訴 Anthropic:指控以盜版歌曲訓練 Claude,每首最高索償十五萬美元

重點摘要

2026 年 8 月 28 日(星期五),索尼音樂出版(Sony Music Publishing)與華納查佩爾音樂(Warner Chappell Music)連同旗下多家出版公司,向美國加州北區聯邦地區法院聖荷西分庭(U.S. District Court for the Northern District of California, San Jose Division)提交民事起訴狀,案號 5:26-cv-09217,控告 Anthropic PBC、行政總裁 Dario Amodei 與共同創辦人 Benjamin Mann。起訴狀指控被告以大規模非法 BT 下載(torrenting)、爬取及下載受版權保護的音樂作品,用以開發、營運 Claude 系列模型並從中獲利;正文點名的作品包括《Ain't No Mountain High Enough》、《All I Want for Christmas is You》、《Eye of the Tiger》、《Here Comes Santa Claus》及 Taylor Swift 的《Paper Rings》。本文由 X News 話題頁發現,其後已核對 CourtListener/RECAP 存檔的起訴狀原文(48 頁)、TechCrunch、Variety、Ars Technica、Al Jazeera 及路透社報道,並對照 Anthropic 向上述媒體發出的回應。來源真實性已驗證。起訴狀所述均為原告主張,並非法院已認定的事實;本文不把尚未證實的指控寫成判決。

索尼與華納查佩爾起訴 Anthropic:指控以盜版歌曲訓練 Claude,每首最高索償十五萬美元

2026 年 8 月 28 日(星期五),索尼音樂出版(Sony Music Publishing)與華納查佩爾音樂(Warner Chappell Music)連同旗下多家出版公司,向美國加州北區聯邦地區法院聖荷西分庭(U.S. District Court for the Northern District of California, San Jose Division)提交民事起訴狀,案號 5:26-cv-09217,控告 Anthropic PBC、行政總裁 Dario Amodei 與共同創辦人 Benjamin Mann。起訴狀指控被告以大規模非法 BT 下載(torrenting)、爬取及下載受版權保護的音樂作品,用以開發、營運 Claude 系列模型並從中獲利;正文點名的作品包括《Ain't No Mountain High Enough》、《All I Want for Christmas is You》、《Eye of the Tiger》、《Here Comes Santa Claus》及 Taylor Swift 的《Paper Rings》。本文由 X News 話題頁發現,其後已核對 CourtListener/RECAP 存檔的起訴狀原文(48 頁)、TechCrunch、Variety、Ars Technica、Al Jazeera 及路透社報道,並對照 Anthropic 向上述媒體發出的回應。來源真實性已驗證。起訴狀所述均為原告主張,並非法院已認定的事實;本文不把尚未證實的指控寫成判決。

這場訴訟把生成式 AI 最尖銳的爭議再次放到台面:訓練資料從哪裡來、取得方式是否合法,以及模型輸出會否直接替代歌詞與樂譜市場。對香港企業而言,問題同樣具體——公共模型吃進未授權語料的風險,與把內部受版權及《個人資料(私隱)條例》約束的資料送出境外,其實是同一條供應鏈。

一、核心事件:音樂出版商把「訓練資料從哪裡來」告上聯邦法院

原告並非唱片廠牌的錄音部門,而是音樂出版業務:索尼音樂出版(US)有限公司及其旗下多家 EMI/Jobete/Hipgnosis 等關聯出版公司,以及華納查佩爾音樂及其旗下 Cotillion、Unichappell、Warner-Tamerlane 等關聯公司。被告為 Anthropic PBC,以及被列為個人被告的 Amodei 與 Mann。起訴狀由 Oppenheim + Zebrak, LLP 與 Pryor Cashman LLP 代表提交,並要求陪審團審理。

原告請求的救濟包括:

  • 依美國《版權法》第 504(c) 條,就故意侵權索取法定損害賠償,每件作品最高 15 萬美元;或以實際損失及被告利潤作為替代。
  • 依第 1203(c)(3)(B) 條,就移除或竄改版權管理資訊(copyright management information, CMI)索取每項違規最高 2.5 萬美元。
  • 永久禁制令,制止繼續侵權。
  • 要求被告交代 Claude 的訓練資料、訓練方法與已知能力,並列出曾用於訓練的原告歌詞及其他受保護作品。
  • 銷毀侵權複製品。

起訴狀列出四項訴因:(一)以 torrenting 構成的直接侵權,針對三名被告;(二)以 torrenting 構成的輔助侵權,針對 Amodei 與 Mann;(三)直接侵權,針對 Anthropic(涵蓋爬取、訓練與輸出);(四)移除或竄改 CMI,針對 Anthropic。

原告稱,在 2021 年 6 月,Mann 代表 Anthropic、並在 Amodei 指示下,以 BitTorrent 從 Library Genesis(LibGen)下載至少五百萬冊盜版書籍;2022 年 7 月再從 Pirate Library Mirror(PiLiMi)下載至少二百萬冊。這些數字來自同一法院先前在 Bartz v. Anthropic 中的事實認定。起訴狀指,上述書庫中包含大量由音樂出版商授權印製的歌譜與歌詞集,例如《The Beatles Complete Scores: Every Song Written & Recorded By the Beatles》(當中有《Twist and Shout》等作品)及《Best of Taylor Swift Songbook》(當中有《Cruel Summer》等作品)。原告又指 Anthropic 從 MusixMatch、LyricFind 等獲授權歌詞網站,以及 Common Crawl、The Pile、Books3 等數據集取得複本,並以「破壞性掃描」把二手實體書製成數碼檔。

必須分開兩層:第一層是「如何取得複本」(盜版書庫、BT 同時上傳下載);第二層是「其後如何用於訓練或輸出」。原告主張兩層都構成侵權,並指 Claude 可應提示逐字或近乎逐字複述歌詞,甚至在用戶只問和弦時一併吐出歌詞。Anthropic 並未在公開新聞室就本案發布獨立聲明;其發言人向 Variety、Ars Technica、TechCrunch 及 Al Jazeera 表示,這是「同一批律師的第三宗訴訟,在重複已在審理中的指控」,並稱「訓練生成式 AI 模型屬轉化性合理使用——正如 Bartz 案法院所裁定」,公司將全力抗辯。TechCrunch 另引述發言人電郵:「我們不同意出版商的主張,並打算在法庭上強力抗辯。」

背景不能省略。2025 年 6 月,同一法院的 William Alsup 法官在 Bartz 案簡易判決中,把用途拆開處理:以合法取得的書籍訓練大型語言模型,被認為具高度轉化性、可構成合理使用;但以盜版複本建立並保存「中央圖書館」則不屬合理使用。其後 Anthropic 於 2025 年 9 月與作者達成約 15 億美元和解。音樂出版商在本案起訴狀中寫道,15 億美元「顯然不足以阻嚇」侵權。該句是原告修辭,不是對和解條款的司法評價。音樂業對 Anthropic 的訴訟亦非第一宗:Universal Music Publishing Group、Concord Music Group 與 ABKCO 已在 2023 年起訴;Variety 與 Music Business Worldwide 指 BMG 與 Round Hill Music 其後亦有類似案件。這些平行訴訟仍在進行,本案並未判決。

技術細節

從系統角度看,起訴狀其實在攻擊 LLM 訓練流水線的三個複製節點:

  1. 取得(acquisition)。BitTorrent 的設計是邊下邊傳:下載即複製,上傳即發行。原告主張每一次 torrent 都同時觸及美國《版權法》的重製權與發行權,且與後續是否用於「訓練」無關。Bartz 案已把「盜版建庫」單獨定性,本案把同一套事實延伸到歌詞與樂譜。
  2. 訓練(training)。文本被切成 token、寫進批次、用來計算下一詞預測的損失,權重因而更新。即使模型權重不是歌詞的逐字檔案,訓練過程仍會製造大量中間複本。原告另指,Anthropic 曾用在 LibGen/PiLiMi 語料上訓練的非商業模型,為商業 Claude 產生合成數據或強化學習回饋,試圖繞過「商業模型沒有直接吃盜版書」的表述。此點仍屬主張,有待舉證。
  3. 輸出與 CMI(output)。若模型能穩定吐出受保護歌詞,即可能構成對重製權與演繹權的另一次侵犯;若輸出去掉作者、出版者或版權聲明,則可能觸及 CMI 條文。原告稱,在較早的 UMG/Concord 訴訟後加入的防護欄,「只要再提示一次」即可繞過。

法定損害賠償的上限是理論數字。起訴狀用「成千上萬」描述原告作品數量,新聞報道因而推算潛在索償可達十億美元量級;法院尚未認定侵權作品清單,也尚未裁定是否屬故意。Forbes 所報、並被起訴狀引用的約 2 萬億美元估值,同樣不是已核實的財務事實,本文不予採納為定論。

二、技術原理:合理使用抗辯,卡在「怎麼拿到資料」

生成式模型的訓練,本質上是大規模複製與壓縮。工程師關心的是損失曲線與基準分數;版權法關心的是每一次複製有沒有授權、抗辯能不能成立。

美國《版權法》第 107 條的合理使用,通常衡量四項因素:使用目的與性質(是否轉化、是否商業)、作品性質、使用的數量與實質性,以及對潛在市場的影響。Bartz 案把「訓練」與「建盜版庫」切開,等於告訴行業:轉化性訓練抗辯並非一張通行證,取得方式仍可獨立構成侵權。音樂出版商顯然在這條縫裡做文章。他們主張歌詞市場與書籍市場不同——Claude 被指可以直接吐出歌詞、拼貼「新歌詞」,與串流、授權歌詞網站、同步授權形成替代,而不只是「學習寫作」。Alsup 法官在 Bartz 中寫過,模型訓練作品並非為了搶跑去複製或取代原作;出版商則認為,歌詞一旦被逐字吐出,這句話就不再成立。這是法律問題,不是已經打完的仗。

技術上還有一層容易被忽略:授權歌詞網站並非公有領域。MusixMatch、LyricFind 之所以能展示歌詞,是因為與出版商簽了授權;網頁上的 CMI(作者、出版者、© 標記)正是授權關係的機器可讀痕跡。若訓練語料來自 Common Crawl 對這些頁面的快照,再在輸出時去掉 CMI,原告主張的就不是「互聯網上公開就等於可訓練」,而是「連授權管道上的聲明一併剝走」。這對企業採購公共 API 同樣有意義:供應商若不能說明語料來源與授權狀態,買家等於把版權風險外包,卻未必真的轉走法律責任。

另一條技術分界是「權重內記憶」與「檢索外掛」。若模型只是在權重裡壓縮了統計規律,輸出偶爾撞詞,抗辯空間較大;若系統在推理時仍可從內部書庫或未授權快取取出完整歌詞,則更接近傳統的重製與提供。起訴狀要求交代訓練資料與方法,正是要把這條分界從黑盒變成可舉證的事實。

香港目前沒有與美國第 107 條同等開放的「合理使用」條款。《版權條例》(第 528 章)以列舉式例外為主。知識產權署 2024 年就「加強《版權條例》以配合人工智能科技發展」完成公眾諮詢;2025 年施政報告其後表示,政府將就相關法律原則制訂實務守則,並擬備立法建議。立法會工商創新科技事務委員會 2025 年 2 月文件指出,擬議的文本及數據開採(TDM)豁免,擬同時涵蓋非商業與商業用途,但設有限制條件,包括:使用者必須合法取用版權作品、不得使用侵權複製品、須保存並披露作品來源紀錄;若已有相關授權計劃,例外可能不適用;權利人亦可選擇退出。換言之,即使日後香港引入 TDM 豁免,「從盜版書庫下載」這條路徑,按官方至今公開的構思,仍會被排除在例外之外。本案的美國爭議,正好對上香港未來條文最可能收緊的那一點:合法來源。

四、日常應用場景

1. 開發者與技術團隊

若團隊仍以「網上找得到就能進訓練集」為預設,這份起訴狀是一次昂貴的反例。可行做法並不神秘:建立資料來源清單與授權狀態、拒絕影子書庫與來路不明的「Books3 類」鏡像、為微調語料保留出處與清洗紀錄,並在評估集中專門測試「會否逐字吐出第三方歌詞、代碼或新聞」。OpenAI 相容的私有 API 只解決介面問題,不解決語料權利。把防護欄當產品功能而非法律抗辯,也更誠實——防護欄可被再提示繞過,並不能把未授權訓練變成已授權。

2. 企業與隱私敏感行業

金融、法律、醫療、媒體機構面對的是雙重約束。版權層面,把客戶合約、內部報告、已購資料庫或歌詞/影像檔丟進公共聊天機械人,可能構成未授權重製,也把資料交給供應商的訓練或日誌政策。私隱層面,《個人資料(私隱)條例》(第 486 章)的保障資料原則要求:收集目的相關且公平(原則一)、使用限於原目的或獲同意的新目的(原則三)、採取切實可行的保安措施(原則四)。私隱專員公署 2024 年《人工智能:保障個人資料模範框架》、2025 年《僱員使用生成式人工智能指引清單》,以及 2026 年《在使用代理式人工智能時保障個人資料私隱》指引,均強調把個人資料輸入第三方 AI、以個人資料訓練模型、以及跨境處理的風險。版權訴訟不會代替 PDPO 執法,但兩者指向同一採購條件:資料必須是機構有權使用的,而且最好不要離開受控環境。

3. 一般用戶

個人向公共模型「問歌詞」或「寫一首像某歌手的歌」,法律風險與企業把整庫歌譜送去訓練並不相同,但輸出端仍可能出現受保護歌詞。本案若進入舉證,法院將要處理的正是這類輸出算不算市場替代。對個人用戶的實際建議很簡單:把模型當草稿工具,而不是授權歌詞資料庫;商業發布前應自行取得授權。

4. 香港與亞洲市場視角

香港的音樂、廣告、短視頻與遊戲公司,日常就在處理詞曲授權;銀行、律所與醫院則同時受 NDA 與 PDPO 約束。美國這宗案件不會直接改寫《版權條例》,但它把「授權資料 vs 盜版資料」從抽象政策變成可計價的訴訟風險。擬議 TDM 豁免若最終要求合法取用、禁止侵權複本、並保留來源紀錄,則企業現在建立的資料治理(來源、授權、退出權、保存期限)將來就是合規底稿,而不是額外成本。

亞洲市場另一個現實是:許多機構負擔不起「先侵權、再和解」的現金流。Bartz 案 15 億美元和解,對前沿實驗室或可稱為「做生意的成本」;對香港中型企業,一張未授權語料單已足以否定整條 AI 項目。較穩妥的路徑,是用開源權重作底座,只注入自有、已獲授權或可合法使用的內部資料,在可審計環境提供私有 API,並為輸出做侵權與私隱抽檢。

五、專業評價與潛在考量

優勢

  • 起訴狀把取得方式、訓練用途與輸出侵權分開主張,對準 Bartz 案已經打開的法律縫隙,而不是只喊「AI 不應訓練受保護作品」。
  • 點名具體歌曲與歌譜書名,並要求交代訓練資料,有助把黑盒爭議變成可發現的事實問題。
  • 將 CMI 列入訴因,觸及授權歌詞網站與元數據被剝離的問題,對依賴授權管道的出版商有實際意義。
  • 對香港讀者而言,本案把「合法來源」寫成全球共同語言,與知識產權署公開的 TDM 構思方向一致。

需要留意的地方

  • 目前只有起訴狀與被告透過傳媒的抗辯,沒有裁決。指控中的 torrent 數量、哪些歌曲確實進入商業 Claude、防護欄是否「一經再提示即可繞過」,均有待舉證。
  • Anthropic 主張訓練屬轉化性合理使用,並指本案在重複其他案件的指控。合理使用是否適用於歌詞市場替代,正是待審議題,不能預支結論。
  • 「每首 15 萬美元」是美國法定損害賠償上限,不是已判決金額;作品清單尚未由法院確認。
  • 路透社/Al Jazeera 曾概括提及 Beatles、Taylor Swift、Michael Jackson 等藝人;起訴狀正文明確點名的是上述歌曲及披頭四、Taylor Swift 等歌譜書。本文以起訴狀為準,不把未經起訴狀點名的曲目寫成已列清單。
  • 15 億美元和解與「2 萬億美元估值」被原告用來論證阻嚇不足,屬訴訟修辭;估值尤其不應當成已核實的財務事實。

結語

索尼與華納查佩爾並不是在抽象地反對人工智能。起訴狀寫明,出版商承認合乎倫理的 AI 有潛力,並且已經簽出允許在 AI 場景使用其音樂作品的授權;他們反對的是未獲授權、尤其是經盜版書庫取得的訓練路徑。Anthropic 則把抗辯放在轉化性合理使用,並否認出版商的主張。法院尚未判決。真正已經發生、而且可以核對的,是一份 2026 年 8 月 28 日入稟加州北區聯邦法院的 48 頁起訴狀,以及被告透過多家媒體作出的公開回應。

對香港機構,可執行的結論比法庭預測更有用:不要把未授權語料或受 PDPO 約束的個人資料送進公共模型;訓練與微調只使用有權使用的資料;保存來源紀錄;讓模型留在可審計的環境。如需在香港以授權的內部資料部署私有 LLM(Dataset 製作、QLoRA/LoRA 微調、託管與 OpenAI 相容私有 API;年費由 HK$88,000 起,100% 數據不出境),可參考 YSK Limited 的企業私有 LLM 全託管:https://ysk.hk/services/ai-automation


參考來源

延伸閱讀 · 相關服務與產品