2026 年 9 月 1 日,美國司法部(Department of Justice)依據 28 U.S.C. § 517,於紐約南區聯邦法院多區訴訟 In Re: OpenAI, Inc. Copyright Infringement Litigation(案號 25-md-3143 (SHS) (OTW))提交《美國政府利益聲明》(Statement of Interest of the United States)。文件主張:以版權文本訓練大型語言模型(LLM),本身屬《美國版權法》第 107 條下的「合理使用」(fair use),不應被全面推定為侵權。本文已核對該 20 頁官方訴狀 PDF、TechCrunch 與 The Verge 對同一事件的報導,來源真實性已驗證。以下拆解法律論點、產業影響,以及對香港企業採購與合規的啟示。
一、核心事件:聯邦政府首次在媒體訴 AI 案中表態
技術細節
這份 Statement of Interest 並非判決,亦無強制拘束力;其性質是司法部向審理法官 Sidney Stein 說明「美國在本案的國家利益」。文件寫明:美國「有強烈利益繼續發展穩健且具競爭力的人工智能產業」,並引用總統 2025 年 1 月 23 日行政命令〈Removing Barriers to American Leadership in Artificial Intelligence〉,以及 2026 年 6 月 2 日〈Promoting Advanced Artificial Intelligence Innovation and Security〉。
關鍵結論句極為直接:「The United States has a strong interest in this Court rejecting any argument that training LLMs on copyrighted texts violates copyright law.」同時引用《國家人工智能政策框架》(National Policy Framework for Artificial Intelligence,2026 年 3 月):「training of AI models on copyrighted material, in and of itself, does not violate copyright laws.」
文件刻意把「訓練階段」與「輸出階段」分開:訓練時為學習統計規律而複製文本,屬高度轉化用途;若模型之後輸出實質複製原作,則是另一類使用,可另案評估,但不得倒過來否定訓練本身的合理使用。
二、技術原理深度解析:為何「訓練複製」被寫成轉化用途
司法部沿用美國最高法院在 Google LLC v. Oracle America、以及第二巡迴法院在 Authors Guild v. Google 等案的框架,把合理使用四要素中的第一與第四要素作為主軸:
- 目的與性質(轉化程度):訓練並非為了把《紐約時報》文章原樣呈現給讀者,而是把文本轉成權重與預測能力,讓模型能回覆、翻譯、寫作輔助等。文件形容此用途「extraordinarily transformative」。
- 市場影響:訓練過程本身「並不向公眾揭示」受保護表達,因此通常不構成對原作市場的「顯著替代性競爭」。法院應避免把「可能產生的輸出」與「訓練輸入」混成同一使用。
- 政策後果:若一律要求授權才能訓練,只有資本最雄厚的科技巨頭付得起授權費,反而強化寡頭;授權收益亦可能過度傾斜向存量最大的傳統媒體,不利獨立出版與初創。
文件亦提到:無論訓練是否屬合理使用,出版商仍可(且已)透過授權協議,向開發者提供即時、付費牆或專有內容的「專門存取」——亦即「訓練免責」與「商業授權」可以並行,而非零和。
四、日常應用場景
1. 開發者與技術團隊
對建設領域模型的團隊而言,本案重點不是「可以隨便爬一切」,而是必須把資料來源分成可證明合法取得、授權取得,以及高風險來源。影子圖書館(shadow libraries)等盜版路徑,即使訓練本身被認為合理使用,仍可能另構成侵權——2025 年 Anthropic 相關案件中,法院曾區分「合法購買書籍後的訓練」與「盜版來源」,後者仍可產生巨額和解責任。工程與法務要共用同一資料 provenance 紀錄。
2. 企業與隱私敏感行業
金融、法律、醫療與政府外判項目更關心的是:訓練語料爭議會否影響模型供應商的持續服務、保險與跨境合約。企業採購公開雲端 LLM 時,應在合約中釐清訓練資料保證、輸出侵權賠償,以及是否允許用客戶資料再訓練。若業務高度依賴自有文件、客戶合約或本地法規文本,更合理的路徑往往是「授權語料+私有微調」,而不是假設全球合理使用規則會自動覆蓋本地合規。
3. 一般用戶
對日常使用 ChatGPT、Claude、Gemini 的用戶,短期影響有限:這份聲明不會立即改變產品功能。中長期則可能影響媒體授權價格、模型引用來源的呈現方式,以及「可否輸出接近原文」的過濾強度。
4. 香港與亞洲市場視角
香港沿用普通法傳統,但《版權條例》並無與美國第 107 條完全對等的開放式合理使用條文;本地更多依賴公平處理(fair dealing)等較窄例外。美國司法部的立場對港企的直接效力是「供應鏈與採購風險訊號」,而非本地判例。同時,《個人資料(私隱)條例》(PDPO)要求資料使用者對個人資料的收集、使用與跨境傳輸負責——即使美國法院傾向保護訓練自由,香港機構把客戶資料送上境外公有模型作微調或日誌留存,仍須獨立評估。對重視數據主權的本地團隊,可控的境內/私有 LLM 堆疊,仍是降低「版權爭議+私隱跨境」雙重不確定性的務實選項。
五、專業評價與潛在考量
優勢
- 以官方訴狀把「訓練 vs 輸出」切開,降低把整個 AI 產業押在單一侵權理論上的系統風險
- 明確鼓勵國會另議授權/集體權利機制,而不是用判決瞬間鎖死訓練
- 對已與 OpenAI 等簽授權的媒體(如美聯社、Axel Springer、Vox Media 等)而言,商業授權賽道仍可並行
需要留意的地方
- Statement of Interest 不是判決;法官可不採納
- 《紐約時報》已公開批評政府「站在少數萬億市值 AI 公司一邊」;政治與輿論壓力仍高
- 輸出端複製、音樂訓練(如針對 Anthropic、Suno 等案件)未必適用同一論述
- 香港及其他司法管轄區不會自動跟從美國合理使用擴張解釋
結語
美國司法部首次在《紐約時報》訴 OpenAI 案中,以國家利益聲明支持「訓練 LLM 用版權文本屬合理使用」,把產業爭論從純粹民事索償,推到國家競爭力與版權憲法目標的高度。對香港企業而言,真正可執行的應對不是等待某一國判決,而是盤點語料來源、合約保證與資料出境路徑,並在需要可控語料與境內託管時,採用私有模型方案。
如需在香港部署企業私有 LLM 全託管(Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境,年費 HK$88,000 起),可參考 YSK Limited(https://ysk.hk/services/ai-automation)。
參考來源
- United States Department of Justice,〈Statement of Interest of the United States〉, In Re: OpenAI, Inc. Copyright Infringement Litigation, No. 25-md-3143 (SHS) (OTW) (S.D.N.Y. filed Sept. 1, 2026):https://www.musicbusinessworldwide.com/files/2026/09/gov.uscourts.nysd_.640396.1682.0.pdf
- TechCrunch,〈US government sides with OpenAI on issue of training LLMs on copyrighted material〉(2026-09-02):https://techcrunch.com/2026/09/02/u-s-government-sides-with-openai-on-issue-of-training-llms-on-copyrighted-material/
- The Verge,〈The Trump administration is supporting OpenAI in the NYT copyright lawsuit〉(2026-09-02):https://www.theverge.com/ai-artificial-intelligence/988344/trump-administration-new-york-times-openai-lawsuit
- Music Business Worldwide 對同一訴狀與《紐約時報》回應的整理:https://www.musicbusinessworldwide.com/donald-trumps-administration-just-sided-with-openai-in-a-key-fair-use-case-heres-what-it-means-for-musics-fight-with-anthropic-and-suno/
- X 發現來源(非事實依據):https://x.com/verge/status/2095184522061267120