紐時解封訴狀:Microsoft 高管稱 AI 爬取「人類史上最大勞動盜竊」,點擊率暴跌九成

Key takeaway

重點摘要 TechCrunch 與 Ars Technica 於九月十七日報道,紐約時報等新聞機構對 OpenAI 與 Microsoft 的版權訴訟中,部分解封的簡易判決動議披露內部文件:Microsoft 應用科學總監 Brent Hecht 將大規模爬取新聞訓練描述為「人類史上最大勞動盜竊」;內部亦警告聊天機械人會令內容供應鏈陷入「末日循環」。報道指部分紐時域名在 Microsoft Copilot「答案引擎」下點擊率較傳統 Bing 搜尋下跌高達九成三。本文已對照兩家科技媒體對解封訴狀的交叉整理,來源真實性已驗證。對香港企業而言,這再次凸顯「把版權內容丟進公有雲模型」與「用授權/私有資料訓練」的治理落差。

紐時解封訴狀:Microsoft 高管稱 AI 爬取「人類史上最大勞動盜竊」,點擊率暴跌九成

重點摘要

TechCrunch 與 Ars Technica 於九月十七日報道,紐約時報等新聞機構對 OpenAI 與 Microsoft 的版權訴訟中,部分解封的簡易判決動議披露內部文件:Microsoft 應用科學總監 Brent Hecht 將大規模爬取新聞訓練描述為「人類史上最大勞動盜竊」;內部亦警告聊天機械人會令內容供應鏈陷入「末日循環」。報道指部分紐時域名在 Microsoft Copilot「答案引擎」下點擊率較傳統 Bing 搜尋下跌高達九成三。本文已對照兩家科技媒體對解封訴狀的交叉整理,來源真實性已驗證。對香港企業而言,這再次凸顯「把版權內容丟進公有雲模型」與「用授權/私有資料訓練」的治理落差。

紐約時報等新聞原告對 OpenAI 與 Microsoft 提起的著作權訴訟已進入第四年。2026 年 9 月 17 日,TechCrunch 與 Ars Technica 分別報道,原告簡易判決動議中一批先前被標為機密的內容解封,披露兩家公司內部如何評估「以新聞內容訓練商用生成式 AI」的法律與商業風險。本文已對照兩篇獨立報道所引述的訴狀摘要交叉核對,來源真實性已驗證;底層部分證物仍密封,引用均來自原告動議所披露之表述。

事件核心並非單一產品發表,而是訴訟證據層面的升級:內部文件與 sworn 證詞,與公開場合常強調的「合理使用/轉化性使用」敘事出現明顯張力。

一、核心事件:解封動議把「盜竊」與「末日循環」寫進公領域

技術細節

據 TechCrunch,動議引述 Microsoft 應用科學總監 Brent Hecht 在 2023 年 1 月內部備忘錄中,將新聞大規模被納入訓練資料稱為「規模空前的驚人盜竊」(an astonishing theft of unprecedented proportions),並形容為「人類史上最大勞動盜竊」(the largest theft of labor in human history)。Ars Technica 亦寫到,Hecht 在文件中指相關做法「徹底嘲弄了『合理使用』的概念」。

同一報道線指出,Microsoft 內部文件把 Copilot 類「答案引擎」對新聞流量的衝擊稱為「末日循環」(doom loop):產品愈能直接回答問題,用戶愈少點進原文;新聞機構收入受壓,長期又削弱模型所依賴的高質內容供應鏈。TechCrunch 引述 Microsoft 數據稱,部分紐時域名在 Copilot 答案引擎下的點擊率,較傳統 Bing 搜尋下跌高達 93%;Ars 則整理原告稱不同原告域名出現約 83%–93%、以至 51%–94% 不等的點擊率跌幅區間。

動議亦披露訓練資料規模細節(以原告訴狀摘要為準):OpenAI 中期訓練資料集中,紐時、Daily News 與 Center for Investigative Reporting 作品被複製逾 91,692 份;由 Common Crawl 衍生的資料集中,僅 nytimes.com 相關文件逾兩百萬份。Microsoft 與 OpenAI 之間另有名為 Project Taxi、Project Mango 等資料交換安排;訴狀指 Project Mango 訓練集包含至少 160,903 份新聞出版商獨特作品副本。

關於取得內容的手法,報道引述內部通訊:當 OpenAI 研究員向總裁 Greg Brockman 提到「繞過紐時付費牆的 hack」時,Brockman 回覆「ah nice」。訴狀亦指訓練前有意剝除版權聲明,以免模型向用戶輸出版權通知文字。

Microsoft CEO Satya Nadella 在本年稍早的宣誓證詞中表示,付費牆後的內容「任何想用於 grounding 或訓練的人都應取得授權」;若知悉 OpenAI 曾爬取並訓練於付費牆後資訊,他會行使權利要求 OpenAI 重新訓練模型。OpenAI ChatGPT 負責人 Nick Turley 則在內部通訊中寫道,出版商面對「生存威脅」,產品「大致是替代性的」,且會「愈來愈替代」。

Microsoft 發言人向 Ars 回應時強調:公司產品屬轉化性合理使用、不替代新聞網站;Nadella 證詞屬對資訊消費方式變化的「觀察」;Hecht 文件僅反映「一名員工的個人觀點」,「並非法學分析,亦不代表公司立場」。OpenAI 對 TechCrunch 採訪請求未有回覆;對 Ars 則未即時回應。紐約 Daily News 律師 Steven Lieberman 則指,這些文件顯示被告「一直知道自己在做的事是錯的」。

二、技術原理深度解析:訓練資料供應鏈 vs 合理使用四因子

生成式模型的「內容供應鏈」可粗分為三層:(1)大規模網路爬取/第三方資料集(如 Common Crawl);(2)搜尋索引或合作方提供的 grounding/retrieval 語料;(3)商用輸出層(聊天、答案引擎、摘要)。原告策略是把(1)(2)的複製規模,與(3)對新聞市場的替代效果連起來,挑戰合理使用中「對原作市場影響」與「使用性質」等因子。

「末日循環」本質上是系統回饋:答案引擎降低點擊 → 新聞產製投入下降 → 高質語料變少 → 模型與搜尋生態長期變差。Microsoft 內部文件據報道亦承認,終端產品威脅到「必要供應商的經濟基礎」並不尋常,卻正是當下 LLM 業務對內容供應鏈的處境。

對企業技術決策者而言,重點不在猜測法庭最終如何裁定「訓練是否合理使用」,而在於:若內部文件已承認替代性與流量衝擊,則依賴「未授權第三方內容餵公有雲模型」的產品路線,合規與聲譽風險正在上升。授權語料、企業自有數據、以及資料不出境的私有部署,成為可操作的風險對沖。

四、日常應用場景

1. 開發者與技術團隊

若產品以「摘要/問答直接給答案」取代連回原文,需預設版權與流量爭議會進入產品設計:來源標示、點擊誘因、授權範圍、以及訓練/RAG 語料清單(data provenance)都應可審計。避免把「能爬到」當成「能商用訓練」。

2. 企業與隱私敏感行業

金融、法律、醫療與傳媒集團若把內部文檔或客戶資料丟進公有雲助手,除私隱外,還可能捲入「訓練與輸出是否構成替代/侵權」的合約與監管問題。應區分:對外公開網頁的檢索,與把受保護作品納入權重訓練,是兩類不同風險。

3. 一般用戶

一般讀者看到的是「聊天機械人愈來愈會講新聞」;解封文件提醒,背後可能是出版業點擊與授權談判的結構性壓力。用戶仍應以原站核對重大新聞,而非只依賴模型複述。

4. 香港與亞洲市場視角

香港傳媒、金融研究與專業服務高度依賴原創內容與客戶機密。若企業要在港落地生成式 AI,較穩妥路徑是:自有/授權語料 → 微調或 RAG → 私有 API,並把資料留在可控環境。這與「直接把付費牆或內部庫丟進公有 frontier 模型」是相反的治理選擇。

五、專業評價與潛在考量

優勢

  • 解封內容把「盜竊/替代/末日循環」等內部語彙帶入公領域,有利業界討論授權與產品設計邊界。
  • TechCrunch 與 Ars 交叉報道,並附有 Microsoft 回應,讀者可同時看到原告引述與被告定性。
  • 對企業可轉化為具體治理清單:語料授權、點擊指標、輸出是否 verbatim。

需要留意的地方

  • 部分底層證物仍密封;公開引述主要來自原告動議整理,完整上下文有待庭審或進一步解封。
  • 美國「合理使用」判例近期對 AI 訓練並非單一方向;行政當局亦曾提交有利 OpenAI 的意見書(據 TechCrunch),最終法律結論仍待法院。
  • Microsoft 將 Hecht 表述定性為個人觀點;企業讀者應以己方法律意見為準,而非把單一內部備忘錄直接等同公司定論。

結語

這批解封文件的價值,在於把 AI 訓練爭議從口號拉回「資料怎麼來、產品怎麼替代原站、內部怎麼評估風險」。對香港企業而言,若希望用 AI 處理新聞、研報或客戶文件,又不想綁死在未授權公有雲訓練爭議上,可考慮以可控資料集做私有化部署。如需在香港建設企業私有 LLM 全託管(Dataset → QLoRA/LoRA → 私有 API,年費 HK$88,000 起,100% 數據不出境),可參考 YSK Limited 服務頁:https://ysk.hk/services/ai-automation


參考來源

  1. TechCrunch:Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal(https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/)(2026-09-17;主報道)
  2. Ars Technica:Microsoft exec called AI scraping the “largest theft of labor in human history”(https://arstechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/)(2026-09-17;含 Microsoft 回應與較完整動議整理)
  3. X 發現來源:TechCrunch(@TechCrunch)帖文指向上述報道(發現用;事實以 TechCrunch/Ars 對解封訴狀的報道為準)

Related services & products