衛報/FOI:牛津 Bodleian 准 OpenAI 用館藏訓練——內部文件指進訓練集,校方稱公版且會公開

重點摘要

《衛報》於二〇二六年九月二十六日報道,經資訊自由(FOI)取得的牛津大學內部會議紀錄顯示,博德利圖書館(Bodleian Libraries)與 OpenAI 的數碼化合作所產出的影像,已用於「填充 OpenAI 訓練集」;同日校方與 OpenAI 發言人均有回應。來源真實性已核對《衛報》報道、Bodleian 官方數碼化研究頁、二〇二五年三月合作公布,以及 OpenAI NextGenAI 對牛津項目的表述。本文整理事件脈絡、訓練數據與公版邊界,以及對香港企業資料授權與私有模型策略的含義。

衛報/FOI:牛津 Bodleian 准 OpenAI 用館藏訓練——內部文件指進訓練集,校方稱公版且會公開

《衛報》於二〇二六年九月二十六日報道,經資訊自由(FOI)取得的牛津大學內部會議紀錄顯示,博德利圖書館(Bodleian Libraries)與 OpenAI 的數碼化合作所產出的影像,已用於「填充 OpenAI 訓練集」;同日校方與 OpenAI 發言人均有回應。來源真實性已核對《衛報》報道、Bodleian 官方數碼化研究頁、二〇二五年三月合作公布,以及 OpenAI NextGenAI 對牛津項目的表述。本文整理事件脈絡、訓練數據與公版邊界,以及對香港企業資料授權與私有模型策略的含義。

牛津大學博德利圖書館與 OpenAI 的五年合作,早於二〇二五年三月公開:重點是把公版館藏數碼化、供師生與全球研究者檢索,並透過 NextGenAI 提供模型與研究資助。九月二十六日《衛報》依 FOI 取得的會議紀錄,把焦點從「數碼化開放」拉到「訓練數據」:內部文件寫明已數碼化材料用於填充 OpenAI 訓練集;校方則強調規模有限、僅限公版、非獨家授權,Bodleian 保留權利並將於數月內自行公開掃描結果。OpenAI 發言人表示自豪能讓當代模型「為未來保存世界歷史知識」。來源真實性已驗證。

一、核心事件:FOI 把「數碼化」與「訓練」擺上同一桌

技術細節

據《衛報》,牛津於二〇二五年三月公布與 OpenAI 合作時,強調以 OpenAI 軟件數碼化世界知名館藏、擴大學生與研究者取用;惟當日公開敘事並未以「模型訓練」為主軸。FOI 取得的會議紀錄則記載:材料已用於填充 OpenAI 訓練集;博德利管治委員會等成員亦曾討論與 OpenAI 合作的聲譽風險,以及能源密集技術對大學環境承諾的影響。

量級上,《衛報》引述至二〇二五年六月,已有約十二萬五千幅影像來自歷史學位論文掃描並交予 OpenAI,涵蓋十九至二十世紀歐美大學博士論文等;另提及約一萬份十六世紀「大幅單面民謠」(broadside ballads)等稀有文本。Bodleian 官方「Digitisation Research project」頁同步寫明:OpenAI 資助該試點(屬與牛津五年合作及 NextGenAI 高等教育聯盟之一環),Imaging Studio 已為 Global Dissertations 館藏捕獲約十二萬五千幅影像,並另掃描約四十二萬九千張卡片目錄檔。兩邊數字在「十二萬五千幅論文影像」上對得上,強化可核對性。

OpenAI 的 NextGenAI 介紹亦點名牛津:博德利圖書館正數碼化稀有文本,並以 OpenAI API 轉錄,使材料更可搜尋。換言之,官方與媒體鏈上同時存在「數碼化/轉錄/開放取用」與「訓練集填充」兩條敘事;今日新聞價值在於 FOI 把後者從內部文件推到公眾視野,並引出校內風險討論與雙方發言人回應。

二、技術原理深度解析

大型語言模型依賴海量文本學習語言分佈與知識表徵。隨着公開網頁日益充斥模型生成內容,開發者轉向較「乾淨」、較少線上重複的實體書與歷史館藏,以補足訓練分布。數碼化管線通常包括:高通量掃描、OCR/手寫辨識、元數據結構化,以及把可機器讀取的文本納入訓練或檢索增強(RAG)語料。

本案的關鍵技術—法律邊界不在「能不能掃」,而在「掃完之後誰有權用、用在哪一層」:

  1. 公版(public domain/out of copyright):牛津發言人強調現階段數碼化屬公版、規模「modest」,OpenAI 使用非獨家;Bodleian 保留自行公開掃描成果的權利。公版降低著作權侵權風險,但不自動消除聲譽、環境與「是否充分告知利益相關者」的治理爭議。
  2. 訓練權相對檢索權:同一批掃描可只做館內檢索與開放下載,也可同時進入預訓練/持續預訓練語料。FOI 文件所指「populate the OpenAI training set」,屬後者;OpenAI 公開表述則強調保存歷史知識與文化視角。企業採購或學術合作時,合約必須把「僅限 OCR/檢索」與「可用於模型權重訓練」分開寫清。
  3. 非破壞性流程對照:報道對比部分二手書收購後拆脊掃描再銷毀的做法;牛津強調館藏實體完好。對文化機構與企業檔案室而言,「可逆、可再公開、保留實體」往往是可接受合作的底線。
  4. 規模敘事:會議亦討論把約二千三百萬件館藏大規模數碼化,以及「Ask the Bod」聊天機械人等構想——屬前瞻討論,並非已全部執行。讀者應把「已交十二萬五千幅論文影像」與「全館二千三百萬件潛能」分開理解。

四、日常應用場景

1. 開發者與技術團隊

評估任何「圖書館/檔案 × 模型商」試點時,應要求書面區分:原始掃描保管方、OCR 產出授權、可否進入預訓練、可否用於微調、可否再授權給第三方、以及出錯內容下架流程。工程上,把「開放數位館藏 API」與「訓練語料投餵」做成不同資料管道與審計日誌,避免產品文案只講開放、合約卻默許訓練。

2. 企業與隱私敏感行業

香港律師樓、金融與醫療機構若考慮把內部檔案交給外部 AI 供應商「幫忙數碼化」,本案是提醒:數碼化敘事可以合法,但訓練權若未明示,日後模型行為與競品知識邊界可能難回溯。對受 NDA、客戶保密或跨境數據限制的材料,更應預設「默認不得進第三方權重」,改以私有部署、檢索增強或授權範圍極窄的微調。公版歷史文本的爭議已夠複雜;含個資或商業秘密的企業語料風險更高。

3. 一般用戶

ChatGPT 等產品若在回應中展現較冷僻的歷史細節,不代表某館「獨家喂養」該模型;公版與多方語料高度重疊。用戶應關注機構是否公開說明:哪些館藏已數碼化、何時開放下載、訓練用途是否披露。對仍受版權保護的近現代作品,切勿假設「已被某大學掃描=可自由重製」。

4. 香港與亞洲市場視角

亞洲大學、博物館與家族企業檔案室正加速「AI 可讀」轉型;香港作為普通法與國際出版/教育樞紐,類似 NextGenAI 式合作很可能出現在本地或大灣區機構。採購清單應包含:公版/授權狀態清冊、非獨家與再公開條款、能源與永續披露、以及聲譽風險委員會是否知情。對企業私有知識庫,更務實的路徑往往是把數據留在境內、自建或託管私有模型,而不是把核心語料一次性交給公有雲訓練管線。YSK Limited 的企業私有 LLM 全託管強調數據不出境、由香港團隊完成 Dataset 至私有 API,正對應此類「訓練權必須可控」的治理需求。

五、專業評價與潛在考量

優勢

  • 一級與官方材料可交叉核對:FOI 報道、Bodleian 研究頁(十二萬五千幅影像)、二〇二五年三月合作稿、OpenAI NextGenAI 牛津段落。
  • 雙方發言人立場清楚,利於讀者分辨「數碼化開放」與「訓練集使用」兩層事實。
  • 公版、非獨家、館方保留再公開權利,屬相對可審視的合作模板,而非完全黑箱收購銷毀。
  • 對企業與大學採購具直接方法論價值:如何寫訓練權條款。

需要留意的地方

  • FOI 會議紀錄全文未隨報道完整公開;「聲譽風險」等表述屬報道引述,細節深度取決於後續文件。
  • 「填充訓練集」不等於某本特定書可在產品中被逐字還原;亦不宜推論所有 ChatGPT 歷史知識都來自 Bodleian。
  • 全館二千三百萬件與「Ask the Bod」仍屬討論/潛能,不是已交付里程碑。
  • 公版訓練爭議與仍受版權保護作品、或摧毀實體書的做法,法律與倫理風險量級不同,不可混為一談。
  • 環境足跡與大學減碳承諾之間的張力,報道有記載,但未給出可獨立審計的能耗數字。

結語

《衛報》FOI 報道把牛津—OpenAI 合作從「數碼化開放館藏」推進到「訓練數據治理」的公共討論:同一條掃描流水線,可以只服務檢索,也可以同時寫進模型權重。對香港與亞洲機構而言,重點不是禁止與前沿實驗室合作,而是把授權範圍、再公開義務與聲譽/環境審查寫進可執行的合約與技術管道。若企業需要在香港部署可審計、數據不出境的私有模型與語料流程,可參考 YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation)。


參考來源

  1. Ethan Penny、Dan Milmo,《The Guardian》:Oxford lets OpenAI train its AI models on Bodleian Library(2026-09-26)https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt
  2. Bodleian Libraries:Bodleian Digitisation Research project(官方項目頁,含約 125,000 幅 Global Dissertations 影像與 OpenAI/NextGenAI 資助說明)https://www.bodleian.ox.ac.uk/services/research-partnerships/digitisation-project
  3. Bodleian Libraries/University of Oxford:Oxford and OpenAI launch collaboration to advance research and education(2025-03 合作公布)https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch
  4. OpenAI:Introducing NextGenAI(點名牛津 Bodleian 數碼化與 API 轉錄)https://openai.com/index/introducing-nextgenai/

延伸閱讀 · 相關服務與產品