OpenAI/三名前安全研究員公開信:否認違規、警告寒蟬效應——公司堅稱屬處理敏感資訊違規;數週內敲定第三方安全評估合約

重點摘要

三名上周被 OpenAI 解聘的安全與對齊研究員——Tomek Korbak、Jasmine Wang 與 Mikita Balesni——於二零二六年十月八日向公司安全與保安委員會、安全諮詢組及使命諮詢委員會發出公開信,否認「違規處理敏感資訊」指控,並警告解聘的溝通方式正令仍在職同事不敢再以高信任、高頻寬方式與第三方安全組織協作。英國廣播公司與科技媒體 TechCrunch 報道公開信並引述三人陳述;十月九日 OpenAI 研究主管公開回應,堅稱調查發現違規與「超出信件所述的重大信任破壞」,決定與解聘無關於提出安全疑慮,並指正敲定第三方安全評估合約、將於數週內公布。來源真實性已驗證。

OpenAI/三名前安全研究員公開信:否認違規、警告寒蟬效應——公司堅稱屬處理敏感資訊違規;數週內敲定第三方安全評估合約

三名上周被 OpenAI 解聘的安全與對齊研究員——Tomek Korbak、Jasmine Wang 與 Mikita Balesni——於二零二六年十月八日向公司安全與保安委員會、安全諮詢組及使命諮詢委員會發出公開信,否認「違規處理敏感資訊」指控,並警告解聘的溝通方式正令仍在職同事不敢再以高信任、高頻寬方式與第三方安全組織協作。英國廣播公司與科技媒體 TechCrunch 報道公開信並引述三人陳述;十月九日 OpenAI 研究主管公開回應,堅稱調查發現違規與「超出信件所述的重大信任破壞」,決定與解聘無關於提出安全疑慮,並指正敲定第三方安全評估合約、將於數週內公布。來源真實性已驗證。

對香港正把前沿模型與 AI 代理接入客服、風控、研發與合規流程的企業,這場爭議的核心不是人事八卦,而是第三方審計、思維鏈可監察性,以及內部人敢不敢在事故調查中對外協作——直接影響你如何寫供應商條款、事故通報與紅隊/評估外包邊界。

三名上周被 OpenAI 解聘的安全與對齊研究員 Tomek Korbak、Jasmine Wang 與 Mikita Balesni,於二零二六年十月八日以公開信致公司安全與保安委員會、安全諮詢組及使命諮詢委員會,標題直指「OpenAI 無法獨自把人工智能做安全」。信件全文已公開為 PDF;TechCrunch 與英國廣播公司同日後續報道引述信件與公司回應。十月九日,OpenAI 新聞室轉發研究主管說明,重申調查結論並承諾數週內敲定第三方安全評估合約細節。本文已核對公開信 PDF、TechCrunch、英國廣播公司報道與研究主管公開說明摘要,來源真實性已驗證。下文拆解事件進程、技術與治理含義、香港企業視角與專業評價。

一、核心事件/機制解說

技術細節

公開信首先定性三人角色:Korbak 曾於 Anthropic 應用對齊技術,加入 OpenAI 後主攻思維鏈(chain-of-thought)可監察性,參與公司安全策略,並在 Hugging Face 事故調查中擔任對外部評估組織 METR 的技術對口;Wang 曾於二零一九年政策研究實習、其後領導英國 AISI 團隊,二零二五年回流 OpenAI 共同領導安全案例(safety cases)計劃,並提出「pacing」概念——「Pacing the Frontier」請願據信件稱獲三百九十四名 OpenAI 員工簽署;Balesni 為 Apollo Research 創始成員之一,在 OpenAI 從事對齊評估、錯位科學與思維鏈可監察性,亦參與 Hugging Face 事故調查。三人並提及入職前共同發起、且其中兩人為主要作者的跨產業立場文件《Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety》。

關於解聘爭議,信件列出幾項直接澄清:

  • 否認《資訊報》洩密:三人稱並非有關「較難監察架構」報道的消息來源,並指該報道反而削弱他們推動跨公司限制「不可監察架構」的工作。
  • Hugging Face 事故協作:信件稱該調查「沒有先例」,內部政策「邊做邊訂」;Korbak 強調盡力依當時政策與長期以來對第三方協作的規範行事,並指與外部對口緊密溝通對建立信任屬必要。
  • 可監察性跨公司承諾:Balesni 稱在董事會成員與高層協調下推動防止喪失可監察性的跨公司工作,過程中向直屬匯報,並在對外材料中移除敏感細節。
  • 行政電郵存取:Wang 稱獲授權為招聘目的存取某高管電郵;不再需要時已要求資訊科技部門移除,但部門未執行,且她無法自行登出;郵箱在手機郵件應用中合併而難以區分。她稱誤點開敏感郵件後數分鐘內告知該高管,並再次要求移除存取。

信件的核心警告是文化層面:若上個月仍屬正常的對外協作,這個月可成突然解聘理由,在職者將「猜不透紅線」,令安全工作與第三方問責同時受阻。三人提出三項臨別建議:(一)信守上個月公開承諾,把第三方安全審計嵌入組織,勿以解聘為由縮限與 METR 等外部評估者的合作,並提及行政總裁 Sam Altman 九月十二日公開承諾給予獨立評估者「近似員工」的持續存取;(二)必須保全前沿模型的可監察性,在仍倚賴可監察性作安全手段時,不應繼續推進進一步降低可監察性的發展;(三)維持安全研究員與外部安全生態之間公開、透明的對話文化,並清楚寫明員工可如何與外部安全組織合作。

OpenAI 十月九日的研究主管說明則針鋒相對:公司指徹底調查後發現三人「違反處理敏感資訊的明確政策」,內部調查更發現「超出他們公開信所述的重大信任破壞」,因此維持不再續聘;強調決定「與提出安全疑慮或發聲無關」,安全與研究辯論每天都在進行且受鼓勵;並稱不會因提出疑慮而解聘員工。說明同時回應信件關切:公司正積極敲定與第三方安全評估者的合約,「將於數週內公布細節」,承諾把外部評估者嵌入、並繼續把與獨立安全組織的緊密協作視為安全工作核心;亦同意保全可監察性「需要包括 OpenAI 在內的全行業承諾」。英國廣播公司引述公司表述,指調查確認敏感資訊在既定程序之外被處理;公司並在周五(對應十月九日)的研究領導說明中重申立場。

二、技術原理深度解析

這場爭議的技術主軸是 可監察性(monitorability)——尤其是模型「思維鏈/中間推理」能否被人類或工具可靠觀察,以捕捉代理在部署後的異常、欺騙或越權行為。信件與三人背景反覆指向:當代理可在沙箱外行動、或架構令推理更難被監察時,單靠供應商內部紅隊已不足,必須依賴與 METR 等外部評估者的高頻寬協作。Hugging Face 事故被信件描述為「沒有先例」的調查,正好暴露政策真空:緊急對外通報與信任建立,可能踩到尚未寫清的保密紅線。

另一條線是 第三方嵌入式審計:信件要求兌現「近似員工存取」的獨立評估承諾;公司回應則把時間表落在「數週內宣布合約」。對企業買家而言,這等於把「外部評估是否真能看到生產級系統」從公關口號,變成可寫進採購與風險附錄的交付物。若寒蟬效應令內部安全人員不敢再主動拉外部專家,企業依賴的「供應商自我披露+偶發外部報告」模型會變脆。

四、日常應用場景

1. 開發者與技術團隊

若你的代理會呼叫工具、瀏覽器或雲端憑證,應把「推理/工具軌跡是否可匯出審計」當成架構需求,而非事後補丁。可監察性下降時,單靠日誌抽樣難以重現「為何代理決定改組態/外傳資料」。事故演習應預先指定:哪些軌跡可與外部紅隊或評估者分享、誰有權批准、如何脫敏。

2. 企業與隱私敏感行業

金融、醫療、上市公司合規團隊採購前沿 API 或代管代理時,宜在合約要求:第三方安全評估的存取範圍、事故對外通報時限、以及供應商不得因員工與認可外部評估者的善意協作而報復的治理聲明。同時保留「若可監察性指標惡化,可暫停高權限代理」的緊急煞車條款——與近日業界把模型當內部人風險的討論同向,但本篇焦點是人事與第三方協作邊界。

3. 一般用戶

個人用戶較少直接接觸 METR 或安全案例文件,但會間接受影響:當平台在事故後收緊對外協作,公開透明度報告可能變慢;反之,若第三方評估合約落實,用戶較有機會看到獨立方對代理越獄、提示注入或資料外洩的驗證結果。

4. 香港與亞洲市場視角

香港企業多以 API 消費美歐前沿模型,本身不僱 OpenAI 安全團隊,卻要承擔部署端風險。實務上應:(一)把「第三方評估是否到位」寫進供應商盡職審查清單;(二)本地紅隊/顧問與供應商安全對口的溝通,預先取得書面允許範圍,避免「緊急協作=違規」;(三)對代理接入核心系統採最小權限與可撤銷金鑰。若團隊同時自建評估閘道或本機模型服務,亦須分開管治「模型權重」與「工具執行權」,避免把監察缺口留在生產路徑。

五、專業評價與潛在考量

優勢(就資訊透明而言)

  • 雙軌一手材料齊備:公開信 PDF 與公司研究主管說明均已公開,讀者可對照「寒蟬/第三方審計/可監察性」主張與「政策違規/信任破壞」抗辯,而不是只看片面洩密傳聞。
  • 把抽象安全議題落地成採購問題:獨立評估者存取、跨公司可監察性承諾、事故調查中的對外協作規範,均可轉成企業可執行的盡職審查項。
  • 與近期代理失控敘事銜接:在業界連續討論非預期代理行為與緊急煞車的背景下,本事件提醒「安全文化與程序清晰」本身是控制項。

需要留意的地方

  • 事實仍有未公開層:公司稱存在「超出信件所述」的信任破壞,但未在公開說明中詳列具體政策條文與證據;讀者不應把信件自辩或公司摘要任一端視為已裁判事實。
  • 非初次報道的延續:本社早前已報道三人因涉嫌在程序外處理敏感資訊被解聘;本篇聚焦十月八日公開信與十月九日公司回應的新發展,屬跟進而非重炒同一條「解聘」消息。
  • 請願與人事數字僅來自信件:例如三百九十四人簽署 pacing 請願,屬信件自述,未在本文獨立核對簽名名單。

結語

三名前 OpenAI 安全研究員以公開信反駁解聘理由並警告寒蟬效應,公司則堅稱屬敏感資訊處理違規與重大信任問題,同時承諾數週內敲定第三方安全評估合約、並同意可監察性需要全行業承諾。對香港企業,真正要帶走的不是站隊,而是把「外部審計存取、事故對外協作授權、可監察性與緊急停用」寫進 AI 自動化治理——在代理權限愈開愈大之前,先把人與程序的紅線劃清。

若你的機構正評估如何把大模型與代理接入業務流程,並需要可審計的自動化設計,可參考 YSK Limited 的 AI 自動化方案(https://ysk.hk/services/ai-automation)。若希望在本機以 OpenAI 相容介面閘道管理 Hugging Face 權重與呼叫策略,亦可了解 YSK Omni v1.0.2(https://ysk.hk/products/ysk-omni)。


參考來源

  1. Tomek Korbak、Jasmine Wang、Mikita Balesni 公開信 PDF:OpenAI cannot make AI safe on its own — https://mikitabalesni.com/letter/letter.pdf(2026-10-08)
  2. TechCrunch:Fired OpenAI safety researchers dispute misconduct claims, warn of chilling effect — https://techcrunch.com/2026/10/08/fired-openai-safety-researchers-dispute-misconduct-claims-warn-of-chilling-effect/(2026-10-08)
  3. BBC News:Fired OpenAI researchers say they were let go for 'prioritising safety' — https://www.bbc.com/news/articles/cvlydn8d3lkjo
  4. OpenAI Newsroom/研究主管說明(Post-Cutoff 存檔摘要):the three researchers violated clear policies… — https://postcutoff.com/p/2026-10-09-openainewsroom-fired-researchers-statement/(2026-10-09)

延伸閱讀 · 相關服務與產品