The Information:OpenAI 與 Anthropic 擬簽具約束力互測協議——互測對方商用模型安全漏洞,約定不留存測試數據

重點摘要

The Information 於二零二六年九月二十一日獨家報道,OpenAI 與 Anthropic 一度接近達成具法律約束力的互測協議:雙方可經 API 壓測對方已公開商用模型的安全漏洞與異常行為,並約定不留存測試期間取得的數據。Mint、Gate News 等轉述同一報道;本文並對照 OpenAI 與 Anthropic 於二零二五年八月二十七日公開的聯合評測結果頁。來源真實性已驗證。重點在於:這是「接近達成」的磋商訊號,並非已簽署生效的正式條約,卻把二零二五年一次性試點,推向可持續的跨實驗室壓測框架。

The Information:OpenAI 與 Anthropic 擬簽具約束力互測協議——互測對方商用模型安全漏洞,約定不留存測試數據

The Information 於二零二六年九月二十一日獨家報道,OpenAI 與 Anthropic 一度接近達成具法律約束力的互測協議:雙方可經 API 壓測對方已公開商用模型的安全漏洞與異常行為,並約定不留存測試期間取得的數據。Mint、Gate News 等轉述同一報道;本文並對照 OpenAI 與 Anthropic 於二零二五年八月二十七日公開的聯合評測結果頁。來源真實性已驗證。重點在於:這是「接近達成」的磋商訊號,並非已簽署生效的正式條約,卻把二零二五年一次性試點,推向可持續的跨實驗室壓測框架。

The Information:OpenAI 與 Anthropic 擬簽具約束力互測協議——互測對方商用模型安全漏洞,約定不留存測試數據

前沿 AI 實驗室談「放慢」與「互相盯梢」的同一週,安全評測本身也在升級。二零二六年九月二十一日,The Information 獨家指 OpenAI 與 Anthropic 已接近敲定一份具法律約束力的安排:彼此開放商用模型 API,專門用來找出安全漏洞、隱藏風險與非常規行為,並承諾不留存測試所得數據。Mint 當日轉述同一報道,Gate News 亦摘要關鍵條款。本文另核對 OpenAI 官方頁「Findings from a pilot Anthropic–OpenAI alignment evaluation exercise」與 Anthropic Alignment 科學部落格同日發布的試點發現,以釐清「今日磋商」與「二零二五年夏日試點」的關係。來源真實性已驗證。下文拆解事件機制、技術含義、應用場景與香港視角,並說明為何企業不應把「互測協議」誤讀成「模型已絕對安全」。

一、核心事件:從一次性試點到具約束力的互測框架

技術細節

按 The Information 報道與多家轉述,磋商中的安排有三個可核實特徵。第一,標的是雙方「已公開商用」的模型,而不是只測內部未發布實驗版;第二,取用方式是 API 介面,以便用自家內部安全/對齊評測工具去壓對方系統;第三,關鍵條件是測試過程取得的數據不得留存,降低把對手提示詞、系統指令或用戶樣式當成訓練素材的疑慮。

The Information 在 X 上的獨家摘要進一步指出:相關談判發生在一連串 AI 相關安全事件之後,OpenAI 內部對風險的焦慮升高。報道用語是「neared」(接近達成),Mint 則寫成「are negotiating」(正在磋商)。讀者宜同時記住兩點:雙方確有具體條款在談;但在官方聯合公告出現前,仍屬未完成的商業/法律磋商,而非已生效合約。

這股互測構想並非憑空出現。二零二五年六月至七月,OpenAI 與 Anthropic 已做過「首次同類」的聯合評測:各自用內部安全與錯位(misalignment)評測,去測對方當時公開釋出的模型,並於二零二五年八月二十七日公開結果。OpenAI 官方說明,此舉旨在補自家盲點、加深對錯位風險的理解,並示範實驗室之間可如何在安全議題上協作。Anthropic 同日發布的發現報告亦指,雙方在模擬測試環境中都見到值得關注的行為,但沒有任何受測模型呈現「極端錯位」;報告同時強調,結果反映的是模型本身經 API 的行為,不等同 ChatGPT 或 Claude 產品在完整產品層防護下的表現。

今日磋商若落地,差異會在「頻率、標的與法律約束」:試點是一次性、公開結果導向;擬議協議則把互測寫成可持續的權利義務,並明確鎖定商用模型與不留存數據。

二、技術原理深度解析

跨實驗室互測,本質上是把「紅隊/對齊評測」從單邊自查,升級成對手方評測。技術上通常包含幾層:

  1. 評測目標:越獄與濫用協助、逢迎(sycophancy)、幻覺、情境意識、指令層級衝突、自我保存/欺瞞傾向、代理式破壞能力等。Anthropic 試點公開涵蓋逢迎、舉報/洩漏、自我保存、協助人類濫用,以及破壞安全評測與監督的能力面向;OpenAI 試點則公開涵蓋指令層級、越獄(含 StrongREJECT)、幻覺、計謀(scheming)等軸線。
  2. 介面與範圍:以公開開發者 API 為主,方便對方把自家評測腳本、多輪代理評測器接到目標模型。試點期間雙方還曾放寬部分會干擾評測完成的 API 外層安全過濾,以便觀察模型本身傾向——這也意味著「評測分數」不能直接等同「產品預設體驗」。
  3. 數據邊界:擬議的「不留存」條款,針對的是互測期間接觸到的提示、中間狀態與輸出日誌。對企業採購而言,這類條款的價值在於降低「安全合作」變成「對手情報收集」的疑慮;但條款如何稽核、例外如何定義,仍待正式文本。
  4. 為何單邊自查不夠:內部紅隊熟悉自家系統提示、工具腳手架與拒絕策略,容易低估「別人用不同工具鏈」時冒出的失敗模式。對手評測引入不同評測設計自由度,理論上可暴露方法論盲點;但也引入新風險——評測設計差異、腳手架不相容、以及把模擬極端情境過度外推到真實部署。

另一條並行討論,是獨立第三方評測員取得「近似員工級」存取權。Anthropic 執行長 Dario Amodei 近期呼籲更強護欄與外部監督;OpenAI 執行長 Sam Altman 其後亦表態願意對齊讓獨立評測者深入系統的方向。擬議的 OpenAI–Anthropic 互測,與「第三方員工級存取」路徑不同:前者是對手實驗室互測商用 API;後者是外部監督者進場。兩者可互補,但都不能替代合規、產品層防護與企業端的私有部署控制。

三、代幣經濟學/協議層影響

本案屬前沿實驗室安全治理與商業契約談判,並非代幣發行或鏈上協議升級,故不套用代幣供應節奏分析。較相關的市場結構觀察是:若互測成為常態,企業採購時可能開始要求供應商披露「是否接受對手/第三方壓測」與數據留存條款;安全評測本身也可能進一步產品化(基準、審計代理、紅隊即服務),但目前仍以報道與官方試點為準,不宜臆測具體營收數字。

四、日常應用場景

1. 開發者與技術團隊

把模型接進代理、工具呼叫與長工作流時,應假設「官方排行榜分數」與「你的腳手架下的行為」會有落差。試點已顯示:工具呼叫格式、是否保留推理文本、系統提示權限等,都會改變評測結果。團隊宜自建回歸紅隊(越獄、資料外洩、越權工具呼叫),並把互測/第三方評測報告當成輸入,而不是唯一驗收標準。

2. 企業與隱私敏感行業

金融、法律、醫療與受 NDA 約束的企業,更應關注三件事:模型與日誌資料是否出境、評測與生產是否隔離、以及供應商能否接受可稽核的安全條款。OpenAI/Anthropic 互測若落地,傳遞的訊號是「頭部實驗室也承認單邊自查不夠」;企業端對應動作是把評測權留在可控環境——例如私有部署、客戶資料不出境、以及對工具呼叫做允許清單。

3. 一般用戶

一般消費者不應把「兩大實驗室互測」解讀成「聊天機械人已不會犯錯」。試點環境刻意模擬極端誘因,且部分測試關閉了產品層過濾;日常產品體驗仍取決於完整防護鏈。遇到聲稱「已通過 OpenAI/Anthropic 互測認證」的第三方 App,應查證是否有可核實來源,避免被營銷話術誤導。

4. 香港與亞洲市場視角

香港企業採購生成式 AI,同時面對跨境數據、行業保密與金管局/證監會等對科技風險管治的期望。互測協議若成為行業慣例,本地顧問與系統整合商或需協助客戶解讀「對手評測報告」與「產品層 SLA」的差異。對必須把客戶資料留在本地的機構,私有 LLM 與可稽核的評測流水線,往往比單純追蹤美國實驗室外交更能落地。亞洲市場亦同時關注 DeepSeek 等業者的算力與評測策略;但那是另一條供應鏈故事,不宜與本案混為「同一協議」。

五、專業評價與潛在考量

優勢

  • 把二零二五年已公開的跨實驗室試點,升級為可持續、具法律約束討論的互測,方向符合「用對手方法找盲點」。
  • 「不留存測試數據」若寫進合約,有助降低安全合作的情報外溢疑慮。
  • OpenAI 與 Anthropic 雙方皆有可核對的官方試點頁,讀者可分開驗證「歷史試點」與「今日磋商」。

需要留意的地方

  • 報道是「接近達成/磋商中」,不是已簽署、已生效;在聯合公告前,條款細節仍可能改變或破局。
  • 對手互測可能引發競爭法與「頭部實驗室互相制定標準」的監管關注(Mint 亦提到此風險)。
  • 評測分數高度依賴腳手架與情境設計;企業若直接把實驗室互測結果當採購唯一依據,容易誤判。

結語

九月二十一日這則 The Information 獨家的價值,不在於宣告「AI 已進入永久安全」,而在於確認:即使是最有資源做內部紅隊的兩家實驗室,也認為需要用法律約束把「互測對方商用模型」常態化,並用「不留存」處理數據邊界。對香港企業而言,更務實的下一步仍是:把關鍵工作負載放進可稽核、資料可駐留的環境,並自建與業務場景對齊的評測,而不是等待一紙實驗室協議替你完成風險管理。

如需在香港部署資料不出境、可對接既有系統的企業私有 LLM(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API),可參考 YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation)。


參考來源

  1. Mint(轉述 The Information):OpenAI, Anthropic negotiate landmark deal to stress-test each other’s AI models for safety risks(2026-09-21)— https://www.livemint.com/ai/openai-anthropic-negotiate-landmark-deal-to-stress-test-each-other-s-ai-models-for-safety-risks-11790001384308.html
  2. OpenAI 官方:Findings from a pilot Anthropic–OpenAI alignment evaluation exercise(2025-08-27)— https://openai.com/index/openai-anthropic-safety-evaluation/
  3. Anthropic Alignment:Findings from a Pilot Anthropic—OpenAI Alignment Evaluation Exercise(2025-08-27)— https://alignment.anthropic.com/2025/openai-findings/
  4. Gate News(轉述 The Information 摘要,2026-09-21)— https://www.gate.com/news/detail/openai-and-anthropic-in-talks-to-conduct-mutual-ai-model-stress-tests-on-24451702
  5. X 發現(discovery only):The Information — https://x.com/theinformation/status/2102047727655723485

延伸閱讀 · 相關服務與產品