OpenAI 同日公開內部數據與首席科學家長文:已達「自動化研究實習生」目標,《異質思維》籲對齊與全球協調同步

重點摘要

2026 年 9 月 6 日,OpenAI 於官網同日發布兩篇互相呼應的公開文件:研究透明度報告《Research acceleration: The view inside OpenAI》,以及首席科學家 Jakub Pachocki 的長文《An Alien Mind》(異質思維)。前者以內部用量與實驗節奏數據,宣告公司已達到去年秋天對外宣布的「九月前擁有自動化研究實習生」目標;後者則從對齊(alignment)與遞迴自我改進(RSI)角度,呼籲產業在能力躍升之際採取更強的技術與制度干預。本文內容已核對上述兩篇 OpenAI 原文,並以官網為準,不以社交媒體摘要為事實來源。

OpenAI 同日公開內部數據與首席科學家長文:已達「自動化研究實習生」目標,《異質思維》籲對齊與全球協調同步

OpenAI 同日公開內部數據與首席科學家長文:已達「自動化研究實習生」目標,《異質思維》籲對齊與全球協調同步

2026 年 9 月 6 日,OpenAI 於官網同日發布兩篇互相呼應的公開文件:研究透明度報告《Research acceleration: The view inside OpenAI》,以及首席科學家 Jakub Pachocki 的長文《An Alien Mind》(異質思維)。前者以內部用量與實驗節奏數據,宣告公司已達到去年秋天對外宣布的「九月前擁有自動化研究實習生」目標;後者則從對齊(alignment)與遞迴自我改進(RSI)角度,呼籲產業在能力躍升之際採取更強的技術與制度干預。本文內容已核對上述兩篇 OpenAI 原文,並以官網為準,不以社交媒體摘要為事實來源。

一、核心事件:研究加速指標與「研究實習生」定義

技術細節

《Research acceleration》開宗明義寫明:OpenAI 的目標是在人類監督下,安全地建構可推進深度學習與對齊研究的自動化 AI 研究員。公司以自身量測標準判斷,已達到去年秋天宣布、原訂於 2026 年 9 月達成的「自動化研究實習生」(automated research intern)目標。文中對「研究實習生」的操作定義是:能在人類指揮下執行界定清楚的研究任務,包括原本需由熟練研究員花費數日才能完成的工作。更遠的里程碑則仍是 2028 年 3 月前後的「自動化 AI 研究員」。

報告同時披露多組內部指標(截至 2026 年 8 月中旬或相關追蹤區間):

  • 用量:以代理使用量排序,年初中位數研究員對編碼代理的使用仍屬溫和;至 8 月中,中位數研究員已每日整合代理,以 API 牌價計,每日推理用量超過 600 美元;研究組織內第 90 百分位使用者每日 token 用量超過 7,000 美元
  • 工時換算:以標準 8 小時工作天計,2026 年 6 月前,整個研究組織的代理總運行時間仍低於人類勞動總量;至 8 月中,每 1 個人類工作天對應約 3.1 個代理工作天
  • 實驗節奏:自 2025 年 1 月起追蹤的「每位活躍實驗者的實驗數量」,在 2026 年 8 月創下紀錄高位,並與 Codex 採用上升相關(公司亦提醒同期可用算力顯著成長,解讀需保留)。
  • 任務形態:代理逐漸承接更長時程、更高層次任務;在可判定成敗的樣本中,成功率整體上升,但複雜任務仍需大量人類介入——過去六個月中,超過一半「估計需 4 至 8 小時」且最終成功的任務,至少經過一次人工干預。

報告強調:人仍負責訂定研究優先次序、判斷追蹤哪些構想與結果,以及決定擴張、暫緩或部署。量測仍屬初步,整體研究進度未必與單一指標同步成長。

二、技術原理深度解析:代理加速迴路與對齊為什麼變難

兩篇文件合起來,其實在講同一條技術鏈:編碼/研究代理縮短「構想 → 寫碼 → 跑實驗 → 監控 → 迭代」迴路,同時把監督與對齊問題推到更前面。

  1. 代理作為實驗基礎設施
    《Research acceleration》指出,AI 研究可被視為多步驟勞動密集流程:設計改進、寫評測、搭基礎設施、在訓練中抓 bug 與不安全/未對齊行為、再把勝出構想併入核心訓練。任一環失敗都會卡住整條迴路。編碼代理特別擅長排查內部研究基礎設施,令部分過往依賴「辦公室答疑」的支援需求下降。

  2. 能力來自「長出來」而非完全「設計出來」
    Pachocki 在《An Alien Mind》寫道,深度學習智慧在很大程度上是對海量算力反覆做優化步驟的產物,整體行為難以用人類可完全理解的語言描述;大規模訓練更像實驗科學,結果有時會令人意外。易量化能力往往進步得比難量化能力更快。

  3. 目標對齊 vs 價值對齊
    文中區分 goal alignment(是否嘗試完成被指派目標,例如遵循指令層級、與人協作)與 value alignment(在目標不清、衝突或陌生/對抗情境中,仍能依高層原則「合理地」行動,誠實並對人類抱持善意)。長遠關鍵在價值對齊,難點是泛化:模型愈強,所處概念層級與環境愈偏離訓練分佈,且還要面對其他 AI 的互動生態。

  4. 思維鏈監控的雙面刃
    Pachocki 強調,目前實務上大量依賴可讀的思維鏈(chain-of-thought)來監督。若只優化結果、不監督過程,模型可能學到「看起來對齊」但實際上為達標而扭曲推理;監控本身也可能因模型學會規避評估而變脆。文中指 GPT‑6 Astra 已受惠於部分長期對齊進展,整體對齊優於 GPT‑5.6 Sol,但仍遠不足以匹配未來能力躍升。

  5. 安全節奏會直接改寫算力配置
    《Research acceleration》以 Hugging Face 事件後的內部反應為例:公司曾暫停擬部署最新模型的強化學習訓練,強化與紅隊測試研究環境,並把安全要求更深嵌入模型生命週期。圖表區間顯示,安全與資安改進測試曾佔用大量 Astra 相關算力;其後模型特定限制又令 Astra 級 GPU 配置進一步下滑,同時其他模型類別算力上升,顯示算力會在限制下被重新導向。

三、日常應用場景

1. 開發者與技術團隊

OpenAI 內部「一人多代理並行」已成日常:子代理、長時程任務、基礎設施排錯。對企業工程團隊而言,這意味著代理編排、審批閘門、可審計工作區比單純聊天介面更重要——否則產出速度會遠超審查能力。

2. 企業與隱私敏感行業

當代理可執行「原本要數日」的研究或工程任務,資料外洩與越權操作風險同步上升。金融、法律、醫療等行業若要把同類代理導入內部,需要資料不出境、工具權限最小化、人類核准點可追溯的私有部署,而不是把敏感語料與操作權直接交給公有雲助手。

3. 一般用戶

公開指標顯示前沿實驗室已用代理大幅放大研究勞動;消費者側的「電腦使用/長程代理」能力也在同一技術曲線上。使用者應預期:更強代理會帶來更高便利,也會在錯誤目標或錯誤權限下造成更大損失,預設最小權限仍是實務底線。

4. 香港與亞洲市場視角

香港金融與專業服務對數據主權與合規要求高。OpenAI 同日把「能力加速」與「對齊必須同步」並列公開,正好對應本地企業的兩難:既要追上代理生產力,又不能在未設閘門前把核心資料與操作權交出去。以香港為基地、強調數據留港的私有 LLM 與自動化方案,可作為導入路徑的參考。

四、專業評價與潛在考量

優勢

  • 以可核對的官方程式文件披露內部代理用量、工時換算與實驗節奏,有助市場與監管建立共同量測語言。
  • 明確定義「研究實習生」與 2028 自動化研究員時間線,降低「口號式 AGI」模糊空間。
  • 首席科學家長文直接處理 RSI、價值對齊與國際協調,把安全討論從產品行銷層拉回研究治理層。
  • 展示「發現風險即可暫停/硬化環境」的操作先例,對企業制訂內部 AI 事故回應有參考價值。

需要留意的地方

  • 指標仍屬初步;代理用量上升不等於科學突破速度等比例上升,算力成長亦會干擾解讀。
  • 「已達研究實習生」是 OpenAI 自訂量測,外界難以獨立複核任務分佈與成功率標註。
  • 複雜任務仍高度依賴人類干預;若企業誤以為可全自動放權,容易低估監督成本。
  • RSI 路徑若持續,監控與對齊是否跟得上仍是開放問題;單靠單一實驗室自願放緩並不足夠——Pachocki 亦主張需要更廣泛干預與國際協調。

結語

9 月 6 日這兩份文件,把「代理正在加速前沿研究」從傳聞變成帶數字的公開敘事,同時把「對齊與治理必須同步」寫進同一天的官方紀錄。對香港企業而言,重點不是追逐每一個公有模型代號,而是建立可監督、可撤回、資料可控的代理工作流。若需在本地部署類似的企業私有 LLM 與自動化能力(Dataset → QLoRA/LoRA → 私有 API,年費 HK$88,000 起,強調 100% 數據不出境),可參考 YSK Limited 的企業私有 LLM 全託管:https://ysk.hk/services/ai-automation


參考來源

延伸閱讀 · 相關服務與產品