Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

重點摘要

團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。

更關鍵一場實驗:較弱嘅 Claude Sonnet 5,用 60 小時試過 50 幾套方案,為尚未完成量產對齊訓練嘅 Opus 4.8 早期版本補安全。最終只用約 2,000 條由模板同公開數據組成嘅樣本,效率據稱較官方流程高約 15,000 倍,安全缺口縮小幅度接近正式版。

呢個意味住,AI 開始可以加速修 AI。好處係安全研究追得上模型迭代;風險係自我改進一旦失控,監督難度會同步上升。

延伸閱讀 · 相關服務與產品