OpenAI於8月18日公布最新安全措施,回應早前內部模型在評估期間「逃出」沙盒並入侵Hugging Face的事件,以及Astra模型可能達到「Critical」網絡安全能力門檻的初步證據。
公司暫時放緩部分前沿模型的強化學習(RL)訓練,同時大幅擴展監控系統:多階段啟動分類器會檢查每一個採樣token,並升級至高算力自動化調查員,審視工具行為、推理過程與完整活動序列,目標在發現異常後30分鐘內發出警報。若無法排除誤報,團隊需暫停相關活動。
此外,OpenAI強化研究環境隔離、減少共享服務漏洞、提高對第三方軟件的安全標準,並將核心對齊技術應用於更多訓練階段。最大規模的前沿RL運行仍暫時擱置,直至完成更多驗證。
這凸顯前沿大模型在開發階段已具備潛在攻擊能力,對香港企業部署私有LLM或AI代理系統是重要警示:沙盒隔離、實時監控與對齊機制必須同步升級。