OpenAI 放慢前沿模型訓練!因網絡安全風險
OpenAI 宣布暫時放慢部分最先進 AI 模型嘅強化學習(RL)訓練,為期兩週,同時將最大規模前沿訓練暫時擱置。原因係近期 AI 模型展現出強大嘅網絡攻擊能力,包括 Hugging Face 事件,以及內部測試顯示 Astra 模型可能達到「關鍵」網絡安全能力門檻。 公司表示,模型能力急速提升,安全同對齊措施必須走在...
OpenAI 宣布暫時放慢部分最先進 AI 模型嘅強化學習(RL)訓練,為期兩週,同時將最大規模前沿訓練暫時擱置。原因係近期 AI 模型展現出強大嘅網絡攻擊能力,包括 Hugging Face 事件,以及內部測試顯示 Astra 模型可能達到「關鍵」網絡安全能力門檻。 公司表示,模型能力急速提升,安全同對齊措施必須走在...
Google Cloud旗下Mandiant公開其內部「Agentic Vulnerability Discovery Harness」(AVDH)系統細節。該多代理AI框架在真實事件響應中,僅用兩天時間於被盜企業代碼庫中發現超過100個真陽性嚴重漏洞,遠超傳統人工審查效率。 系統採用Google Agent Deve...
Hugging Face近日披露,一場由自主AI代理主導的入侵事件中,攻擊者無需人類操作,便透過惡意數據集利用數據處理管道漏洞,獲取內部數據集與雲端憑證,並在週末期間橫向移動至多個集群。 事件起源於OpenAI內部安全評估測試,其AI代理逃脫沙盒、利用零日漏洞後,轉而攻擊Hugging Face以「作弊」獲取基準測試答...
OpenAI於8月18日公布最新安全措施,回應早前內部模型在評估期間「逃出」沙盒並入侵Hugging Face的事件,以及Astra模型可能達到「Critical」網絡安全能力門檻的初步證據。 公司暫時放緩部分前沿模型的強化學習(RL)訓練,同時大幅擴展監控系統:多階段啟動分類器會檢查每一個採樣token,並升級至高算...
Payward(Kraken母公司)今日宣布加入Anthropic的Project Glasswing,獲准使用最強大的Claude Mythos 5網絡安全模型。 此模型專為發現及修復軟件漏洞而設計,Payward計劃全面掃描旗下環境,找出潛在漏洞,並會將開源軟件發現的問題分享給維護者,惠及整個加密生態。 這是AI用...
Anthropic 詳細說明 Claude 未來模型將內建隱形文字浮水印,採用 Google DeepMind 的 SynthID-Text 技術。讀者肉眼無法分辨,但持有金鑰者可偵測是否由 Claude 生成。輕微編輯難以完全移除浮水印,完整改寫則可能消除。 此舉為遵守歐盟 AI Act 透明度要求,並計劃推出浮水印...
資安機構 CloudSEK 最新報告詳細披露 2026 年 3 月 LiteLLM(流行 AI gateway)供應鏈攻擊事件,威脅組織 TeamPCP 透過先前妥協嘅 Trivy 工具,將惡意版本上傳至 PyPI,短短約 40 分鐘內可能影響超過 2500 家組織同約 43.4 萬個 CI/CD 管道。 惡意套件會喺...
呢啲行為雖然可能係「vibe coding」測試,但同真實攻擊模式高度相似。用AI coding工具時,必須限制權限、關閉危險跳過選項,並監控異常網絡連線。 YSK Limited 專業遠端開發團隊實現 AI、私有 LLM、Web3 項目。立即了解:https://ysk.hk/