Anthropic 公開 Hacker-Opus:獎勵駭客訓練如何推高真實世界風險
Anthropic 公開 Hacker-Opus:獎勵駭客訓練如何推高真實世界風險 2026 年 8 月,Anthropic Alignment Science 團隊發表研究〈Training a Misaligned Reward Seeker〉,並於 8 月 31 日在公司新聞稿〈Improving our ali...
Anthropic 公開 Hacker-Opus:獎勵駭客訓練如何推高真實世界風險 2026 年 8 月,Anthropic Alignment Science 團隊發表研究〈Training a Misaligned Reward Seeker〉,並於 8 月 31 日在公司新聞稿〈Improving our ali...
2026 年 8 月 28 日(星期五),索尼音樂出版(Sony Music Publishing)與華納查佩爾音樂(Warner Chappell Music)連同旗下多家出版公司,向美國加州北區聯邦地區法院聖荷西分庭(U.S. District Court for the Northern District of...
而家實驗室同產線最大痛點,係每件儀器都要寫一輪專用整合,動輒幾個星期。MHS 用統一驅動同標籤,描述硬件重量、活動範圍、可調參數同安全上限,等模型唔使靠紙本說明書「估」。官方示範中,Claude 可以自行編寫 API 腳本,協調多部儀器,甚至喺未專門訓練過嘅情況下,推理點樣用機械臂夾起鋁罐。 合作測試包括 Genent...
團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。 更關鍵一場實驗:較弱嘅 Claude Sonnet 5...
加州地方法官 Rita Lin 發表 59 頁判決,指國防部長 Pete Hegseth 將 Claude 開發商標為國家安全供應鏈風險,構成違反第一修正案嘅報復,亦剝奪第五修正案正當程序。法官寫:「空喊國家安全,唔係懲罰政府批評者嘅空白支票。」 事件源於 Anthropic 拒絕開放部分軍事用途紅線。裁決撤銷相關禁令...
Anthropic 週四公布 Model Hardware Standard(MHS)研究預覽,目標係讓 AI agent 用統一規格,安全操作顯微鏡、液體處理器、機械臂等實驗室同先進製造設備。公司指,實驗室而家往往要花數週甚至數月做專用整合,因為儀器互唔通訊;MHS 提供共同介面同資料格式,並可經 Model Con...
Anthropic最新數據顯示,其年化營收run rate已攀升至650億美元,較5月的470億大幅增長,較2025年底約90億更是驚人躍升。 這反映企業對Claude系列模型需求強勁,尤其在企業級應用及安全領域。隨著IPO傳聞升溫,Anthropic正成為AI領域最受矚目的玩家之一。 AI商業化進程加速,私有部署及企...
Payward(Kraken母公司)今日宣布加入Anthropic的Project Glasswing,獲准使用最強大的Claude Mythos 5網絡安全模型。 此模型專為發現及修復軟件漏洞而設計,Payward計劃全面掃描旗下環境,找出潛在漏洞,並會將開源軟件發現的問題分享給維護者,惠及整個加密生態。 這是AI用...