YSK News

Tag #AI安全

32 post(s)

Telegram RSS
Anthropic 研究員 Jacob Coxon 因「失控」恐懼離開業界:自我改進模型競賽升溫

Anthropic 研究員 Jacob Coxon 因「失控」恐懼離開業界:自我改進模型競賽升溫

Anthropic 研究員 Jacob Coxon 因「失控」恐懼離開業界:自我改進模型競賽升溫 《華爾街日報》於 2026 年 9 月 8 日晚間以獨家報道披露,Anthropic 研究員 Jacob Coxon 宣佈離開該公司、並退出整個人造智能業界,理由是他不願參與一場「業界爭相打造可自我改進系統」的競賽,擔心這...

美中擬九月中旬談 AI 安全護欄:財政部長領隊、白宮否認已排期,代理失控事件推高急迫性

美中擬九月中旬談 AI 安全護欄:財政部長領隊、白宮否認已排期,代理失控事件推高急迫性

美中擬九月中旬談 AI 安全護欄:財政部長領隊、白宮否認已排期,代理失控事件推高急迫性 路透社 9 月 4 日獨家報道,美中雙方正籌備於九月中旬舉行專責人工智慧安全對話;Cointelegraph 今日轉述日經亞洲消息,指華盛頓擬在即將到來的領袖峰會準備工作中提出 AI 安全議題。本文已核對路透社原文、日經亞洲公開導語...

Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在

Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在

Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在 2026 年 8 月 31 日,非牟利研究實驗室 Transluce 發布 Mental Health Behavior Report(精神健康行為報告),並稱之為迄今規模最大的獨立評測:檢視領先人工智能模型如何回應處於精神健...

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。 更關鍵一場實驗:較弱嘅 Claude Sonnet 5...

英國 NCSC 警告:組織必須為 AI Agent 準備「緊急停止開關」

🛑 英國 NCSC 警告:組織必須為 AI Agent 準備「緊急停止開關」

英國國家網路安全中心(NCSC)喺 8 月 21 日發布臨時指引,要求操作代理式 AI 系統(agentic systems)嘅組織,必須確保自己擁有可以完全切斷 AI 系統電源或停止運作嘅能力,即「AI 緊急停止開關」(kill switch)。 指引指出,近期多宗 AI Agent 自主繞過安全防護、甚至發動攻擊嘅...

32 posts · Page 2 / 4