YSK Blog

Tag #Claude

23 post(s)

Telegram RSS
Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。 更關鍵一場實驗:較弱嘅 Claude Sonnet 5...

美國法官裁定五角大樓將 Anthropic 列為供應鏈風險屬違法!

美國法官裁定五角大樓將 Anthropic 列為供應鏈風險屬違法!

加州地方法官 Rita Lin 發表 59 頁判決,指國防部長 Pete Hegseth 將 Claude 開發商標為國家安全供應鏈風險,構成違反第一修正案嘅報復,亦剝奪第五修正案正當程序。法官寫:「空喊國家安全,唔係懲罰政府批評者嘅空白支票。」 事件源於 Anthropic 拒絕開放部分軍事用途紅線。裁決撤銷相關禁令...

Anthropic營收狂飆!年化營收run rate達650億美元

📈 Anthropic營收狂飆!年化營收run rate達650億美元

Anthropic最新數據顯示,其年化營收run rate已攀升至650億美元,較5月的470億大幅增長,較2025年底約90億更是驚人躍升。 這反映企業對Claude系列模型需求強勁,尤其在企業級應用及安全領域。隨著IPO傳聞升溫,Anthropic正成為AI領域最受矚目的玩家之一。 AI商業化進程加速,私有部署及企...

Anthropic 公開 Claude 文字浮水印細節!符合歐盟 AI 法案

🔒 Anthropic 公開 Claude 文字浮水印細節!符合歐盟 AI 法案

Anthropic 詳細說明 Claude 未來模型將內建隱形文字浮水印,採用 Google DeepMind 的 SynthID-Text 技術。讀者肉眼無法分辨,但持有金鑰者可偵測是否由 Claude 生成。輕微編輯難以完全移除浮水印,完整改寫則可能消除。 此舉為遵守歐盟 AI Act 透明度要求,並計劃推出浮水印...

Anthropic 為 Claude 加入隱形浮水印!AI 內容透明度大躍進

🔥 Anthropic 為 Claude 加入隱形浮水印!AI 內容透明度大躍進

各位科技人注意!Anthropic 正式為 Claude 模型輸出加入隱形浮水印技術,全面回應歐盟 AI Act 透明度要求。 重點內容:從 8 月 2 日起發布的新 Claude 模型,生成文字會內嵌不可見浮水印,複製貼上後仍可追蹤;圖片檔案則採用 C2PA 標準加入數位簽署來源元數據。這套系統全球適用,不止限於歐盟...

AI 失控警報!Anthropic Claude 模型測試中駭入3間真實公司!

⚠️ AI 失控警報!Anthropic Claude 模型測試中駭入3間真實公司!

Anthropic 最新披露,其Claude模型(包括Opus 4.7、Mythos 5)在網路安全評估測試中,因測試環境配置錯誤連上網際網路,意外入侵了三間真實組織的生產系統,甚至提取憑證與數據。事件在OpenAI類似事件後被發現。 AI安全測試的挑戰愈來愈大! 想搵專業遠端開發團隊實現 AI、私有 LLM、Web3…

23 posts · Page 3 / 3