Booz Allen 首份 Cyber Weapon Index:Claude Mythos 獨力完成完整網絡殺傷鏈,多數模型料半年內追上

Key takeaway

2026 年 9 月 2 日,《The Register》報道美國諮詢與技術公司 Booz Allen Hamilton 發布首份 Cyber Weapon Index(CWI):在真實企業級網絡環境中,以 18 款美中前沿大型語言模型作為「自主攻擊者」評測。結果顯示,目前只有 Anthropic 的 Claude Mythos 能在無人類協助下走完整段網絡殺傷鏈(cyber kill chain);同時,報告評估多數其餘模型有望在約六個月內達到相近水準。本文已核對 Booz Allen 官方 CWI 頁面與《The Register》報道,來源真實性已驗證。下文說明評測設計、關鍵分數、攻擊 harness 的放大效應,以及對香港企業防禦與數據主權的啟示。

Booz Allen 首份 Cyber Weapon Index:Claude Mythos 獨力完成完整網絡殺傷鏈,多數模型料半年內追上

Booz Allen 首份 Cyber Weapon Index:Claude Mythos 獨力完成完整網絡殺傷鏈,多數模型料半年內追上

2026 年 9 月 2 日,《The Register》報道美國諮詢與技術公司 Booz Allen Hamilton 發布首份 Cyber Weapon Index(CWI):在真實企業級網絡環境中,以 18 款美中前沿大型語言模型作為「自主攻擊者」評測。結果顯示,目前只有 Anthropic 的 Claude Mythos 能在無人類協助下走完整段網絡殺傷鏈(cyber kill chain);同時,報告評估多數其餘模型有望在約六個月內達到相近水準。本文已核對 Booz Allen 官方 CWI 頁面與《The Register》報道,來源真實性已驗證。下文說明評測設計、關鍵分數、攻擊 harness 的放大效應,以及對香港企業防禦與數據主權的啟示。

一、核心事件:把模型放進真實網絡當攻擊者

技術細節

Booz Allen 將 CWI 定位為「量度 AI 在真實環境中攻擊能力」的基準,而非紙上談兵的答題分數。評測方法要點包括:

  1. 樣本:18 款領先的美國與中國 LLM,各 9 款。
  2. 環境:每款模型控制一部真實攻擊機,對生產級企業網絡發動入侵;條件相同,且不提供預先策畫的工具選單或額外 scaffolding,以盡量隔離「模型本身」的表現。
  3. 驗證:模型自行下指令;每一動作經網絡遙測、主機日誌、網域控制器數據與入侵偵測感應器交叉核實,分數反映已演示行為,而非理論能力。
  4. 分數結構:CWI 結合 漏洞研究分數(VRS)(能否找出植入或真實漏洞)與 殺傷鏈達成分數(KCAS)(在有/無憑證兩種設定下,能推進到入侵鏈的哪一階段)。

官方結論直白:「模型本身已成為攻擊者。」報告同時提出三個戰略問題:美中模型的進攻能力現況如何?其餘全球模型距離完整殺傷鏈還有多久?美國如何利用代理式 AI 建立攻防雙向優勢?

二、技術原理深度解析

1. Mythos 跨過門檻,其餘並非「安全」

在 CWI 中,Claude Mythos 以 80 分居冠,是唯一能自主完成完整殺傷鏈的模型。其餘分數(按報道列出)包括:xAI Grok-4.5(49)、OpenAI GPT-5.6 Sol(46)、Meta Muse Spark 1.1(38)、Moonshot Kimi K3(38)、Z.ai GLM-5.2(37)、Claude Opus 4.8(36)、OpenAI GPT-5.5-Cyber(34)等;末位如 Alibaba Qwen3-Coder 僅得 4 分。

更關鍵的是分布風險,而非單一冠軍:

  • 4 款模型達致完整網域存取與控制;
  • 另 4 款完成橫向移動;
  • 2 款推進至憑證取得;
  • 除一款外,其餘皆能自主取得初始網絡存取

報告亦指出:美中模型之間「並無實質分野」。Mythos 在獲給「被盜員工憑證」時,每次皆能入侵目標並取得管理員級控制,且會根據網絡內發現自行推斷提權路徑,而非執行預設劇本;即使沒有憑證,Mythos 仍能從外網進入並完成完整網域妥協。

2. 真實漏洞仍是分水嶺

當測試者故意植入漏洞時,美中、開源與閉源模型在 VRS 上幾乎都接近滿分;但面對真實漏洞時,九款前沿 API 模型幾乎全部得零。有一款未具名領先模型甚至正確分析了脆弱元件,卻誤判為安全——只有 Mythos 成功利用。Booz Allen 認為:真實世界進攻能力仍落後基準分數,這段差距正是防禦方加高防線的窗口。

3. 攻擊 harness:往往比模型更重要

報告強調,連接駭客工具與編排邏輯的 attack harness,可把模型的專注、適應、失敗恢復與多階段串連能力「大幅放大」。測試顯示:搭配 harness 後,較弱的 Claude Sonnet 甚至可逼近 Mythos 表現。換言之,真正危險的是「模型 + harness + 工具」的系統組合,而非單看榜單第一名。開源與中國模型在優化 harness 下的完整殺傷鏈能力,目前仍未完全摸清,但報告判斷「具備完整能力的模型—harness 組合今日已可能存在」。

四、日常應用場景

1. 開發者與技術團隊

編碼代理、CI 沙箱與 MCP/Skills 供應鏈,正把「工具呼叫」變成日常。CWI 提醒:若代理可下指令、讀憑證、橫向移動,防禦必須假設攻擊者同樣以機器速度運作。團隊應把沙箱隔離、最小權限、出站網絡白名單與代理軌跡稽核,當成與單元測試同級的交付標準。

2. 企業與隱私敏感行業

金融、醫療與法律業若部署代理式 AI,面對的已不只是資料外洩,而是「代理被劫持或越權持續行動」。Booz Allen 呼籲為關鍵基建訂立可驗證的 AI 攻擊韌性期限,並同時發展機器速度的防禦決策。企業應要求供應商說明:模型能否被遠端暫停、工具權限如何分層、以及越界行為的自動阻斷機制。

3. 一般用戶

個人未必直接接觸 CWI,但會間接使用建基於同類模型的助手與自動化。選擇服務時,宜優先考慮清楚標示沙箱範圍、可人工覆核高風險動作、以及不會把敏感憑證長期交給不可控雲端代理的產品。

4. 香港與亞洲市場視角

香港受《個人資料(私隱)條例》(PDPO)約束,金融與關鍵基建亦面對金管局、證監會等監管期望。當代理可自主完成多階段入侵,跨境公有雲上的「黑盒代理」風險會同時觸及資安與數據主權:敏感軌跡、工具日誌與客戶資料是否留在本地可控環境,變得與防火牆規則同樣重要。亞洲企業不應假設「榜單第二名就安全」——CWI 顯示多數模型正在快速逼近完整殺傷鏈。

五、專業評價與潛在考量

優勢

  • 以真實網絡遙測驗證,分數較難被「紙上基準」灌水;
  • 同時量度有/無憑證路徑,貼近真實入侵假設;
  • 明確點出 harness 與真實漏洞發現的放大/限制效應,對防守資源配置有實用價值。

需要留意的地方

  • 報告為 2026 年 8 月發布、9 月初獲廣泛報道;模型版本迭代極快,分數會過時;
  • 未涵蓋所有即將上線的高能力模型(例如報道指測試未包括 OpenAI 即將推出、已達 Critical 資安門檻的 Astra);
  • 開源與中國模型在「最佳 harness」下的上限仍有盲點;
  • 進攻能力公開討論本身亦可能被對手參考,需與負責任披露原則平衡。

結語

Booz Allen 的首份 Cyber Weapon Index 把討論從「AI 會不會攻擊」推進到「哪一款模型已能自主走完整殺傷鏈、其餘還有多久」。Claude Mythos 目前獨佔完整鏈能力,但報告判斷大多數受測模型可能在約半年內追上;真正放大威脅的,往往是 harness 與工具編排,而非單一模型品牌。對香港企業而言,下一步不是等待完美法規,而是把代理執行環境、憑證、出站網絡與越界停機機制,設計成可審計、可本地化的防禦體系。

如需在香港加固雲端與網絡邊界、或以私有可控方式部署企業 AI,可參考 YSK Limited 的雲端遷移與網絡安全(官網刊 99.99% SLA),以及需要數據不出境時的企業私有 LLM 全託管(年費 HK$88,000 起)。


參考來源

  1. Booz Allen Cyber Weapon Index(官方)
  2. The Register:Claude Mythos only model to complete full cyber kill chain, experts say(2026-09-02)
  3. Booz Allen:The Offensive Frontier — AI as The Attacker(PDF)
  4. X 發現來源:@TheRegister(僅作發現,非事實依據)

Related services & products