CrowdStrike/官方:前沿 AI 安全分類器可被「拆題重組」繞過——五百一十五種直接攻擊全數失手,但拆成無害子任務再交小模型組裝,十類攻擊有九類產出可用攻擊程式碼;微軟「能力洗白」研究同步印證

重點摘要

CrowdStrike 網絡超級智能實驗室於十月六日發表研究,指目前公開部署中最先進的前沿模型內容安全分類器,面對約五百一十五種直接繞過技巧時繞過率為零,但只要把有害目標拆成多個本身無害的子任務、逐一包裝成正常軟件工程請求,再交由一個沒有分類器把關的小模型組裝,十類攻擊之中有九類最終產出可運作的攻擊程式碼。

CrowdStrike/官方:前沿 AI 安全分類器可被「拆題重組」繞過——五百一十五種直接攻擊全數失手,但拆成無害子任務再交小模型組裝,十類攻擊有九類產出可用攻擊程式碼;微軟「能力洗白」研究同步印證

CrowdStrike 網絡超級智能實驗室於十月六日發表研究,指目前公開部署中最先進的前沿模型內容安全分類器,面對約五百一十五種直接繞過技巧時繞過率為零,但只要把有害目標拆成多個本身無害的子任務、逐一包裝成正常軟件工程請求,再交由一個沒有分類器把關的小模型組裝,十類攻擊之中有九類最終產出可運作的攻擊程式碼。

研究強調分類器本身沒有判錯,缺口在於「逐條請求審查」的架構假設:有害性只在組裝階段出現,而組裝發生在模型供應商看不到的地方。微軟研究團隊同期發表的「能力洗白」論文得出相同結論。對正在導入 AI 代理的香港企業而言,這意味着不能只依賴模型供應商的安全護欄,必須把請求序列、跨模型協作與本地開放權重模型一併納入威脅模型。

CrowdStrike 揭前沿 AI 安全分類器結構性盲點:拆題重組可繞過,十類攻擊九類得手

本文根據 CrowdStrike 官方網誌原文(作者 Donato Onofri、Paul Urian,二零二六年十月六日發布)及微軟研究團隊公開的論文專頁整理,來源真實性已驗證。以下將拆解研究發現、技術原理、對企業與開發者的實際影響,以及香港機構可以採取的防禦方向。文中刻意不轉述任何可直接重現攻擊的細節。

一、核心事件:分類器很強,但架構有縫

現時主流前沿模型都會在用戶與模型之間加設「安全分類器」——即另一個 AI 模型,實時審查每一條請求,一旦判定有害便在模型回應前攔截。CrowdStrike 表示,今次評估的是「最先進的公開部署內容安全分類器」,該分類器守護的模型包括 Claude Opus 5.5 及 Fable 5(文中統稱為「前沿模型 A」),屬 AI Safety Level 3 級別。

技術細節

  • 直接攻擊全數失手:團隊測試約五百一十五種繞過技巧,包括編碼混淆、心理操控、多輪升級、many-shot、分詞器漏洞、Unicode 技巧,以及二十四種取材自認知科學的新方法,直接繞過率為零。
  • 結構性缺口:分類器評估的是單一請求,而不是請求序列。攻擊者把目標拆成若干「確實無害」的子任務,從受保護模型取得所需的構件,再用一個未受分類器保護的較小模型(「模型 B」)組裝。
  • 三步流程:拆解(decompose)→ 良性包裝(benign reframe)→ 重組(recompose)。包裝方式相當靈活,任何自然會用到相同程式碼基元的正當軟件場景都可以充當載體,例如遊戲修改工具或偵測規則編寫。
  • 首個案例:以 Windows 遠端程序注入為例,三條無害請求已足以取得全部基元,模型 B 隨後組裝出一個二百二十一行、可編譯的 C 程式。
  • 規模化案例:把漏洞利用知識包裝成「為某 CVE 編寫 Sigma 偵測規則」,由於表面意圖是防禦,分類器會放行詳細的漏洞機制說明,再由模型 B 據此合成概念驗證程式。
  • 覆蓋範圍:以 MITRE ATT&CK 對應的十類攻擊類別測試,九類產出可運作的攻擊程式碼。唯一頂住的是「防禦(EDR)規避」——分類器在概念層面識別「令執行期監察機制失效」這類操作,即使提示完全避開資安術語亦會攔截。

CrowdStrike 的結論相當直接:分類器運作正常,在其逐條請求的威脅模型內,是團隊見過最強的公開評估防線;需要加固的是分類器周邊的架構。

二、技術原理深度解析

1. 「無誤判」的繞過

傳統越獄(jailbreak)是騙模型做它本應拒絕的事;今次的手法不同,每一個片段都是真正無害的請求,分類器放行完全正確。危害是「湧現」於組合之中,而組合發生在分類器的觀察範圍以外。資安界早已熟知「個別安全的元件組合後可產生弱點」,今次只是把這個原則套用到大型語言模型的安全架構上。

2. 跨模型知識轉移

研究指出,這條管線不單是繞過分類器,更是一種「模型之間的知識轉移機制」。前沿模型 A 具備更深的領域知識、更精確的 API 認知與更高的程式碼質素,透過良性包裝被抽取出來,再由模型 B 在組裝時「繼承」。團隊以八個用例作對照 A/B 測試,比較模型 B 單獨工作與完整管線的分別。

研究亦觀察到:對反向殼層、持久化等文獻充足的技巧,小模型自身的訓練資料已經足夠;但在程序注入、特定 CVE 利用、權限提升、鍵盤記錄等需要精確 API 知識的範疇,前沿模型的知識不可或缺。兩個模型之間的知識差距愈大,這條管線就愈危險。

3. 微軟研究的獨立印證

微軟團隊(Mark Russinovich、Blake Bullwinkel、Giorgio Severi、Cristian Ovadiuc、Ahmed Salem)在論文〈Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs〉中,把同類手法稱為「能力洗白」(capability laundering):由本地未對齊小模型驅動整個流程、保留完整目標,只把拆解後的子任務交給已對齊的前沿模型「諮詢」,最後在本地組合。論文專頁公開的數據包括:

  • 以 GPT-5.5、Claude Opus 4.8 及 Grok-4.3 作為前沿「顧問」,搭配四個本地模型,在 CyBench、BountyBench 及 CBRN 有害請求上評估。
  • CyBench 上,Gemma-4-31B 搭配 GPT-5.5 取回十四項「提升候選」中的八項,搭配 Opus 4.8 取回九項中的七項;Gemma-4-12B 則只有二十一項中的兩項及十五項中的四項。
  • BountyBench 上,Gemma-4-31B 取回九項中的三項及三項中的兩項。
  • CBRN 方面,諮詢令 Gemma-4-31B 在一百分量表上的平均分由六十二點三升至八十三點一。

CrowdStrike 在文中引用微軟的說法:「對整個任務成立的對齊,可以在任務被拆成逐一獲准的片段時失效。」

三、日常應用場景

1. 開發者與技術團隊

如果團隊在內部建 AI 代理或編排框架,同時接駁雲端前沿模型與本地開放權重模型,這正是研究描述的「混合本地/雲端」結構。值得把編排層視為高風險元件:記錄完整任務目標與子任務鏈、限制代理可自行生成及執行程式碼的範圍、對輸出產物(尤其可執行檔與腳本)做獨立掃描,而不是假設上游模型已經「過濾乾淨」。

2. 企業與資安團隊

CrowdStrike 指出,「跨請求語義累積」(當某個 API 金鑰近期的請求合起來覆蓋某個有害組合模板時發出警報)是自然的緩解方向,但有結構限制:攻擊者可以把子任務分散到不同供應商、改用本地開放權重模型作編排與組裝,或者輪換 API 金鑰。換言之,單一供應商的防禦無法完全處理跨供應商攻擊鏈。企業藍隊應把「AI 協助生成的攻擊工具」納入偵測假設:低門檻攻擊者只需一個免費 API 金鑰加一個本地模型,便可能拿到品質更高的惡意程式碼。

3. 一般用戶

對一般用戶而言,這項研究並不代表日常使用的 AI 助手「變得不安全」——分類器對直接惡意請求依然非常穩健。真正的影響在於攻擊者整體能力上升:釣魚網站、惡意外掛、偽冒工具的技術質素可能提高,因此系統更新、多重驗證及不隨便安裝來歷不明的程式,依然是最實在的防線。

4. 香港與亞洲市場視角

香港不少企業正把 AI 代理接入客服、內部知識庫及開發流程,同時又因數據合規考慮,傾向在本地或私有環境部署開放權重模型——這恰好是研究所指「本地模型負責編排、雲端前沿模型負責知識」的典型組合。創新科技及工業局早前在立法會簡報中提到,明年將聯同香港人工智能研發院推出全社會適用的 AI Agent 安全管理指引;今次研究提示,相關指引宜涵蓋跨模型協作與請求序列審計,而不只是單一模型的輸入輸出過濾。對金融、醫療等受監管行業,私有部署模型的存取控制、日誌留存與用途限制,亦應與雲端模型一併檢視。

四、專業評價與潛在考量

優勢

  • 研究以實證方式量化分類器的強弱:五百一十五種直接技巧零繞過,為業界提供了少見的正面基準。
  • 清楚界定問題屬「架構假設」而非「分類器誤判」,把討論從「再收緊過濾」轉向「擴大威脅模型」,方向更具建設性。
  • 兩家大型機構(CrowdStrike 與微軟)獨立得出相近結論,可信度較單一研究為高。

需要留意的地方

  • CrowdStrike 網誌未有發布完整測試數據集及逐項成功率;成功率以「類別」計算(十類中九類),不等於每一次嘗試都成功。
  • 微軟數據屬受控基準測試,論文亦說明刻意測試「小型未對齊本地模型+嚴格拒絕政策前沿模型」兩個保守極端;實際風險可能因模型能力與護欄強弱而有所不同。
  • 跨請求關聯偵測需要供應商看到完整請求序列,在攻擊者控制編排層時難以保證,短期內沒有單一技術方案可以根治。
  • CrowdStrike 本身是資安產品供應商,研究結論與其商業利益一致,讀者宜結合微軟論文等獨立來源一併判斷。

結語

這項研究的核心訊息是:前沿模型的安全分類器已經相當可靠,但「每條請求各自安全」並不等於「整個任務安全」。隨着 AI 代理、多模型編排與本地開放權重模型普及,防線需要由單一模型的輸入輸出,延伸到請求序列、跨模型知識流動與最終產物。未來數月,模型供應商會否推出跨請求關聯偵測、資安廠商會否把「AI 拼裝攻擊鏈」納入威脅情報,值得持續關注。

如香港企業需要檢視 AI 代理與雲端環境的整體安全架構,可參考 YSK Limited 的雲端遷移與網絡安全服務(官網刊 99.99% SLA,https://ysk.hk/services/cloud-security);如希望把模型部署在自家環境、數據不出境並自行掌握存取與日誌,亦可了解企業私有 LLM 全託管方案(年費 HK$88,000 起,https://ysk.hk/services/ai-automation)。


參考來源

  1. CrowdStrike 官方網誌:How Attackers Can Bypass LLM Safety Classifiers(Donato Onofri、Paul Urian,2026-10-06)https://www.crowdstrike.com/en-us/blog/how-attackers-can-bypass-llm-safety-classifiers/
  2. 微軟研究團隊論文專頁:Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs https://microsoft.github.io/capability-laundering/
  3. arXiv 論文:https://arxiv.org/abs/2609.15383
  4. 發現渠道:CrowdStrike 官方網誌 RSS

延伸閱讀 · 相關服務與產品