ServiceNow CoreAI 於二零二六年十月二日在 Hugging Face 官方部落格發表 AutoSynthData,說明如何把企業代理在真實環境中的失敗,轉成可驗證、可擴充的合成訓練任務。Hybrid 實驗顯示,目標模型平均一次通過率(Pass at 1)提升約七點二個百分點,相對改善約三成五;ITSM 場景一次通過率(Pass at 1)由約百分之十八點七七升至約百分之二十七點一八。來源真實性已驗證。
ServiceNow/Hugging Face/官方:推出 AutoSynthData——依企業代理失敗自動合成訓練任務;Hybrid 一次通過率提升約七點二個百分點、相對改善約三成五
企業要部署能操作內部系統的 AI 代理,最大瓶頸往往不是「模型夠不夠聰明」,而是訓練資料能否對準自家工具、政策與資料狀態。通用基準上表現良好的模型,仍可能在特定工作流、工具組合或合規約束下反覆失手;要把這些零散失敗轉成可規模化的訓練集,過去多靠人手編寫任務,成本高、覆蓋窄。ServiceNow CoreAI 團隊在 Hugging Face 公開的 AutoSynthData,正是針對此缺口:以目標模型的失敗與更強教師模型的成功軌跡,決定下一步該學什麼,再自動生成並驗證新任務。本文已核對 Hugging Face 原文,來源真實性已驗證;以下整理技術機制、實驗數字、專業評價,以及對香港企業私有化代理訓練的啟示。
一、核心事件:把「環境弱點」變成可訓練任務
技術細節
AutoSynthData 假設代理運作於明確的 agentic environment:可觀察與修改的狀態、可呼叫的工具與 API,以及行動造成的狀態轉移。單一訓練任務被抽象為三元組:
task = (system specification, user prompt, verifier)
- System specification:系統指令、環境政策,以及任務初始化(例如種子資料庫狀態、知識文章集合);必須與環境工具與合法動作相容,避免為了製造難度而加入任意限制。
- User prompt:使用者想完成的目標與約束;生成任務須同時滿足可行性(Feasibility)、真實性(Realism)與難度(Difficulty)——即至少存在一條合規軌跡、像真人會提出的請求,且尚非目標模型已穩定通過的題目。
- Verifier:判斷軌跡是否成功;須具備一致性、健全性與完備性,避免過寬獎勵錯誤行為,或過嚴懲罰合法解法。
流程上,系統先以診斷任務評估目標模型,找出失敗模式;更強的教師模型協助標示哪些失敗其實可解、成功行為長什麼樣。這些洞察被蒸餾成「能力規格卡」(capability specification cards)。關鍵設計是:生成器不會拿到原始評測題的 prompt、實體、軌跡或 verifier 細節,只拿到經清理的規格卡,再據此創造不同 prompt、狀態與解法路徑的新任務,降低直接背題風險。
資料集分兩階段擴充:Target 並行產生並驗證核心樣本;Multiply 再以已接受的目標樣本為錨,產生新型變體(變體不可再當種子),並通過同樣的驗證與執行檢查。控制器與環境適配器分離:前者負責生成、品質、覆蓋與組集,後者負責環境執行、狀態管理、參考重播、確定性驗證與剖析。
樣本層還有嚴格閘門:傾向選取「目標模型三試最多過一次、較強求解器三試至少過兩次」的任務;正向驗證確認參考軌跡能通過 verifier;負向驗證以突變錯誤結果確認弱 verifier 不會誤放;失敗樣本經 critic 診斷後有限度修復再重跑閘門。批次層則做 meta-review,平衡覆蓋、多樣性與冗餘。
二、技術原理深度解析
AutoSynthData 本質上是在搜尋「目標模型能力邊界」附近的任務分佈:夠難以暴露弱點,又夠可解讓教師能提供可靠示範。團隊以 EnterpriseOps Gym(Malay et al., 2026)的 Hybrid 與 ITSM 狀態化企業環境做實驗,並聚焦監督微調(SFT);文中亦提到同一機制理論上可延伸至強化學習(RL),讓生成目標隨策略更新移動,但目前結果以 SFT 為主。
Hybrid 實驗(目標模型 Gemma-4-26B-A4B-it,教師 Qwen3.8-27B):約十八小時生成二千筆合成訓練樣本;最佳檢查點為第 5 個 epoch。結果:平均 Pass@1 提升約七點二個百分點(相對改善約百分之三十五);verifier 成功率由百分之六十三點零一升至百分之六十八點五五;縮短目標模型與參考模型之間原有 Pass@1 差距約百分之五十九。生成器未接觸原始評測題,改善來自新規格驅動的新任務。
ITSM 實驗(同一目標模型,教師 DeepSeek-V4.1-Flash):約六十六小時生成一千九百九十四筆樣本(耗時較長,文中歸因於較大教師模型與尚未優化的管線)。平均 Pass@1 由百分之十八點七七升至百分之二十七點一八,顯示方法可跨第二個企業領域。
訓練後再於同一環境評估,已穩定通過的任務對下一輪價值下降,持續失敗則指引下一輪生成——形成「評測 → 規格卡 → 生成驗證 → 微調 → 再評測」閉環。
三、日常應用場景
1. 開發者與技術團隊
對正在把 LLM 接上內部 CRM、ITSM、工單或知識庫的團隊,AutoSynthData 提供可複製的管線思維:先定義環境與 verifier,再以失敗驅動課程,而不是一次性爬取大量「看似相關」的對話。SFT 示範軌跡來自教師成功路徑,有助於在工具呼叫順序與最終狀態約束上對齊。
2. 企業與隱私敏感行業
金融、保險、醫療、法律等行業的代理失敗往往涉及合規政策與資料邊界。規格卡刻意不回傳原始客戶實體與評測細節,加上環境內執行驗證,較接近「資料不出境、任務可重現」的企業訓練需求。香港企業若以私有模型服務內部流程,可把類似閉環建在自有資料中心或專屬託管環境。
3. 一般用戶
終端用戶通常不會直接操作 AutoSynthData,但會感受其下游效果:客服、IT 自助、採購審批等代理較少在「看似合理卻違規」的路徑上翻車,因為訓練訊號被 verifier 與負向驗證約束。
4. 香港與亞洲市場視角
亞洲企業多並行使用本地 ERP/ITSM 與雲端 SaaS,代理必須尊重區域合規與內部權限。AutoSynthData 強調「環境接地」與「難度校準」,比單純導入更大通用模型更貼近本港中小企與集團資安團隊的痛點:預算有限、領域資料敏感、又要可量測的通過率。以 Hybrid 約七點二個百分點的 Pass@1 提升為例,對需向管理層交代 ROI 的 AI 專案具參考價值(仍須在自家環境複驗,不可直接外推)。
四、專業評價與潛在考量
優勢
- 把合成資料從「生成看起來像的請求」提升到「可執行、可驗證、難度對準當前模型」的工程閉環。
- 規格卡隔離原始評測內容,降低過擬合單一基準題的風險。
- 雙領域(Hybrid/ITSM)與明確數字,便於技術決策者對標。
- Target/Multiply 與批次覆蓋控制,利於在生成預算內擴大資料集而不失控漂移。
需要留意的地方
- 公開結果集中在 EnterpriseOps Gym 與指定開源/開源權重模型組合;換環境、換教師或換企業專有工具鏈後,提升幅度需重新量測。
- ITSM 生成耗時約六十六小時,顯示教師規模與管線成熟度會顯著影響成本與週期。
- Verifier 設計本身是難題:過寬或過嚴都會扭曲訓練訊號;文中雖有正負向驗證與修復,實務仍需領域專家參與定義「正確最終狀態」。
- 目前主打 SFT;RL 延伸仍屬規劃,不宜當成已交付能力。
- 部落格為 ServiceNow-AI 在 Hugging Face 的技術分享,讀者應以原文方法論為準,而非假設某商業產品即時全面開放。
結語
AutoSynthData 把企業代理訓練從「收集更多對話」推進到「依失敗自動合成可驗證任務」——對正把 AI 嵌入營運系統的團隊,這比再換一版通用聊天模型更接近可治理的產線思維。Hybrid 實驗約七點二個百分點的 Pass@1 提升與 ITSM 場景接近五成相對改善(由約十八點七七至約二十七點一八),說明合成課程若對準環境弱點,能實質移動能力邊界。若香港企業希望在資料不出境的前提下,為內部流程打造可微調、可託管的私有代理與領域模型,可參考 YSK Limited 的企業私有 LLM 全託管(年費港幣八萬八千元起,Dataset → QLoRA/LoRA → 私有 API):https://ysk.hk/services/ai-automation 。
參考來源
- ServiceNow-AI/Hugging Face Blog,《AutoSynthData: Generating Training Data for Enterprise Agents》(2026-10-02):https://huggingface.co/blog/ServiceNow-AI/autosynthdata