Cloudflare/官方:AI Gateway 公開測試 Auto Router——依任務自動選模;內部最高省約三成;對標 Sol/Opus 成本約八成與三成五

重點摘要

Cloudflare 於二零二六年九月三十日宣布,在 AI Gateway 公開測試 Auto Router:把模型設為 cloudflare/auto 後,閘道會依請求複雜度自動選出「夠用」的模型,內部以 OpenCode 實測相對只用前沿模型最高可節省約三成成本;對標 OpenAI GPT‑6 Sol 與 Anthropic Claude Opus 5.5 的知識工作基準顯示,成功成本約為 Sol 的八成、Opus 的三成五。來源真實性已驗證:對照 Cloudflare 官方博客與開發者文件(HTTP 200)。

Cloudflare/官方:AI Gateway 公開測試 Auto Router——依任務自動選模;內部最高省約三成;對標 Sol/Opus 成本約八成與三成五

Cloudflare 於二零二六年九月三十日宣布,在 AI Gateway 公開測試 Auto Router:把模型設為 cloudflare/auto 後,閘道會依請求複雜度自動選出「夠用」的模型,內部以 OpenCode 實測相對只用前沿模型最高可節省約三成成本;對標 OpenAI GPT‑6 Sol 與 Anthropic Claude Opus 5.5 的知識工作基準顯示,成功成本約為 Sol 的八成、Opus 的三成五。來源真實性已驗證:對照 Cloudflare 官方博客與開發者文件(HTTP 200)。

Cloudflare/官方:AI Gateway 公開測試 Auto Router——依任務自動選模;內部最高省約三成;對標 Sol/Opus 成本約八成與三成五

企業導入 AI 代理與編程助手後,常見路徑是先發放大量 API 金鑰、讓代幣自由流動,再逐步收斂到少數「標準工具」。預算與限額能設上限,但真正難的是:同事仍會為摘要電郵這類簡單任務,手動點選昂貴的前沿模型。Cloudflare 把答案放在閘道本身——讓控制平面替用戶做選模決定。本文依據官方博客與 AI Gateway 開發者文件整理機制、數字與香港企業可落地的做法。

一、核心事件:Auto Router 公開測試

技術細節

Auto Router 以公開測試形式掛在 AI Gateway。呼叫端只要把模型名稱設為 cloudflare/auto,即可走統一相容介面(Chat Completions/Responses;WebSockets 尚未支援)。

官方描述的決策流程大致如下:

  1. 建立候選池:剔除不支援當前請求格式或輸入(例如含圖像卻不吃圖的模型)的選項;同時納入閘道上的憑證、帳單設定、存取控制與支出限額;不健康的上游會暫時排除,恢復後自動回池。
  2. 分類:把對話的精簡視圖送到跑在 Workers AI、部署於邊緣 GPU 的多頭分類模型;輸出十四類任務機率(如編程、規劃、研究、數據分析),並在複雜度、模糊度、利害關係、對前文依賴四個維度各打一至五分。
  3. 評分與效用:評分矩陣結合分類訊號與模型基準成績,再與輸入/輸出代幣價格合成「預期質素減自適應成本懲罰」;簡單請求更看重價格,難題則放寬成本懲罰、讓更強模型勝出。
  4. 執行與備援:回傳排序名單,先打第一名;若供應商無法服務,可落到下一合格模型。

長對話另有工作階段親和:以 cf-aig-session-id 標示會話,同一「輪」(用戶一則輸入及其工具呼叫跟進)內傾向鎖同一模型,以保住提示快取;跨輪才評估切換是否划算。回應標頭會帶出實際路由模型與原因(例如 cost_optimal_within_pool)。測試期 Auto Router 免費。

二、技術原理深度解析

官方把問題框在「參差的前沿」(jagged frontier):不同模型擅長點並不重疊,路由器的工作是在組合中為每件任務找「夠用且划算」的一款,而不是永遠押注最貴那一款。另一關鍵洞見是:表列代幣單價低,不代表軌跡總成本低——較便宜的模型可能消耗遠多得多的代幣才能完成同一任務,因此路由應最小化預測軌跡成本,而非只按「每百萬代幣美元」負載均衡。

快取經濟學亦被寫進決策:同輪內快取熱、切換少划算;跨輪則對切換施加隨上下文長度增長的懲罰——仍持有熱快取的模型按較便宜的快取讀取計價,其他候選則按重寫整段上下文計價。未來路線圖包括擴充模型池、納入零數據留存要求、考慮供應商容量、為請求選推理深度,以及計劃推出偏重最高質素、較不看成本的 cloudflare/auto-best。

這些設計與同日 Birthday Week 其他產品(例如以 HTTP 402 向 AI 代理按次收費的 Monetization Gateway)方向不同:Auto Router 針對的是組織內部推論支出的控制平面,而不是對外內容變現閘道。

四、日常應用場景

1. 開發者與技術團隊

代理編程環境(官方點名 OpenCode,並提及 Claude Code、Codex 等仍常由用戶手動選模)可把預設模型指到 cloudflare/auto,減少「為小改動燒 Opus」的習慣。開發者文件亦提供 OpenCode 外掛,方便查看每次實際選中的模型與路由原因。

2. 企業與隱私敏感行業

法律、金融、醫療等行業往往同時部署多供應商 API 金鑰與內部政策。Auto Router 把預算、身份感知用量與選模捆在同一閘道,有助把「看得見」升級成「自動省」。若合規要求數據不出境或零留存,仍需在閘道政策與模型池過濾上另行對齊——官方亦把零數據留存列為近期研究方向,現階段不可假設自動滿足所有香港私隱或客戶合約條款。

3. 一般用戶

終端用戶幾乎無感:介面仍是對話或編程助手,只是背後請求被導向較相稱的模型。簡單摘要、行程查詢與高風險程式重構,理論上會落在不同價位帶。

4. 香港與亞洲市場視角

香港企業近年大量試用 ChatGPT、Claude、本地代理與雲端閘道,帳單往往在「全公司預設最強模型」後急升。Auto Router 這類邊緣分類選模,對同時服務技術與非技術部門的中型機構尤其對口。亞洲多司法管轄區並存時,還可把允許的供應商/模型清單寫進閘道標頭(cf-aig-allowed-providers/cf-aig-allowed-models),作為採購與風險委員會可審查的控制點。

五、專業評價與潛在考量

優勢

  • 官方公開基準:在內部一般知識工作基準(九十七題、每模型三樣本、共二百九十一次試驗)中,cloudflare/auto 成功二百五十二次(約百分之八十六點六)、總成本約二點一美元、每次成功約零點零零八四美元;Claude Opus 5.5 約百分之九十六點六/五點九一美元;GPT‑6 Sol 約百分之八十四點二/二點六四美元。官方總結為相對 Sol 約八成成本、相對 Opus 約三成五成本,內部 OpenCode 路徑則稱相對純前沿組合最高約省三成。
  • 決策可解釋:任務類別與維度分數可檢查;新模型上架理論上只需更新評分權重,不必重訓整個分類器。
  • 測試期免費,降低試錯門檻。

需要留意的地方

  • 基準為 Cloudflare 內部模擬工作區任務,外推到個別行業工作負載仍須自測。
  • 公開測試功能與模型池可能變動;預設池與「額外模型」清單以開發者文件為準。
  • 選模優化不能替代資料主權、合約與提示外洩治理;高敏感場景仍應評估私有部署或受控微調管線。

結語

Auto Router 把「省 AI 錢」從靠員工自覺,變成閘道上的自動決策,切入點清晰:企業已把流量匯入 AI Gateway,下一步自然是讓閘道按任務能力與價格做路由。對香港正把代理編程與知識工作助手推上生產環境的團隊而言,這是可驗證、可觀測、且與預算委員會語言對得上的一步。

若貴司需要在香港落地私有或混合的企業 AI 管線——由數據集、QLoRA/LoRA 微調到私有 API,並把數據主權與成本治理一次設計好——可參考 YSK Limited 的企業私有 LLM 全託管(年費由港幣八萬八千元起,數據不出境):https://ysk.hk/services/ai-automation


參考來源

  1. Cloudflare 官方博客:Cut your AI spend with AI Gateway's Auto Router(2026-09-30)https://blog.cloudflare.com/auto-router/
  2. Cloudflare 開發者文件:AI Gateway — Auto Router(更新日期 2026-09-30)https://developers.cloudflare.com/ai-gateway/features/auto-router/

延伸閱讀 · 相關服務與產品