Cloudflare/官方:Clef-omni 全模態決策上線——音訊視像一次評分;Clef-flash 降至約三點八美分/百萬代幣,Clef 中位加快約一點七至兩倍

Key takeaway

Cloudflare 於二零二六年十月九日宣布,決策模型系列新增全模態 Clef-omni,可在單一 API 呼叫同時處理文字、圖像、音訊與視像;並將 Clef-flash 託管價由每百萬輸入代幣約九美分降至約三點八美分,同時以服務層優化讓 Clef 中位延遲加快約一點七至兩倍。

Cloudflare/官方:Clef-omni 全模態決策上線——音訊視像一次評分;Clef-flash 降至約三點八美分/百萬代幣,Clef 中位加快約一點七至兩倍

Cloudflare 於二零二六年十月九日宣布,決策模型系列新增全模態 Clef-omni,可在單一 API 呼叫同時處理文字、圖像、音訊與視像;並將 Clef-flash 託管價由每百萬輸入代幣約九美分降至約三點八美分,同時以服務層優化讓 Clef 中位延遲加快約一點七至兩倍。

官方強調 Clef 家族並非生成長文的大型語言模型,而是對結構化問題直接輸出校準機率與選項分數,兼容既有 Jev/System One API。來源真實性已對照 Cloudflare 產品博客、Workers AI 更新日誌與模型文件核實。

Cloudflare/官方:Clef-omni 全模態決策上線——音訊視像一次評分;Clef-flash 降至約三點八美分/百萬代幣,Clef 中位加快約一點七至兩倍

二零二六年十月九日,Cloudflare 於官方博客與 Workers AI 更新日誌宣布:繼上周推出開源決策模型 Clef 與 Clef-flash 之後,再發布 Clef-omni,在文字與圖像之外原生接受 WAV/MP3 音訊與 MP4/WebM 視像;同時把託管版 Clef-flash 價格由每百萬輸入代幣 0.09 美元降至 0.038 美元(官方稱已低於競品 Jev),並以服務基礎設施優化讓 Clef 在約八百、三千四百、一萬六千代幣輸入規模下,中位延遲分別約加快 1.7×、2.0×、1.7×。本文已核對官方原文要點,來源真實性已驗證。

一、核心事件:決策模型進入「看、聽、讀」同一請求

技術細節

按產品博客,決策模型自 TypeSafe 的 Jev 登場以來,多數仍以文字為主;初代 Clef 已支援圖像與視像幀陣列,但 Clef-omni 可把音訊與完整視像檔一併送入,避免「語音轉寫 → 影音拆軌 → 再交文字決策模型」的級聯管線。

官方公開的可核對要點包括:

  • 模型識別:Workers AI 模型 ID @cf/cloudflare/clef-omni;請求內 model 選擇器為 clef-omni。
  • 骨幹:建基於 Qwen3-Omni-30B-A3B-Instruct 混合專家(MoE)理解骨幹;文件描述為約 三百億參數、啟用約三十億;捨棄文字轉語音輸出路徑,專注評分而非生成散文。
  • 輸入上限(模型頁):最多 4 張圖、4 段音訊、2 段視像;音訊單段最長約 300 秒、視像單段最長約 60 秒;遠端 URL 不接受,須以 base64 data URL 嵌入。
  • 上下文:託管 Clef-omni 與 Clef 為 64k;託管 Clef-flash 為配合降價改為 24k(官方稱僅約 0.24% 請求超過 24k);Hugging Face 權重仍標示可自建更高上下文(flash 權重敘述可至 256k)。
  • 定價(每百萬輸入代幣):Clef-flash 0.038 美元、Clef-omni 0.15 美元、Clef 0.24 美元;決策模型不按輸出代幣計費;圖像/音訊/視像會換算成輸入代幣。
  • 延遲(產品博客自述):純文字決策中位約 130 毫秒;含圖像約 150 毫秒;音訊約數百毫秒;約 21 秒含聲視像約 1.5 秒完成評分。Workers AI 更新日誌另列更快數量級數字,實際以線上文件為準。
  • Clef 加速表(服務層、權重不變):約 800 tokens 中位 262→152 ms(約 1.7×);約 3,400 tokens 616→305 ms(約 2.0×);約 16,000 tokens 2,721→1,635 ms(約 1.7×)。官方指部分優化來自改用 SGLang 服務(預計納入 SGLang 0.5.22)。

開源權重繼續放上 Hugging Face;API 維持與 Jev/System One 兼容,亦可經 AI Gateway 切換模型 ID。

二、技術原理深度解析

Clef 系列的核心主張,是把「分類/路由/嚴重度評分」從「先叫 LLM 寫一段再解析 JSON」改成 schema 約束的一次評分:請求帶上 state(狀態)與最多六十四條 typed questions(如 noul 是否題、choice 多選、score 等級),模型對每個合法選項輸出機率,供程式直接分支,而不是再解析自由文字。

Clef-omni 在此之上把多模態媒體映射進同一序列:官方描述先做完整 payload 的 prefill,再以兩階段注意力把各選項對文字片段、畫面與音訊證據做匯聚,最後交叉注意力產出校準分數;訓練上凍結 Qwen3 骨幹、以 LoRA 適配,並結合標籤平滑交叉熵與 Brier score 校準。結果是:不必為每個通道各開一個專用小模型,也能在同一契約下做「標籤是否可見、運轉聲是否異常、風扇是否轉動」這類跨模態核對。

計費與上下文也反映媒體成本:模型頁指出圖像經縮放後以約 32×32 patch 計 token(每圖最多約 1,024 token);音訊約每分鐘 780 token;視像在最高解析度下可達約每分鐘 15,400 frame token,另加有聲軌約每分鐘 780 token。這對香港企業評估「邊緣巡檢/客服錄音/短片合規」的單位成本有直接意義。

四、日常應用場景

1. 開發者與技術團隊

若代理工作流需要「讀工單 + 看截圖 + 聽通話錄音」再決定升級哪一隊,可把多模態輸入一次交給 Clef-omni,減少自建 ASR/caption 鏈。Jev 兼容意味著既有 System One 客戶端多半只需改模型 ID。自建場景可下載開源權重,並留意官方公布的 SGLang 啟動方式。

2. 企業與隱私敏感行業

Cloudflare 內部用例包括:公開 GitHub 文件庫以 Clef 偵測並關閉垃圾議題、內容系統稽核外掛釣魚、DLP 掃描政府證件等 PII、威脅情報輔助惡意網域判斷。金融、保險、醫療若要把類似決策留在可控邊界,可評估 Workers AI 託管與自建權重兩條路;香港對數據出境敏感的機構,更應把「媒體是否上傳公有端點」寫進架構審查。

3. 一般用戶

一般消費者不會直接「安裝一個 Clef」,但會間接受惠於更快的垃圾內容審核、客服分流與釣魚偵測。產品本質仍是企業/開發者 API,不是面向大眾的聊天機械人。

4. 香港與亞洲市場視角

香港中小企與金融科技團隊已大量把客服錄音、店舖 CCTV 短片、維修現場照片納入營運系統。全模態決策模型降低「先請人聽完再標籤」的人力成本,但也提高對音訊/視像留存、同意書與跨境傳輸的合規要求。亞洲市場同時面對 TypeSafe Jev 生態融資升溫與開源決策模型價格戰;Cloudflare 以邊緣託管 + 開源權重雙軌,對已使用 Workers/AI Gateway 的團隊切換成本較低。

五、專業評價與潛在考量

優勢

  • 官方同日給出模型 ID、定價表、上下文取捨、加速對照表與多項基準數字,產品可核對性高。
  • 全模態單一請求切中代理式系統真實痛點;價格下調與加速回應「決策要夠便宜才能處處呼叫」的市場壓力。
  • 與既有 Jev API 兼容,降低遷移摩擦;開源權重保留自建與私有化選項。

需要留意的地方

  • 基準多為 Cloudflare 自報;PhishNChips 等項目上 Clef-omni 並非全面領先 Clef/Clef-flash,選型仍須按任務回歸測試。
  • 託管 Clef-flash 上下文縮至 24k 是降價的明確取捨;長上下文應改用 Clef 或自建。
  • 產品博客與更新日誌對 Clef-omni 延遲數量級表述不完全一致,上線前應以 Workers AI 即時文件與自身區域探測為準。
  • 媒體 token 成本可使「看似便宜的每百萬代幣價」在長視像場景快速累積;需按分鐘級用量建模。

結語

Clef-omni 把 Cloudflare 決策模型系列推到「文字+圖像+音訊+視像」同一契約,並以 Clef-flash 降價與 Clef 服務層加速回應規模化呼叫的成本與延遲壓力。對香港企業而言,重點不只是多一個模型名稱,而是能否把審核、分流、巡檢與威脅分類做成可測試、可校準的程式介面。若貴司需要在本地或私有環境部署類似決策/領域模型,可參考 YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation;年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,強調數據不出境);若要在自有機器跑 Hugging Face 開源權重並提供 OpenAI 兼容介面,亦可了解 YSK Omni(https://ysk.hk/products/ysk-omni)。


參考來源

Related services & products