Liquid AI 於二零二六年十月七日公開開源權重決策模型 d1-3B 與實驗版 d1-omni-600M:不生成代幣,單次前向傳播即輸出校準答案。d1-3B 在 Decision Index v0.2.1 公開分取得 48.57,高於所有十億參數以下模型,並略勝參數約十二倍的 Decider 35B-A3B(47.11);NVIDIA Jetson AGX Thor 單題延遲約十六毫秒,RTX 4090 約八毫秒。
不同於聊天模型,d1 面向路由分流、內容審核、代理護欄與視覺檢查等「要答案、不要長文」場景,權重已上架 Hugging Face,並宣稱支援 llama.cpp。來源真實性已驗證。
Liquid AI/官方:開源邊緣決策模型 d1-3B 與 d1-omni-600M——Decision Index 48.57 逼近十二倍參數對手;Jetson Thor 單題約十六毫秒
美國新創 Liquid AI 在二零二六年十月七日官方博客與 Hugging Face 同步發布 open d1 系列:旗艦 d1-3B(約三十一億參數)與實驗級 d1-omni-600M。兩者屬「決策模型」而非生成式語言模型——輸入狀態與一組結構化問題後,於單次前向傳播內回傳是非機率、具名選項或有序評分,輸出代幣數為零。本文交叉核對 Liquid AI 官方說明、Hugging Face 模型卡與同日技術博文,來源真實性已驗證;文中數字均來自官方披露,並標明評估條件。
本文梳理架構差異、基準與延遲數字、企業落地場景,以及對香港/亞洲私有部署與邊緣閘道的啟示。
一、核心事件:開源「決策模型」進入邊緣硬體
技術細節
Liquid AI 指出,生成式 Liquid Foundation Models(LFM)會產出代幣;d1 決策模型則「一次前向、直接作答」。兩款模型骨幹不同:
- d1-3B:由最新視覺語言模型 LFM2.5-VL-3B 後訓練而來(解碼器架構),接受文字與圖像;模型卡列總參數約 3.12B、上下文 32,768 token、視覺編碼器為 SigLIP2 NaFlex(約四億參數)。
- d1-omni-600M:由雙向編碼器 LFM2.5-Encoder-350M 出發,再分期接入視覺與音訊編碼器;同一請求可接受「文字+圖像」或「文字+音訊」,屬早期研究發布,官方暫不公布其延遲數字。
問題格式對齊 Decision Index schema,常見三類:noul(是/否機率)、choice(具名選項)、score(二至十級有序評分)。一次呼叫可對同一狀態掛多個具名問題,狀態只讀一遍。官方並展示十個即時鏡頭演示(Hugging Face Space「System One Arcade」),以及與 NVIDIA 合作、於 Isaac Sim 硬體迴路中由 Jetson 託管 d1-3B 導航的示範。
權重已可下載:LiquidAI/d1-3B、LiquidAI/d1-omni-600M。官方強調 open-weight、可微調與部署,並稱對 llama.cpp 有 day-one 支援(含 Apple、AMD、Qualcomm、NVIDIA/NVFP4)。載入需 transformers>=5.14 且 trust_remote_code=True。
二、技術原理深度解析
決策模型把「判斷」從生成流水線拆出:不依賴長鏈思維或逐 token 解碼,而是把狀態編碼後直接映射到校準輸出。對企業系統而言,這對應三類既有痛點:
- 延遲預算:客服分派、閘道審核、代理護欄往往要求十至數十毫秒級回應;生成式小模型即使量化,仍受解碼步數拖累。
- 輸出可控:是非/選項/評分比自由文字易接入規則引擎與稽核日誌;模型卡亦寫明回傳結構含
answers與usage(output_tokens: 0)。 - 多模態同一狀態:d1-3B 可把圖像納入狀態;d1-omni-600M 進一步嘗試音訊,惟官方坦言專用音訊決策基準仍屬開放問題,Decision Index v0.3 的視覺分亦不公開,故文中不以未披露數字作宣稱。
基準方面(官方博客表一/模型卡):d1-3B 在七項公開文字任務平均約 82.9,高於表中 Decider 4B(81.1);d1-omni-600M 平均約 78.4,參數約為 Decider 2B 的四分之一卻高於其 77.1。Decision Index v0.2.1 公開分:d1-3B 為 48.57,Decider 35B-A3B 為 47.11(官方稱約十二倍參數規模)。視覺面,模型卡指 d1-3B 在十一項公開圖像基準平均 74.1,接近骨幹 LFM2.5-VL-3B 的 73.9;去掉圖像後同分題僅約 45.1,顯示答案依賴視覺輸入。
延遲(暖機、單請求、官方與 NVIDIA 合作量測):d1-3B 單題約 8 ms(RTX 4090)、9 ms(AMD MI325X)、16 ms(Jetson AGX Thor)、26 ms(Jetson AGX Orin 64 GB)、30 ms(Apple M5 Pro)、50 ms(Jetson Orin Nano)。三題同狀態在 Thor 上由 16 ms 僅升至約 20 ms(約 1.3 倍)。384 像素圖像在 RTX 4090/MI325X 均低於約 18 ms。打包 64 個狀態時,RTX 4090 吞吐約 475/秒、MI325X 約 1,106/秒、Thor 約 262/秒。d1-omni-600M 在同一 Decision Index 公開分為 15.95,定位為體積優先的實驗檢查點。
須留意:不同頁面個別文字基準小數位略有出入(例如博文與模型卡部分列),本文以 Liquid 官方博客與 d1-3B 模型卡為準;Decision Index 列為官方以正式 scorer 自評,並非提交排行榜的聲明。
三、日常應用場景
1. 開發者與技術團隊
適合把「LLM-as-a-judge、重排、抽取核對、意圖分類」從生成路徑改為單次決策呼叫,降低成本與抖動。示例流程:客服工單一次問退款意圖、負責團隊與緊急度;或對鏡頭幀做手勢/內容標籤。批次 API(system_one_batch)可無 padding 打包多請求,利於閘道服務。
2. 企業與隱私敏感行業
銀行、保險、醫療與法律場景常要「可審計的結構化判斷」而非散文建議。開源權重意味可在專有網路或本機推論,配合零資料出站政策。代理(agent)護欄——例如是否允許呼叫外部工具、是否涉及敏感個資——亦可放在生成模型之前,形成廉價、低延遲的第一道關。
3. 一般用戶與產品團隊
Arcade 演示顯示即時審核與互動遊戲可跑在消費級/邊緣硬體;對新創而言,可用較小參數換取可預測延遲,把大模型留給真正需要生成的步驟。
4. 香港與亞洲市場視角
香港金融、零售與物流大量使用邊緣閘道、門市鏡頭與客服中台。毫秒級決策模型可部署於分行/倉儲的 Jetson 或工作站 GPU,減少把原始音視訊送上公有雲的合規摩擦。粵語/多語客服若仍倚賴大型生成模型,可用 d1 做前級分流與升級策略;阿拉伯語 ASR 等其他開源發布可並行評估,但與本則 d1 無直接替代關係。對須數據留港的機構,開源權重+本地閘道比純 API 決策服務更易通過內部資安審查。
四、專業評價與潛在考量
優勢
- 公開硬數字:Decision Index、多平台延遲與吞吐表完整,利於採購比較。
- 真正開源權重,可私有微調與離線部署;與僅雲端評分 API 形成差異。
- 與生成式堆疊互補:適合護欄、分流、審核,而非取代聊天/寫作模型。
- 邊緣友好:Orin Nano 單題約 50 ms,覆蓋「即時足夠」門檻。
需要留意的地方
- d1-omni-600M 仍屬實驗發布,音訊決策基準未成熟,不宜直接當生產 SLA 依據。
- 需
trust_remote_code,上線前應審視隨模型分發的自訂程式碼供應鏈風險。 - 決策模型「不作長文」:產品文案、調查報告、複雜推理仍要生成模型或人類。
- 與微軟 Foundry 上的 Microsoft-Decision-1 等雲端決策評分屬不同產品線——後者走託管/計費;d1 走開源邊緣。勿把基準分數跨廠商直接等同。
結語
Liquid AI 把「決策」從生成式 AI 中拆出,並以可下載權重加上 Jetson/RTX 級延遲證明,邊緣與本機閘道已能承載結構化判斷。對香港企業而言,這條路徑有助於在代理自動化加速之際,先把高頻、低延遲、可稽核的關卡放在私有環境。若團隊正評估本機 Hugging Face 模型閘道或企業私有 AI 流水線,可參考 YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation),以及本機 HF 模型閘道 YSK Omni v1.0.2(https://ysk.hk/products/ysk-omni)。
參考來源
- Liquid AI 官方:Open d1: Edge decision models for text, vision, and audio(2026-10-07)— https://www.liquid.ai/blog/d1-open
- Hugging Face 模型卡:LiquidAI/d1-3B — https://huggingface.co/LiquidAI/d1-3B
- Hugging Face 模型卡:LiquidAI/d1-omni-600M — https://huggingface.co/LiquidAI/d1-omni-600M
- Hugging Face Blog(發現來源):Multimodal open d1 decision models for the edge — https://huggingface.co/blog/LiquidAI/open-d1
- Hugging Face RSS(發現來源):https://huggingface.co/blog/feed.xml