Microsoft/官方:推出 Microsoft-Decision-1 決策評分模型——Foundry 上架;三十六項基準最高準確度;較 GPT-6 Sol 快約三十五倍;輸入每百萬代幣約零點零四二美元

Key takeaway

微軟於二零二六年十月九日在 Command Line 官方技術網誌宣布推出決策評分模型 Microsoft-Decision-1,即日起可於 Microsoft Foundry 使用,並預告稍後經 OpenRouter 開放。官方稱該模型在三十六項基準比較中準確度最高,橫跨近十五萬道題;延遲量度較亞軍 Quyet-1.0-Large 快約四點五倍、較 GPT-6 Sol 快約三十五倍。來源真實性已對照微軟官方網誌核實。

Microsoft/官方:推出 Microsoft-Decision-1 決策評分模型——Foundry 上架;三十六項基準最高準確度;較 GPT-6 Sol 快約三十五倍;輸入每百萬代幣約零點零四二美元

微軟於二零二六年十月九日在 Command Line 官方技術網誌宣布推出決策評分模型 Microsoft-Decision-1,即日起可於 Microsoft Foundry 使用,並預告稍後經 OpenRouter 開放。官方稱該模型在三十六項基準比較中準確度最高,橫跨近十五萬道題;延遲量度較亞軍 Quyet-1.0-Large 快約四點五倍、較 GPT-6 Sol 快約三十五倍。來源真實性已對照微軟官方網誌核實。

對香港與亞洲企業而言,這代表「決策模型」不再只是創投敘事:雲端巨頭已把路由、分類、優先排序、核證與工作流控制,做成可直接嵌進代理與應用的結構化 API,並公開標出輸入代幣單價。

Microsoft/官方:推出 Microsoft-Decision-1 決策評分模型——Foundry 上架;三十六項基準最高準確度;較 GPT-6 Sol 快約三十五倍;輸入每百萬代幣約零點零四二美元

微軟 Office of the CTO 軟件工程副總裁 Achint Srivastava 於二零二六年十月九日在 Command Line 發表〈Introducing Microsoft-Decision-1, our model for fast decision-making〉。本文已核對該頁所列產品定位、基準描述、內部試用數字與定價;Foundry 型號目錄頁 Microsoft-Decision-1 回傳 HTTP 200。來源真實性已驗證。以下數字均屬微軟公開表述或內部基準聲明,並非獨立第三方審計。

一、核心事件:微軟把「決策模型」做成可上架產品

技術細節

按官方公開資訊,要點包括:

  • 產品名稱:Microsoft-Decision-1——定位為快速決策評分(decision-scoring)模型,與主攻長文生成或長鏈推理的大型語言模型(LLM)區隔。
  • 上架通道:即日起可在 Microsoft Foundry 使用;並稱即將經 OpenRouter 提供。
  • 典型用途:路由、分類、優先排序、核證(verification)與工作流控制,讓現有應用、代理與流程在「安全、可信」環境接入決策智能。
  • 基準聲明:在微軟進行的 三十六項基準比較中取得最高準確度,題目合計近 十五萬道,且基準對訓練保持盲測;延遲方面自稱量度最快——較亞軍 Quyet-1.0-Large 快約 四點五倍,較 GPT-6 Sol 快約 三十五倍(文中亦寫 P50 延遲約為 GPT-6 Sol 的約三十五倍)。
  • 定價(官方):輸入代幣每百萬約 零點零四二美元;輸出代幣免費。
  • 與同日產業敘事的關係:同日創投圈亦熱議 TypeSafe/Jev 等「決策模型」融資;Microsoft-Decision-1 屬微軟自有產品上架,實體與事件均不同,不宜與單一新創融資混為同一條新聞。

二、技術原理深度解析

官方把決策模型定義為:在固定答案選項下,為每個選項回傳校準後的機率分數,讓軟體可即時執行,而不是先生成長文再由應用層解析。

  1. 基底與訓練路線
    微軟稱以 Qwen3.5-9B 做後訓練(post-trained),面向單次通過(single-pass)決策評分;並預告稍後會改以其他模型為基底,包括 Microsoft AI(MAI)與 OpenAI 模型線。

  2. 輸出契約:給程式用的結構化決策
    支援是/否、多選、評分等級,以及對 AI 回覆與代理動作做評分規尺(rubric)打分;透過簡單結構化 API 呼叫。機率本身是 API 的一部分——應用可用置信度決定「立刻執行、暫緩,或要求人工覆核」。

  3. 為何強調速度
    官方舉例:若工作流有二十個相依決策,每步多一百毫秒,整體就多兩秒。決策模型若延遲偏高,代理編排很快變得不可用;這也解釋為何產品文案反覆對標 GPT-6 Sol 等通用模型的延遲。

  4. 泛化、穩健與安全

    • 泛化:除熱門開放榜(官方提及 JevBench 上的公開模型)外,另在三十六項公開與私有基準上比較,覆蓋路由、排序、長上下文、多語、分佈外、推理與安全等。
    • 穩健:對同一請求做八種擾動(改寫、選項重排等),Microsoft-Decision-1 平均僅約 百分之一點三 決策翻轉;選項描述改寫或選項反轉/洗牌時自稱零翻轉。
    • 安全:在十一項基準共 五千二百五十 個請求上測試有害內容、越獄與提示注入,稱能拒絕有害行為並保留可用性。
  5. 內部試用數字(均為微軟聲明)

    • Xbox Research:處理逾一萬則開放式回饋/評論並歸入固定主題——質素可與 GPT-6 Sol 競爭,速度快逾 十四倍、成本低約 二百倍。
    • Copilot 團隊:量度聊天與代理回覆質素——可與 GPT-5.6 Luna 競爭,速度快約 一百倍。
    • 事故應變:on-call 以 AI 從日誌、工單等檢索知識——稱決策模型較 LLM 更快更好。
    • Microsoft Discovery:自適應重規劃中,決策模型評分一致性約為 LLM 評分的 四十六倍,速度約 三倍,整體自適應重規劃近 四倍加速。

附錄點名對照模型包括 Quyet-1.0-Large、Surogate Rune、GPT-6 Luna Decisions、deck-31B、H2O-Lightning-4B、Strands-Decider 2B 等,讀者應理解這是供應商自選對照組。

四、日常應用場景

1. 開發者與技術團隊

把 Microsoft-Decision-1 當成「閘門函式」:代理下一步是否繼續/停止/重試/交人;依質素、成本、延遲做模型路由;用 skill 規則選動作;對程式碼或內容做政策分類。優先建立契約測試、置信度閾值,以及模型升級時的回歸集——官方亦強調擾動穩健性,正好對應生產環境指令與選項經常改寫的現實。

2. 企業與隱私敏感行業

客服意圖分析、事件分級與路由、資料驗證(接受/拒絕/標記覆核)、內容過濾、安全篩查等高頻短決策,適合低成本結構化模型。金融、醫療與政府場景仍須保留合資格人員覆核與審計日誌;勿假設「快且便宜」等於可免除法定把關。若輸入含客戶識別資訊,還須評估資料駐留與供應商處理位置。

3. 一般用戶/業務營運

終端用戶未必直接呼叫 Foundry,但會感受到應用更快完成「通過/拒絕/下一步」。業務單位應向 IT 索取每千次決策的估計成本與誤判率,並設定「低置信度必人工」規則,避免代理自動鏈在錯誤決策上越跑越遠。

4. 香港與亞洲市場視角

香港金融科技、電商風控與內部 IT 工單系統,天然有大量分類與路由決策。若團隊需要在本地落地可審計的私有模型與自動化管線(資料不出境、自管 API),可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境):https://ysk.hk/services/ai-automation

五、專業評價與潛在考量

優勢

  • 一級來源為微軟官方產品網誌,並附 Foundry 型號目錄連結與明確輸入單價,企業可立刻做成本試算。
  • 產品假設清楚:結構化選項+校準機率,對代理控制面與工作流閘門可操作。
  • 公開討論穩健性(擾動翻轉率)與安全基準,比純「更快更便宜」口號更接近生產關注點。

需要留意的地方

  • 三十六項基準「最高準確度」、對 GPT-6 Sol/Quyet 的倍數,以及 Xbox/Copilot/Discovery 內部倍數,皆為微軟自測聲明;換工作負載後不可直接外推。
  • 基底目前公開為後訓練的 Qwen3.5-9B,企業採購應確認授權、資料處理區域、SLA,以及後續改掛 MAI/OpenAI 基底時的行為漂移。
  • 「輸出免費」改變帳單結構,但仍需防範高頻呼叫造成輸入量暴衝(Jevons 效應同樣適用於便宜決策 API)。
  • 決策模型不能取代長文推理、程式碼生成或需開放式回答的任務;正確用法是與 LLM/代理編排互補,而非單一模型通吃。

結語

Microsoft-Decision-1 把「決策模型」從賽道敘事推進到可訂閱的雲端目錄:有結構化 API、有公開單價、有對延遲與穩健性的產品主張。對正在組裝代理工作流的團隊,下一步應是選定三至五個高頻閘門場景做 A/B,同時量度誤判成本與人工覆核負荷。若香港企業希望把類似決策/分類能力留在自管環境、並串起資料集到私有 API 的完整管線,可從 YSK Limited 企業私有 LLM 全託管入手:https://ysk.hk/services/ai-automation


參考來源

  1. Microsoft Command Line(官方):Introducing Microsoft-Decision-1, our model for fast decision-making — https://commandline.microsoft.com/microsoft-decision-1-model-foundry/(2026-10-09)
  2. Microsoft Foundry 型號目錄:Microsoft-Decision-1 — https://ai.azure.com/catalog/models/Microsoft-Decision-1
  3. (對照/非本篇主體)Hugging Face/Ai2:Impactful scheduling for GPU clusters — https://huggingface.co/blog/allenai/impactful-scheduling
  4. (對照/非本篇主體)Meanwhile 官方新聞稿:$37.5M funding — https://meanwhile.bm/press/releases/2026_10_08_funding/

Related services & products