Amazon Web Services 透過 Strands Labs 於二零二六年十月一日推出開源決策模型 Strands Decider 2B,約二十億參數,可在本地 CPU/GPU 以毫秒級完成封閉選項評分與校準信心分數。官方連同權重、訓練資料與腳本一併公開。來源真實性已驗證。
決策模型不生成任意文字,而是在預設選項中作選擇並給出分數,適合代理工作流中的路由、工具選取與動作審核。對香港企業而言,可把昂貴前沿大模型留給難題,把高頻例行判斷下放至可本地部署的小型決策層。
Amazon/AWS/官方:推出開源決策模型 Strands Decider 2B——約二十億參數本地推論;毫秒級選項評分;完整訓練資料公開
Amazon Web Services(AWS)於二零二六年十月一日經 Strands Agents 官方部落格宣布,以 Strands Labs 名義開源釋出決策模型 Strands Decider 2B。來源真實性已驗證:對照官方技術說明與 TechCrunch 報導,產品定位、架構描述與延遲數字一致。該模型屬近年興起的「決策模型/System One」路線——繼 TypeSafe AI 的 Jev,以及同日 Cloudflare 等業者跟進之後,AWS 以可本地運行、連訓練配方一併公開的方式切入同一賽道。
一、核心事件:為代理工作流加一層「毫秒級裁判」
技術細節
官方說明,決策模型不像一般大型語言模型(LLM)可任意生成文字,而是在給定選項集合中作選擇(例如是/否、哪個團隊接手),並可輸出簡單數值分數(例如情緒介乎零至一)。換取靈活性之後,換來同尺寸下更快、必定落在選項內的答案,以及極低延遲。
Strands Decider 2B 約二十億參數,官方指可在本地 CPU 或 GPU 運行,對有意義問題的回答可達數十毫秒級。官方公布在常見硬體上的中位延遲約為:NVIDIA RTX 3090 約一百一十五毫秒;Apple M3 MacBook 小任務約一百五十三毫秒。延遲大致隨任務 token 規模近似線性上升。
AWS 傑出工程師 Marc Brooker 向 TechCrunch 表示,靈感來自與客戶討論代理工作流時發現:並非每一步都需要完整前沿 LLM 的能力與成本;決策模型適合充當「接下來該做什麼」的工作流步驟,並因信心分數與封閉答案域而更易結構化、延遲與成本也可能更低。
二、技術原理:拿掉文字頭、換成指標頭
官方架構:以預訓練 LLM「軀幹」Qwen3.5-2B 為基礎,移除負責文字生成的 LM head,改以指標頭(pointer head)對各選項位置的隱藏狀態與答案標記位置評分;該頭參數僅逾約一百萬。軀幹以 rank-16 LoRA 適配器微調。官方稱本次釋出為多次迭代後的 v19 版本,並在倉庫公開各版變更軌跡。
評估方面,官方以第三方基準 JevBench 公開集量測準確度,並以 Brier 分數檢視校準。官方稱在約二十億參數級別中名列第三十三名中的第三,若排除略大於二十億參數的模型則在三十名中居首。官方強調複雜推理仍遠不及推理型大模型;亦因不能生成文字,不適合作編碼、聊天或文件摘要等常見 LLM 任務。
使用入口方面,官方示範以 pip install strands-decider 安裝 CLI,並提供與 Strands agent 整合、在工具呼叫前以決策模型審核「參數是否有用戶事實依據/是否過早呼叫工具」的範例。權重放上 Hugging Face,程式與訓練資料/腳本在 GitHub;公開套件資料標示採 Apache 2.0。
三、日常應用場景
1. 開發者與技術團隊
可用於模型路由、工具選取、評估、護欄、記憶與上下文管理、政策分類等「高頻但選項封閉」的步驟;亦可與固定工作流語言組合成混合管線,把最難決策留給 LLM、把例行判斷交給決策模型以降本加速。
2. 企業與注重合規的行業
本地可跑、配方可審計,有利於金融、法律、醫療等希望把審核邏輯留在可控環境的機構。官方/報導亦指目前以開源模型為主、暫無託管按次 API 收費敘事,企業需自備硬體或雲端算力;上線前仍應以自身資料做校準與紅隊測試。
3. 一般用戶/初創團隊
小型團隊可在筆電實驗代理護欄與路由,毋須一開始就負擔大型模型 API 帳單。惟決策模型只回答「選項內」問題,產品文案、客服對話與長文生成仍需搭配生成式模型。
4. 香港與亞洲市場視角
香港金融科技與企業 IT 正大量試行 AI 代理處理工單分流、合規檢查與內部知識問答。Strands Decider 這類可本地部署的決策層,有助在個人資料出境敏感的場景,把「是否呼叫外部工具/是否升級人工」留在境內算力。亞洲多語環境下,官方亦提醒微調時須在準確度與語言/常識能力之間取平衡,避免為刷基準而削弱多語理解。
四、專業評價與潛在考量
優勢
- 官方技術稿+主流科技媒體交叉驗證,數字與架構敘事清晰。
- 開源連同訓練資料與腳本,可複現、可自訓,與僅提供 API 的決策服務形成差異。
- 延遲與成本結構適合塞進每一步代理動作的審核路徑。
需要留意的地方
- 與 Cloudflare Clef 等屬同一「決策模型熱潮」,但交付形態不同(本地開源權重 versus 邊緣託管);企業應按資料主權、維運能力與延遲預算選型,而非視為同一產品。
- JevBench 任務數有限,官方/社群文件亦提醒單次分數差異不宜過度解讀。
- 不能生成文字、不善複雜推理;誤用為通用聊天模型會失望。
- TypeSafe 創辦人向 TechCrunch 表示,目前一批跟風實作未必等同「真正好用的智能」,校準與實務智慧仍是門檻。
- 同週 OpenAI 亦透露類似 Decisions API 方向,類別競爭激烈,介面與生態可能快速洗牌。
結語
Strands Decider 2B 顯示:代理系統不一定每一步都要燒最貴的前沿模型——把封閉選項的判斷拆成可本地、可審計、毫秒級的決策層,正成為二零二六年代理工程的主流選項之一。香港企業若要在私有資料與合規邊界內組裝類似「大模型+決策模型」混合代理,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,數據不出境)(https://ysk.hk/services/ai-automation)。若同時需要把代理能力嵌進內部 App 或 ERP/工單流程,亦可了解香港 APP 開發服務(https://ysk.hk/services/app-development)。
參考來源
- Strands Agents 官方:Introducing Strands Decider 2B: a small, open source, decision model — https://strandsagents.com/blog/introducing-strands-decider/
- TechCrunch:Amazon releases its own Jev clone as decision models flood the web — https://techcrunch.com/2026/10/01/amazon-releases-its-own-jev-clone-as-decision-models-flood-the-web/
- PyPI:strands-decider(套件與授權標示)— https://pypi.org/project/strands-decider/
- VentureBeat:Amazon unveils … Strands Decider 2B…(Apache 2.0/開源定位旁證;本機直連曾 429)— https://venturebeat.com/technology/amazon-unveils-a-free-fast-open-source-jev-killer-strands-decider-2b-makes-decisions-in-fractions-of-a-second