Aleph Alpha/官方:推出主權開源權重模型 Kolibri——德英 MoE 總參約七百八十億、活躍約三十億;上下文最長一百萬代幣;Apache 2.0;面向公共行政與工業航太

Key takeaway

德國 AI 公司 Aleph Alpha 於二零二六年十月三日(德國統一日)在官方網誌宣布開源權重模型 Kolibri:德英雙語 Mixture-of-Experts,總參數約七百八十億、每 token 活躍約三十億,上下文最長可至一百萬代幣,權重以 Apache 2.0 授權於 Hugging Face 公開下載。官方指模型面向公共行政、工業與航太等受規管場景,並強調訓練與部署鏈的主權可控。來源真實性已驗證。

Aleph Alpha/官方:推出主權開源權重模型 Kolibri——德英 MoE 總參約七百八十億、活躍約三十億;上下文最長一百萬代幣;Apache 2.0;面向公共行政與工業航太

德國 AI 公司 Aleph Alpha 於二零二六年十月三日(德國統一日)在官方網誌宣布開源權重模型 Kolibri:德英雙語 Mixture-of-Experts,總參數約七百八十億、每 token 活躍約三十億,上下文最長可至一百萬代幣,權重以 Apache 2.0 授權於 Hugging Face 公開下載。官方指模型面向公共行政、工業與航太等受規管場景,並強調訓練與部署鏈的主權可控。來源真實性已驗證。

本文整理官方技術細節、基準與部署方式,並討論對企業私有部署與香港/亞洲數據主權需求的啟示。

Aleph Alpha/官方:推出主權開源權重模型 Kolibri——德英 MoE 總參約七百八十億、活躍約三十億;上下文最長一百萬代幣;Apache 2.0;面向公共行政與工業航太

德國海德堡出身的 Aleph Alpha 在德國統一日發布新一代開源權重語言模型 Kolibri。公司官方網誌與技術報告寫明:Kolibri 為英德雙語 Mixture-of-Experts(MoE)Transformer,總參數約七百八十點一億、每 token 活躍約三十點四六億,支援最長約一百萬代幣上下文;完整權重已上架 Hugging Face(Aleph-Alpha/Kolibri-1),授權為 Apache 2.0。本文交叉核對官方網誌、技術報告摘要與 Hugging Face 模型卡,來源真實性已驗證。

一、核心發布:主權開源、受規管場景優先

官方定位

Aleph Alpha 將 Kolibri 定位為「主權開源權重」模型:一方面權重可下載、可自託管;另一方面公司強調由數據攝取、預訓練、後訓練到評估的全鏈可控,訓練基建位於德國與芬蘭,並在歐洲與德國法律框架下運作。目標垂直包括公共行政、工業與航太等「任務關鍵」場景,並強調客戶可在地部署,避免把內部數據送往第三方推論服務。

與前代 Kolibri Origin 的差距

官方披露內部迭代「Model Factory」:先以 Kolibri Origin(總參約三百億、活躍約三十億、最長約六萬五千上下文)驗證管線,Origin 預訓練於二零二六年六月十一日完成;Kolibri 預訓練於九月十一日完成,十月三日公開。三個月內參數由約三百億升至約七百八十億、訓練 token 由約七點五兆升至預訓練約二十兆(含 mid-training 與長上下文後合計約二十四兆),專家數由一百二十八增至三百八十四、活躍專家由八減至六,並引入 none/low/medium/high 四檔推理力度。

二、技術原理深度解析

MoE 與長上下文設計

Kolibri 以約百分之四點四的參數啟用率服務請求:總參約七百八十億、活躍約三十億,官方稱在英德品質與服務成本的帕累托前沿上與對比開源模型競爭。注意力層採滑動窗(五百一十二)與每五層一次全注意力的混合,以控制解碼計算量。長上下文路徑:預訓練十六 k → mid-training 六十四 k → 長上下文適應二百五十六 k,服務端可透過覆寫將最大長度推至約一百萬代幣。

預訓練使用七百六十八張 B200 GPU,約二十一天、約二十兆 token;官方稱訓練期間約三十八次非計劃中斷,由管線自動從最多約二百五十步前的檢查點恢復。路由採用精確分位負載均衡(exact quantile balancing)。

德語數據與雙語分詞

官方強調德語能力來自「有機德語」而非大量機器翻譯:預訓練 token 中德語約佔百分之二十一點三(約四點三兆),英語約百分之六十二、程式碼約百分之十四。德語來源包括自建 Common Crawl 德語管線、重寫(rephrase)與少量翻譯;並訓練英德雙語 UniBPE 分詞器,官方展示在德語網頁壓縮(bytes per token)上優於多個對比模型。

接地(Grounding)與 Merlin-Arthur

針對受規管客戶「寧可拒答、不可臆測」的需求,團隊以 abstention 樣本與自研 Merlin-Arthur 協議訓練:在上下文不足時傾向回答「我不知道」。官方公布 AA-Omniscience 非幻覺率約百分之四十四(Origin 約百分之十五),並提供內部 M/A grounding score 等指標。後訓練先經監督微調(合成與開源許可數據合計約二千六百八十億 token 量級的高質混合),再於逾一百二十萬內部策展任務上進行強化學習,涵蓋推理、工具呼叫、指令遵循、程式碼與檢索等。

公開基準(節錄,官方自測 harness)

官方表格顯示(取最高推理力度對比):AIME 2025 英語約九十六點九、德語約八十七點五;GPQA Diamond 英語約八十四點三、德語約八十一點三;LiveCodeBench v6 約八十五點九;HumanEval+ 約九十二點七。垂直代理基準方面,Honeypot 約八十點八,並在汽車供應商、半導體、德國公共部門、工業驅動、航太等內部客代評估上顯示相對 Origin 的大幅提升。讀者應注意:基準由官方自測,跨廠比較仍須獨立複現。

三、日常應用場景

1. 開發者與技術團隊

權重可自 Hugging Face 下載;推論需 aleph-alpha-inference(提供 Kolibri 的 vLLM 插件),或使用官方容器 ghcr.io/aleph-alpha/aleph-alpha-inference。範例指令為以 vllm serve Aleph-Alpha/Kolibri-1 啟用 reasoning/tool-call parser;超過約二十六萬 token 上下文時需加上 --max-model-len 與相關覆寫。建議採樣參數為 temperature 1.0、top_p 0.97、top_k 128。對本地閘道與 OpenAI 相容 API 工作流,開源權重可直接納入私有推論棧。

2. 企業與隱私敏感行業

官方賣點是「合規可繼承」:EU AI Act、GPAI Code of Practice、GDPR 與著作權考量被寫進訓練敘事;客戶可完全控制部署與知識產權邊界。金融、醫療、公務與製造若需德英雙語、長文件與拒答能力,MoE 低活躍參數有助控制機架成本。香港同樣受數據出境與行業保密約束的機構,可參考其「全鏈可控 + 開源可審」組合,而非僅依賴閉源 API。

3. 一般用戶

Apache 2.0 降低試用門檻,但七百八十億總參模型仍需足夠 GPU 記憶體與工程能力;一般消費者更可能透過託管商或精簡量化版本接觸。四檔推理力度方便在成本與品質間切換。

4. 香港與亞洲市場視角

歐洲「主權 AI」敘事與香港企業私有 LLM、數據不出境需求同向:重點不在品牌國籍,而在訓練透明度、部署自由與拒答/接地行為是否可驗證。對同時處理中英/歐亞文件的團隊,德英雙語專精未必直接取代中文主力模型,但可作為受規管跨境場景的補充,或作為評估開源 MoE 服務成本的對照基準。

四、專業評價與潛在考量

優勢

  • 開源權重 + Apache 2.0,便於私有部署與供應鏈審計。
  • 活躍參數約三十億,服務成本相對「同等公開基準表現」的更大活躍模型具競爭力(官方帕累托主張)。
  • 德語有機數據比例高、拒答/接地敘事完整,貼近公務與工業合規敘事。
  • 公開 Model Factory 與 Origin→Kolibri 迭代時間表,工程透明度高於許多僅發布權重的項目。

需要留意的地方

  • 基準為官方 harness;採購前應以自有語料與紅隊測試複核。
  • 主權敘事指訓練與法律管轄在歐,不等於自動符合香港或其他司法區的行業法規。
  • 一百萬上下文為架構上限,實際延遲、KV 快取與成本需按工作負載實測;長上下文品質可能隨任務變化。
  • 德語專精對香港中文主力場景需另做適配或與中文開源模型組合。
  • 推論依賴特定 vLLM 插件版本,升級與資安補丁節奏需納入運維計劃。

結語

Kolibri 把「可下載的開源權重」與「受規管產業的主權/接地敘事」綁在同一發布上,對正在比較閉源 API 與自託管開源棧的企業具參考價值。若香港機構希望以開源權重搭建私有推論、並要求數據留在本地可控環境,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境):https://ysk.hk/services/ai-automation 。本地 Hugging Face 權重亦可經 YSK Omni 等 OpenAI 相容閘道接入現有應用(產品詳情以官網為準)。


參考來源

  1. Aleph Alpha 官方網誌:Kolibri Has Landed: A Sovereign Open-Weight Model(2026-10-03)— https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/
  2. Aleph Alpha 技術報告 PDF:Kolibri: A Sovereign European Model on the Pareto Frontier — https://aleph-alpha.com/downloads/tech-report.pdf
  3. Hugging Face 模型卡:Aleph-Alpha/Kolibri-1(Apache-2.0)— https://huggingface.co/Aleph-Alpha/Kolibri-1
  4. PyPI:aleph-alpha-inference(Kolibri vLLM 插件)— https://pypi.org/project/aleph-alpha-inference/
  5. YSK Limited llms.txt(服務與公開價目核對)— https://ysk.hk/llms.txt

Related services & products