德国 AI 公司 Aleph Alpha 在 10 月 3 日发布并开源了新模型 Kolibri:总参数 781 亿的 MoE(Mixture-of-Experts,混合专家架构),每个 token 只激活约 34.6 亿参数,权重以 Apache 2.0 协议挂在 Hugging Face 上,发布当天即可下载。训练从零开始,在德国和芬兰的基础设施上完成,全流程受欧盟与德国法律约束。这是欧洲主权 AI 阵营迄今最重要的一次开源动作。

781 亿参数,每个 token 只干活 34.6 亿
Kolibri 的基本盘是一组数字。总参数 78,103,074,560,每 token 激活 3,457,573,120,激活比例 4.4%。模型共 50 层,每层配 384 个专家外加 1 个所有 token 都要经过的共享专家,路由器为每个 token 从 384 个里挑 6 个。
这就是 MoE 架构的标准玩法:稠密模型里每个 token 都要穿过全部参数,MoE 把每一层拆成一群小网络,让路由器按 token 挑选。效果是计算量按 35 亿参数的模型走,容量按 780 亿参数的模型算。代价也写在 model card 里:虽然每个 token 只激活一小部分参数,但全部 781 亿参数必须同时驻留显存,权重以 FP8 精度计约 78 GB。最低部署门槛是 2 张 80GB 的 A100/H100,或者单张 H200/B200。
推理成本看激活参数,显存看总参数,这笔账在选型时要分开算。
UniBPE 分词器:德语省 15% token
Kolibri 只做德语和英语两种语言,model card 称这是"深度优先于广度的刻意选择"。为德语下的功夫首先体现在分词器上。
德语把词粘成长复合词,比如德国联邦宪法法院的德语名 Bundesverfassungsgericht。主流分词器的词表主要从英语语料学来,遇到这种长词只能切成碎片:GPT-5 使用的 o200k_base 分词器把它切成 6 段(Bund | es | ver | fass | ungs | gericht),Kolibri 的分词器切成 2 段(Bundes | verfassungsgericht)。
Kolibri 的分词器词表 128,000 token,用一种名为 UniBPE 的新算法训练:保留字节对编码(BPE)自底向上的合并流程,但每一步合并改用 Unigram 目标的评分规则来挑选,让切分方式尊重德语的构词法。Aleph Alpha 的技术报告给出,对德语文本它比 GPT-5 的分词器少用 11.2% 的 token,是同期对比的 9 个分词器里最好的。
工程师 Tejas Kumar 用德国基本法(185 KB 的德语法律文本)实测了 6 个分词器:Kolibri 用 135,190 个 token,GPT-5 的 o200k_base 用 159,000 左右,比 Kolibri 多 17.9%;对齐到同一文本,Kolibri 在德语法律文本上比 GPT-5 少用约 15% 的 token,英语侧两者打平。更少的 token 意味着读写同样的德语文本步数更少,同样的上下文窗口能装下更多德语内容,对按 token 计费的 API 场景就是直接的成本差。
滑动窗口注意力撑起百万 token 上下文
Kolibri 原生上下文 262,144 token,可扩展至 1,048,576,即 100 万 token。撑起这个数字的是注意力层的分工:50 层里 40 层用滑动窗口注意力(SWA),每个 token 只看它前面 512 个 token;每 5 层有一个全注意力层,看全部历史。SWA 与 GQA(分组查询注意力)的比例为 4:1。
这里有个值得展开的细节:只有滑动窗口层带旋转位置编码(RoPE),全注意力层不感知 token 的绝对位置。于是上下文长度超过训练时的 262,144 也不需要任何位置外推技巧,原则上可以无限拉长。Aleph Alpha 验证到 1,048,576:在 RULER 长上下文测试的 100 万 token 档位,Kolibri 基座模型得 63.2 分,对比模型 Qwen3.5 35B-A3B 的基座为 57.5 分。
代价在中段:128,000 token 档位上 Qwen3.5 基座拿 89.9 分,Kolibri 只有 67.9 分。滑动窗口结构在超长上下文的末端占优,中段反而吃亏,选型时按实际文档长度判断。
用德语思考的推理模型
推理模型在回答前会先生成思考过程,即便提问是德语,模型 interne 的思考语言也多半是英语。Aleph Alpha 在 9 月 24 日的博客里公开过这个坑:他们先做了个实验,往模型里混入少量德语推理数据,德语数学成绩从 70.2 跌到 48.3,因为模型的德语思考过程反复绕圈无法收敛;把德语推理数据加到足够大的量级后成绩才回升到 67.3。
Kolibri 吃满了这批数据:8 万个德语推理样本之外又加了大量同分布数据,最终在德语提问上直接用德语推理。成绩是 AIME 2025 德语版 87.5 分,在 30 亿级激活参数的模型里排第一,次名 NVIDIA Nemotron 3 Nano 为 84.4 分。英语版 AIME 2025 更高:96.9 分,超过了对比表里所有 MoE 模型,包括激活参数是它 4 倍的 Nemotron 3 Super 120B-A12B(91.7 分)。
每个请求还可以显式设置 reasoning_effort 为 none、low、medium 或 high 四档,同一个模型同一个服务实例,简单查询直接出答案,难题切到长思考。
训练它说"我不知道"
幻觉治理是 Kolibri 另一个重点,用的是自家方法 Merlin-Arthur 协议。机制是一个三人博弈:Arthur 是模型本人,拿到一份被遮挡的支撑文档和问题;Merlin 的目标是遮挡后正确答案仍可推出,Arthur 被训练成在这类情况下给出答案;Morgana 的目标是把关键证据藏掉,Arthur 被训练成在这类情况下回答"不知道"。Arthur 不知道对面站的是 Merlin 还是 Morgana,唯一的取胜策略是真正检查眼前的证据是否支撑答案。
这个训练的直接产出是弃答率。在 Artificial Analysis 的 Omniscience 测试上(问题超出模型知识范围),Kolibri 在不知道答案时选择弃答或部分作答的比例为 44%;同场对比,Qwen3.5 35B-A3B 为 11.1%,GPT-OSS 120B 为 23.7%。对检索增强生成(RAG)场景这是关键属性:系统把检索到的文档塞进提示词,模型得先承认文档里没有答案,答案质量才有意义。
强项与短板同表公开
Aleph Alpha 把自家模型的最弱项和最强项放在同一张 model card 里,这种公开方式本身少见。弱项清单:
- 闭卷知识弱。无文档的 RAG 基准测试上 51.0 分,12 个对比模型里垫底;Omniscience 测试正确作答率 14.8%,低于 Qwen3.5 的 22.2%。它知道自己不知道什么,但它确实也知道得更少。放进提示词里问它没问题,当百科问答机不行。
- 多轮工具调用弱。Berkeley Function Calling Leaderboard 多轮档位 39.8 分,对比 GLM-4.7 Flash 的 58.2 分、Qwen3.5 35B-A3B 的 54.0 分。
- 编码代理不是强项。Terminal-Bench 2.1 拿 27.7 分(Qwen3.5 为 39.7),SWE-bench Verified 拿 66.4 分(Qwen3.6 35B-A3B 为 73.8)。
- 部署门槛高。78 GB 权重注定与笔记本无缘,需要数据中心级 GPU。推理栈依赖 Aleph Alpha 自家的 vLLM 插件(aleph-alpha-inference 包),发布当天没有托管服务商上线它。
- 只有德英双语。
强项同样明确:数学、德语任务、长文档 RAG、弃答率。Aleph Alpha 自己的评测里,Kolibri 的英语总分 75.5、德语总分 70.8,在激活参数约 30 亿的开放模型里都排第一(德语次名 Qwen3.5 35B-A3B 为 69.8)。官方基准表还给出它落在质量对推理成本的 Pareto 前沿上:同等推理成本下没有对比模型质量更高,同等质量下没有对比模型更便宜。
部署:一条命令起 OpenAI 兼容服务
权重在 Hugging Face 的 Aleph-Alpha/Kolibri-1 仓库,Apache 2.0 协议覆盖权重和配置文件,训练代码与方法的权利仍归 Aleph Alpha。部署路径:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice起的是 OpenAI 兼容服务,任何 OpenAI 客户端可以直接对接,推理强度通过 chat template 参数传入:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "解释一下混合专家模型是什么"}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
)
print(response.choices[0].message.content)model card 推荐采样参数:temperature=1.0、top_p=0.97、top_k=128。对延迟敏感的负载,上下文上限建议不超过 262,144。要上 100 万 token 上下文,加两个参数:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'训练规模与流水线
Kolibri 不是一次成型。Aleph Alpha 先用同一套训练流水线做了个 30B 总参/3B 激活的先行版 Kolibri Origin(上下文只有 65k),用它跑通数据摄入、消融实验、预训练、后训练到评测的全链路,数百家消融实验在无人值守下完成(硬件故障和数据连接中断时训练不中断),然后才把流水线跑在正式版上。两代模型的发布间隔只有几个月,Origin 的存在意义就是给正式版排雷。
正式版的训练账单:768 块 NVIDIA B200(96 台 HGX 8 卡节点),预训练 21 天(511 小时,39.2 万 GPU 时),总计 6.4e23 FLOPS。预训练语料约 20T token,德语占 23.9%,英语 62.5%,代码 13.6%;另有 3.44T token 的中期训练和 201B token 的长上下文扩展阶段。训练数据里英语网络文本用 Google 的 Gemma 4 改写,德语用 Mistral-NeMo 改写,质量过滤用 Qwen3-32B 标注。model card 没有回避这些非欧洲组件,"主权"指的是训练过程受欧洲法律约束、部署不受外国控制,不是零外国依赖。
谁该用它,谁不该
Kolibri 的目标场景很收敛:数据不能出本地的机构(政府部门、银行、制造业、航空航天供应商),文档以德语或英语为主,需要长文档 RAG、需要模型承认"文档里没有答案",并且有自己的 GPU。这套条件同时满足时,Kolibri 是当前开源市场里几乎没有对手的选择,同等部署成本下德语质量最高的开放权重模型。
反过来,写代码为主的 agent 工作流、依赖闭卷知识的问答、德英之外的语言、没有数据中心 GPU 的团队,都不该选它。78 GB 显存和 35 亿激活参数之间的落差,是 MoE 架构的物理事实,选型时别被"3.5B 激活"四个字带偏。
对中文开发者,Kolibri 的价值不在直接使用,而在它公开的两份方法论:UniBPE 分词器证明了分词器对非英语语言的成本影响可以量化到 15% 量级(中文长期被英语中心的分词器切碎,同样的逻辑值得复算一遍),Merlin-Arthur 协议给出了一个可复现的弃答训练框架,比"诉诸 RLHF 调教"具体得多。权重已挂出,技术报告(189 页 PDF)在 Aleph Alpha 官网可下载,这两个方向都值得挖。
来源:Aleph Alpha 官方发布文、Hugging Face model card、Tejas Kumar 技术解读