认识 Kolibri —— 781 亿参数只唤醒 34.6 亿,德国人在统一日给欧洲发了一只「蜂鸟」
先说个让我看了两遍才信的数字。
781 亿参数,但每一个 token 真正动用的只有 34.6 亿。比例是 4.4%。
这事儿听着像白捡便宜,但我得马上把冷水泼上去:省的是算力,不是显存。 那 781 亿个参数,一个都不能少地躺在你的显存里,FP8 精度下大概 78 GB。少算的不代表少存——这就好比一家医院养着 384 个专科医生,你每次看病只有 6 个人出手,但工资得照发全员。
MoE 的账从来都是这么算的:它可以假装自己是 35 亿参数的小模型去干活,但你得照着 781 亿参数的大模型去买卡。
就在昨天,2026 年 10 月 3 日(对,德国统一日,这个选日子的心思昭然若揭),总部在海德堡的 Aleph Alpha 把这只"蜂鸟"放了出来:Kolibri。
Kolibri 是德语里"蜂鸟"的意思。名字起得很贴切——翅膀扇得极快,体重轻得可怜。
先把最重要的事说清楚:Apache 2.0 协议,权重直接挂在 Hugging Face 上,能下载、能微调、能做商业产品,不用跟任何人签合同。 这在当下"开放权重但附一堆附加条款"的环境里,属于相当干净的一类。
什么是 Kolibri
一句话:Kolibri 是 Aleph Alpha 发布的英德双语 MoE 大模型,主打"能在你自己机房里跑、用欧盟法律管着、德语比英语母语模型还溜"。
注意几个容易搞混的点:
- 它不是聊天产品,是模型权重。想直接对话请去别处,目前还没有任何一家主流云厂商上线托管版
- 它是 Kolibri 1,不是第一个。此前有个前身叫 Kolibri Origin(300 亿总参数 / 30 亿激活,上下文只有 6.5 万),两个版本间隔很短,官方的说法是同一套训练流水线跑出来的第二只模型
- 开源权重 ≠ 完全开源。Apache 2.0 覆盖的是权重和配置文件,训练代码和方法论留在公司手里。 这一点官方在模型卡里写得很直白,我挺欣赏这种坦白,但你要知道边界在哪
基本盘:
| 项目 | 情况 |
|---|---|
| 发布方 | Aleph Alpha(德国海德堡,约 200 人,德国境内 4 个办公点) |
| 发布日期 | 2026-10-03 |
| 模型名 | Aleph-Alpha/Kolibri-1 |
| 架构 | MoE Transformer,50 层,每层 384 个路由专家 + 1 个共享专家,每 token 选 6 个 |
| 参数量 | 总 78.1B,激活 3.46B(约 4.4%) |
| 上下文 | 原生 262,144 token,验证到 1,048,576(100 万) |
| 语言 | 仅英语、德语(官方原话:这是刻意的"深度优于广度") |
| 训练量 | 约 24 万亿 token,其中德语占 21.3%,用 768 张 NVIDIA B200 |
| 知识截止 | 2026-06-18 |
| 开源协议 | Apache 2.0(权重 + 配置文件) |
| 推理档位 | reasoning_effort:none / low / medium / high |
| 估计能耗 | 约 9.5×10² MWh(含预训练、中期训练和长上下文训练,未含 SFT 与 RL) |
核心特点
一、MoE 的账:384 个专家里挑 6 个
先给小白补一分钟背景。MoE(Mixture of Experts,混合专家) 的核心心思是:别让所有参数对每个 token 都干活,每次只唤醒一小撮。
Kolibri 的做法是,每个 token 进来,一个路由器(router) 从 384 个专家里挑 6 个,外加上一个对谁都开放的共享专家。算下来每个 token 实际参与计算的只有 34.6 亿参数。
有个我觉得必须纠正的直觉:这 384 个专家不是"一个管法律、一个管医学、一个管做菜"这种人类分科。 研究者拆开 MoE 模型看过,里面多半是针对 token 模式形成的专家——标点、专有名词、某种句式结构。把它们想象成"科室",只在你理解"路由"这一步时有用,别往深了推。
那为什么还要搞 384 个这么极端?因为容量和算力被解耦了:多加专家,模型"记住的东西"变多,但每个 token 的计算成本几乎不动。这是 Kolibri 敢同时做"德语好"和"便宜"的底气。
代价刚才说过了:781 亿参数一个都得住进显存。 官方给的最低配置是 2 张 A100/H100 80GB,或者单张 H200 / B200 / B300。笔记本?想都别想。
二、UniBPE:一个专门给德语复合词设计的分词器
这是全文我最想让你记住的部分,因为它回答了一个我以前从没认真想过的问题:分词器是有国别的。
模型不读字母也不读单词,它读 token——词表里的固定碎片。而德语有个英语没有的毛病:喜欢把词粘起来。 一个词可能是一整句话。
举个官方给的例子,德国联邦宪法法院的名字:
o200k_base(GPT-4o / GPT-5 用的分词器):
Bund | es | ver | fass | ungs | gericht → 6 个 token
Kolibri:
Bundes | verfassungsgericht → 2 个 token粘得有多碎,吞得就有多亏。
Aleph Alpha 训练了一个 128,000 词表的分词器,算法叫 UniBPE:保留 BPE 那套自底向上合并的流程,但用 Unigram 目标给候选合并打分,让德语复合词能整体活下来。官方说法是德语文本比 GPT-5 的分词器少 11.2% 的 token。
有第三方(tej.as 那位老哥)不服,自己拿德国基本法全文(185 KB 密密麻麻的法律文本)跑了六个分词器复现了一遍:
| 分词器 | 德语 token 数 | 比 Kolibri 多 | 英语 token 数 | 比 Kolibri 多 |
|---|---|---|---|---|
| Kolibri | 35,190 | — | 39,875 | — |
| o200k_base(GPT-4o/5) | 41,482 | +17.9% | 39,737 | -0.3% |
| Qwen3.5 35B-A3B | 42,907 | +21.9% | 41,650 | +4.5% |
| Mistral Small 4 | 43,478 | +23.6% | 41,301 | +3.6% |
| Gemma 4 | 43,850 | +24.6% | 41,564 | +4.2% |
第三方实测在德语上省了 15%,比官方说的 11.2% 还夸张;而在英语上两边基本打平(Kolibri 甚至略输 0.3%)。
少 15% 的 token 意味着什么?同样一段德语条文的推理费少了 15%,同样的上下文窗口里能多塞 15% 的法条。 对一个天天处理德语长文档的机构来说,这是直接进账的钱。
顺带说句公道话:这套优化是针对性的,不是"Kolibri 分词器更强"。它法语不会更好,中文更是没戏。这是把筹码全压在一个语言上的打法。
三、混合注意力:40 层只看眼前,10 层看全局
100 万 token 上下文要是全用标准注意力,算力早就爆了。Kolibri 的解法是分层偷懒:
- 50 层里,40 层用滑动窗口注意力:每个 token 只看它前面 512 个 token
- 每隔 5 层做一次全注意力:看得见前面所有内容
打个比方:读一份超长合同时,你绝大部分注意力其实在正在读的这一句;隔几页停下来,把整份文件在脑子里过一遍。这才是人真正的读法。
里面还有个我认为相当漂亮的细节:位置信息(旋转位置编码)只加在滑动窗口层,全注意力层不带位置信息。 正因为如此,模型才能在不做任何额外位置插值技巧的情况下,把上下文从训练时的 26.2 万拉到服务端可配的 100 万。
实际效果呢?在 100 万 token 的 RULER 长上下文评测上,Kolibri 基座得 63.2 分,Qwen3.5 35B-A3B 基座 57.5 分。 这个长度它确实是领先的。
但丑话我照说:中间的尺度它是输的。 在 128,000 token 长度上 RULER 分数是 67.9,Qwen3.5 的基座是 89.9——差距不是一点半点。 也就是说这模型属于"要么别用太长,要么干脆拉到百万级",中间那段是它的洼地。
四、Merlin-Arthur 协议:被训练成会说"我不知道"
这部分我私心最喜欢,因为它戳的是大模型最要命的那个病:一本正经地胡说八道。
大部分模型被奖励的是"给出答案",所以哪怕不知道,它也会凑一个出来。Kolibri 反过来,用了套叫 Merlin-Arthur 的训练协议,专门用弃权数据教它:上下文里没有的东西,就老实说没有。
官方在 AA-Omniscience 幻觉评测上的非幻觉率是 44.0%,而它的前身 Kolibri Origin 只有 14.8%。翻了差不多三倍。
不过我必须补一刀(这是诚实的一部分):同一张表里,Qwen3.6-35B-A3B 是 56.7%,比 Kolibri 还高。所以这事的准确定性是:相对自己有巨大进步,但没到同尺寸最强。
更有意思的是这个"副作用":Kolibri 因为太爱承认不知道,闭包问答反而垫底。 在 RGB(不给文档、纯靠记忆答)评测上得 51.0 分,在官方拿来对比的 12 个模型里排最后;AA-Omniscience 里答对的只有 14.8%(对照组 Qwen3.5 35B-A3B 是 22.2%)。
翻译过来:给它文档,它极靠谱;让它凭脑子回答,它经常摊手。
这其实是我见过最像专业人士的性格——手里有资料才敢下结论。但对指望它当百科全书的人,会是当头一棒。
五、四档思考强度 + 工具调用
用法上和其他现代推理模型差不多,几个开关值得知道:
reasoning_effort:none/low/medium/high,通过 chat template 传,none或者enable_thinking=false就是直接作答不想- 工具调用:服务端开启 Hermes 风格 parser(
--tool-call-parser kolibri1 --enable-auto-tool-choice),用标准 OpenAItools字段传函数 schema - 推荐采样参数(模型卡给的,别自己瞎调):
temperature=1.0、top_p=0.97、top_k=128 - 官方建议:对延迟敏感的场合,上下文控制在 262,144 以内
六、为什么是 781 亿,而不是更大
这条不在发布会的 headline 里,但我认为是整篇最见工程判断的地方。
Aleph Alpha 试过更大的 1230 亿版本,然后砍掉了。原因是他们的实测:在两张 H100 上,123B 版本在处理 25.6 万 token 上下文的并发查询时只能扛住 3 个并发,而 78B 版本能扛 18 个,而且解码速度还快 28%。
多数人选模型看跑分,少数人选模型看"我这台机器到底能同时伺候几个人"。
781 亿这个数字不是能力上限,是服务成本的甜点。这一点非常德国工程师。
关键数据一览
汇总一下,方便你直接抄去用(附带必要的限定条件):
| 维度 | 数据 | 说明 |
|---|---|---|
| 参数规模 | 78.1B 总 / 3.46B 激活,384 选 6 | 每层另有 1 个共享专家 |
| 德语分词效率 | 官方称少 11.2%,第三方实测少 15% | 对比 GPT-5 的 o200k_base;英语打平 |
| 长上下文(100 万) | RULER 63.2 vs Qwen3.5 基座 57.5 | 这是它的主场 |
| 长上下文(12.8 万) | RULER 67.9 vs Qwen3.5 基座 89.9 | 明显落后,别在这个区间用 |
| AIME 2025 | 96.9 | 官方自测 |
| 德语 AIME 2026 | 90.0 | 少见地单独提供了德语版数学评测 |
| GPQA Diamond | 84.3 | |
| LiveCodeBench v6 | 85.9 | |
| HumanEval+ | 92.7 | |
| SWE-bench Verified | 66.4 | Qwen3.6 35B-A3B 为 73.8,输 |
| BFCL v4 多轮工具调用 | 39.8 | GLM-4.7 Flash 58.2、Qwen3.5 54.0,明显落后 |
| Terminal-Bench 2.1 | 27.7 | Qwen3.5 为 39.7,不是好的编码 Agent |
| AA-Omniscience 非幻觉率 | 44.0%(前代 14.8%) | 但 Qwen3.6-35B-A3B 为 56.7% |
| 并发能力 | 2×H100、256k 上下文下 18 路并发 | 123B 版本同条件只有 3 路,故弃用 |
必须加的两个限定条件:
- 这批 benchmark 几乎全是 Aleph Alpha 自己的评测流水线跑的,发布才一天,没有任何第三方独立验证
- 官方自己也认了总榜上打不过密集模型:Qwen3.8 27B 在英语 80.2、德语 79.9,都高于 Kolibri 的 75.5——但那个模型每个 token 要用掉近 8 倍的参数。Kolibri 的官方定位一直是"单位服务成本下的质量",是效率主张,不是榜首主张
它在哪些场景真的有用
Aleph Alpha 自己建了 5 套"客户代理"评测集(模拟真实业务,但从不用客户真实数据训练),从 Kolibri Origin 到 Kolibri 的分数变化是这样的:
| 垂直场景 | Kolibri Origin | Kolibri 1 |
|---|---|---|
| 汽车供应链 | 0.72 | 0.99 |
| 半导体 | 0.35 | 0.80 |
| 德国公共部门 | 0.54 | 0.75 |
| 工业驱动技术 | 0.31 | 0.60 |
| 航空航天 | 0.14 | 0.59 |
注意,这些是公司用合成环境自建的内部评测,不是公开榜单,含金量要打折看。但涨幅本身至少说明方向对了。
说人话,适合它的局面其实很窄,但在窄的地方几乎没对手:
- 德语长文档的 RAG(检索增强生成)——法律条文、合同、技术手册。分词器省 15%、上下文能到 100 万、还愿意说"文档里没写"——三项技能点全点在这一个场景上了
- 数据绝对不能出域的机构:政府机关、银行、制造业。78 GB 显存换一套完全私有、且法律上干净的部署,对这类买家是笔划算交易
- 受欧盟 AI 法案约束的合规场景:Aleph Alpha 签了欧盟的《通用 AI 行为准则》,宣称从设计之初就照着 AI Act 来做,这是它能拿去敲政府采购大门的门票
- 宁可得不到答案、也不能得到错答案的决策支持:它的定位在模型卡里写得很清楚,是"给人类权衡证据的顾问",明确不主张当自动决策组件
不适合的情况我也直说:
- 写代码 / 做 Agent——Terminal-Bench 27.7 对 Qwen3.5 的 39.7,这个差距不用测试也能下结论
- 除德语英语之外的任何语言——词表里压根没给位置
- 当百科全书问着玩——闭包问答垫底,它会不停摊手
- 只有一张消费级显卡——78 GB 是硬门槛,RTX 4090 请绕行
- 想要开箱即用的云服务——发布当天没有任何托管厂商上线,也没公布 API 价格,企业级部署要联系销售
我的个人判断:这不是一个"大家都会用"的模型,它是一个"某些机构非它不可"的模型。
在一个所有人都在卷通用排行榜的年份,有人把筹码全押在一个语言、一个垂直方向上——这种偏执挺值得尊敬的。
关于"主权",有两句话不得不说
这个词是 Kolibri 最核心的卖点,也是最容易被引述过头的地方。我尽量公允:
站得住的部分: 团队在德国,训练硬件在德国和芬兰(768 张 B200),受欧洲和德国法律管辖,签署了欧盟行为准则,部署方完全自控。对于在意"谁能拔我电源"的机构,这些是实在的。
需要打折的部分:
- 训练数据管线里确实碰过非欧洲模型:英文网页文本用 Google 的 Gemma 4 改写,德文用 Mistral-NeMo 改写,Qwen3-32B 给质量过滤器打标。 官方回应是之后又过滤了这些模型可能带入的政治偏见——这个回应你信几分自己判断,但至少人家写出来了
- Apache 2.0 只覆盖权重。训练代码和方法论不公开,所以这不是那种"任何人都能完整复现"的开放
- 公司层面有个不大不小的背景:今年 4 月 Aleph Alpha 与加拿大 Cohere 达成协议共建跨大西洋主权 AI 合资体,外界普遍将其解读为事实上的收购。 在这个背景下谈"独立主权",保留一点怀疑是合理的
主权从来不是一个二元开关,它是一个光谱。Kolibri 站得比大多数模型靠前,但没站在端点上。
初体验:把它跑起来
老规矩,先泼冷水:你需要数据中心级显卡。 但好在它的部署门槛其实很低——一个 pip、一条 vLLM 命令。
装
Kolibri 需要 Aleph Alpha 自己的 vLLM 插件(顺便说,这个插件同一时间只支持一个 vLLM 版本,发布当天是 0.29,别乱升 vLLM):
pip install 'aleph-alpha-inference>=1'或者通过源码仓库 Aleph-Alpha/aleph-alpha-inference 装,它会自动安装匹配的 vLLM 版本。
懒得折腾环境就用官方容器镜像:
ghcr.io/aleph-alpha/aleph-alpha-inference起服务
一条命令,推理和工具调用全开:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice这就得到一个 OpenAI 兼容的服务端,任何现成的 OpenAI 客户端都能直接连上去。
想要 100 万上下文,再加两个参数:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'调一次试试
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{
"role": "user",
"content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."
}],
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "high",
"enable_thinking": True,
}
},
)
print(response.choices[0].message.content)几个上手前就该知道的点:
- 采样参数别自作主张:官方推荐
temperature=1.0、top_p=0.97、top_k=128。这一组看上去很反直觉(温度给到 1.0?),但这是跟着它的长思考链路调出来的,先照着用再改 - 想省时间就关思考:
reasoning_effort="none"或enable_thinking=False,模型会直接给答案 - 延迟敏感的场景别拉满长度:官方明确建议这类用途控制在 262,144 token 以内
- 工具调用是 Hermes 风格,用标准 OpenAI
tools字段传函数 schema 就行
几句必须说的丑话
- 发布才一天。 没有一个第三方复现过那些跑分,没有一家云厂商托管,社区生态基本为零。现在所有关于它的二手信息,源头都是 Aleph Alpha 自己
- 78 GB 显存是硬门槛。 说它是"35 亿参数的小模型"是错的——它按 35 亿参数算,按 781 亿参数买卡
- 插件依赖锁死 vLLM 版本。 同一时间只支持一个版本,想跟着 vLLM 主线升级的团队会很难受
- 只有两种语言。 这是官方刻意的取舍,不是待办事项,短期不会有第三种
- 中间长度的上下文是洼地。 12.8 万这个量级它输给 Qwen3.5 一大截,用之前先确认你的文本到底有多长
- 严格的总榜对比里它不是第一。 Qwen3.8 27B 在英德双语都压它一头,只是成本高得多。别把"效率高"读成"最强"
最后一句个人立场。
这两年"主权 AI"这个词被写在太多政策文件里,大多停留在表态层面。Kolibri 的价值在于它把一个抽象主张拆成了能验证的东西:**训练在哪国的卡上跑的、词表为哪种语言调过、愿不愿意承认自己不知道、能不能整套搬进自己家的机房。
你可以质疑它的主权纯度,可以指出它数据管线里的 Qwen 和 Gemma,甚至可以笑话它闭眼答卷垫底。
但至少它把答卷连同不及格的科目一起贴出来了。这个习惯,比榜单上的名次值钱。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
