Skip to content

认识 Kolibri —— 781 亿参数只唤醒 34.6 亿,德国人在统一日给欧洲发了一只「蜂鸟」 ​

先说个让我看了两遍才信的数字。

781 亿参数,但每一个 token 真正动用的只有 34.6 亿。比例是 4.4%。

这事儿听着像白捡便宜,但我得马上把冷水泼上去:省的是算力,不是显存。 那 781 亿个参数,一个都不能少地躺在你的显存里,FP8 精度下大概 78 GB。少算的不代表少存——这就好比一家医院养着 384 个专科医生,你每次看病只有 6 个人出手,但工资得照发全员。

MoE 的账从来都是这么算的:它可以假装自己是 35 亿参数的小模型去干活,但你得照着 781 亿参数的大模型去买卡。

就在昨天,2026 年 10 月 3 日(对,德国统一日,这个选日子的心思昭然若揭),总部在海德堡的 Aleph Alpha 把这只"蜂鸟"放了出来:Kolibri。

Kolibri 是德语里"蜂鸟"的意思。名字起得很贴切——翅膀扇得极快,体重轻得可怜。

先把最重要的事说清楚:Apache 2.0 协议,权重直接挂在 Hugging Face 上,能下载、能微调、能做商业产品,不用跟任何人签合同。 这在当下"开放权重但附一堆附加条款"的环境里,属于相当干净的一类。

什么是 Kolibri ​

一句话:Kolibri 是 Aleph Alpha 发布的英德双语 MoE 大模型,主打"能在你自己机房里跑、用欧盟法律管着、德语比英语母语模型还溜"。

注意几个容易搞混的点:

  • 它不是聊天产品,是模型权重。想直接对话请去别处,目前还没有任何一家主流云厂商上线托管版
  • 它是 Kolibri 1,不是第一个。此前有个前身叫 Kolibri Origin(300 亿总参数 / 30 亿激活,上下文只有 6.5 万),两个版本间隔很短,官方的说法是同一套训练流水线跑出来的第二只模型
  • 开源权重 ≠ 完全开源。Apache 2.0 覆盖的是权重和配置文件,训练代码和方法论留在公司手里。 这一点官方在模型卡里写得很直白,我挺欣赏这种坦白,但你要知道边界在哪

基本盘:

项目情况
发布方Aleph Alpha(德国海德堡,约 200 人,德国境内 4 个办公点)
发布日期2026-10-03
模型名Aleph-Alpha/Kolibri-1
架构MoE Transformer,50 层,每层 384 个路由专家 + 1 个共享专家,每 token 选 6 个
参数量总 78.1B,激活 3.46B(约 4.4%)
上下文原生 262,144 token,验证到 1,048,576(100 万)
语言仅英语、德语(官方原话:这是刻意的"深度优于广度")
训练量约 24 万亿 token,其中德语占 21.3%,用 768 张 NVIDIA B200
知识截止2026-06-18
开源协议Apache 2.0(权重 + 配置文件)
推理档位reasoning_effort:none / low / medium / high
估计能耗约 9.5×10² MWh(含预训练、中期训练和长上下文训练,未含 SFT 与 RL)

核心特点 ​

一、MoE 的账:384 个专家里挑 6 个 ​

先给小白补一分钟背景。MoE(Mixture of Experts,混合专家) 的核心心思是:别让所有参数对每个 token 都干活,每次只唤醒一小撮。

Kolibri 的做法是,每个 token 进来,一个路由器(router) 从 384 个专家里挑 6 个,外加上一个对谁都开放的共享专家。算下来每个 token 实际参与计算的只有 34.6 亿参数。

有个我觉得必须纠正的直觉:这 384 个专家不是"一个管法律、一个管医学、一个管做菜"这种人类分科。 研究者拆开 MoE 模型看过,里面多半是针对 token 模式形成的专家——标点、专有名词、某种句式结构。把它们想象成"科室",只在你理解"路由"这一步时有用,别往深了推。

那为什么还要搞 384 个这么极端?因为容量和算力被解耦了:多加专家,模型"记住的东西"变多,但每个 token 的计算成本几乎不动。这是 Kolibri 敢同时做"德语好"和"便宜"的底气。

代价刚才说过了:781 亿参数一个都得住进显存。 官方给的最低配置是 2 张 A100/H100 80GB,或者单张 H200 / B200 / B300。笔记本?想都别想。

二、UniBPE:一个专门给德语复合词设计的分词器 ​

这是全文我最想让你记住的部分,因为它回答了一个我以前从没认真想过的问题:分词器是有国别的。

模型不读字母也不读单词,它读 token——词表里的固定碎片。而德语有个英语没有的毛病:喜欢把词粘起来。 一个词可能是一整句话。

举个官方给的例子,德国联邦宪法法院的名字:

o200k_base(GPT-4o / GPT-5 用的分词器):
Bund | es | ver | fass | ungs | gericht        → 6 个 token

Kolibri:
Bundes | verfassungsgericht                    → 2 个 token

粘得有多碎,吞得就有多亏。

Aleph Alpha 训练了一个 128,000 词表的分词器,算法叫 UniBPE:保留 BPE 那套自底向上合并的流程,但用 Unigram 目标给候选合并打分,让德语复合词能整体活下来。官方说法是德语文本比 GPT-5 的分词器少 11.2% 的 token。

有第三方(tej.as 那位老哥)不服,自己拿德国基本法全文(185 KB 密密麻麻的法律文本)跑了六个分词器复现了一遍:

分词器德语 token 数比 Kolibri 多英语 token 数比 Kolibri 多
Kolibri35,190—39,875—
o200k_base(GPT-4o/5)41,482+17.9%39,737-0.3%
Qwen3.5 35B-A3B42,907+21.9%41,650+4.5%
Mistral Small 443,478+23.6%41,301+3.6%
Gemma 443,850+24.6%41,564+4.2%

第三方实测在德语上省了 15%,比官方说的 11.2% 还夸张;而在英语上两边基本打平(Kolibri 甚至略输 0.3%)。

少 15% 的 token 意味着什么?同样一段德语条文的推理费少了 15%,同样的上下文窗口里能多塞 15% 的法条。 对一个天天处理德语长文档的机构来说,这是直接进账的钱。

顺带说句公道话:这套优化是针对性的,不是"Kolibri 分词器更强"。它法语不会更好,中文更是没戏。这是把筹码全压在一个语言上的打法。

三、混合注意力:40 层只看眼前,10 层看全局 ​

100 万 token 上下文要是全用标准注意力,算力早就爆了。Kolibri 的解法是分层偷懒:

  • 50 层里,40 层用滑动窗口注意力:每个 token 只看它前面 512 个 token
  • 每隔 5 层做一次全注意力:看得见前面所有内容

打个比方:读一份超长合同时,你绝大部分注意力其实在正在读的这一句;隔几页停下来,把整份文件在脑子里过一遍。这才是人真正的读法。

里面还有个我认为相当漂亮的细节:位置信息(旋转位置编码)只加在滑动窗口层,全注意力层不带位置信息。 正因为如此,模型才能在不做任何额外位置插值技巧的情况下,把上下文从训练时的 26.2 万拉到服务端可配的 100 万。

实际效果呢?在 100 万 token 的 RULER 长上下文评测上,Kolibri 基座得 63.2 分,Qwen3.5 35B-A3B 基座 57.5 分。 这个长度它确实是领先的。

但丑话我照说:中间的尺度它是输的。 在 128,000 token 长度上 RULER 分数是 67.9,Qwen3.5 的基座是 89.9——差距不是一点半点。 也就是说这模型属于"要么别用太长,要么干脆拉到百万级",中间那段是它的洼地。

四、Merlin-Arthur 协议:被训练成会说"我不知道" ​

这部分我私心最喜欢,因为它戳的是大模型最要命的那个病:一本正经地胡说八道。

大部分模型被奖励的是"给出答案",所以哪怕不知道,它也会凑一个出来。Kolibri 反过来,用了套叫 Merlin-Arthur 的训练协议,专门用弃权数据教它:上下文里没有的东西,就老实说没有。

官方在 AA-Omniscience 幻觉评测上的非幻觉率是 44.0%,而它的前身 Kolibri Origin 只有 14.8%。翻了差不多三倍。

不过我必须补一刀(这是诚实的一部分):同一张表里,Qwen3.6-35B-A3B 是 56.7%,比 Kolibri 还高。所以这事的准确定性是:相对自己有巨大进步,但没到同尺寸最强。

更有意思的是这个"副作用":Kolibri 因为太爱承认不知道,闭包问答反而垫底。 在 RGB(不给文档、纯靠记忆答)评测上得 51.0 分,在官方拿来对比的 12 个模型里排最后;AA-Omniscience 里答对的只有 14.8%(对照组 Qwen3.5 35B-A3B 是 22.2%)。

翻译过来:给它文档,它极靠谱;让它凭脑子回答,它经常摊手。
这其实是我见过最像专业人士的性格——手里有资料才敢下结论。但对指望它当百科全书的人,会是当头一棒。

五、四档思考强度 + 工具调用 ​

用法上和其他现代推理模型差不多,几个开关值得知道:

  • reasoning_effort:none / low / medium / high,通过 chat template 传,none 或者 enable_thinking=false 就是直接作答不想
  • 工具调用:服务端开启 Hermes 风格 parser(--tool-call-parser kolibri1 --enable-auto-tool-choice),用标准 OpenAI tools 字段传函数 schema
  • 推荐采样参数(模型卡给的,别自己瞎调):temperature=1.0、top_p=0.97、top_k=128
  • 官方建议:对延迟敏感的场合,上下文控制在 262,144 以内

六、为什么是 781 亿,而不是更大 ​

这条不在发布会的 headline 里,但我认为是整篇最见工程判断的地方。

Aleph Alpha 试过更大的 1230 亿版本,然后砍掉了。原因是他们的实测:在两张 H100 上,123B 版本在处理 25.6 万 token 上下文的并发查询时只能扛住 3 个并发,而 78B 版本能扛 18 个,而且解码速度还快 28%。

多数人选模型看跑分,少数人选模型看"我这台机器到底能同时伺候几个人"。
781 亿这个数字不是能力上限,是服务成本的甜点。这一点非常德国工程师。

关键数据一览 ​

汇总一下,方便你直接抄去用(附带必要的限定条件):

维度数据说明
参数规模78.1B 总 / 3.46B 激活,384 选 6每层另有 1 个共享专家
德语分词效率官方称少 11.2%,第三方实测少 15%对比 GPT-5 的 o200k_base;英语打平
长上下文(100 万)RULER 63.2 vs Qwen3.5 基座 57.5这是它的主场
长上下文(12.8 万)RULER 67.9 vs Qwen3.5 基座 89.9明显落后,别在这个区间用
AIME 202596.9官方自测
德语 AIME 202690.0少见地单独提供了德语版数学评测
GPQA Diamond84.3
LiveCodeBench v685.9
HumanEval+92.7
SWE-bench Verified66.4Qwen3.6 35B-A3B 为 73.8,输
BFCL v4 多轮工具调用39.8GLM-4.7 Flash 58.2、Qwen3.5 54.0,明显落后
Terminal-Bench 2.127.7Qwen3.5 为 39.7,不是好的编码 Agent
AA-Omniscience 非幻觉率44.0%(前代 14.8%)但 Qwen3.6-35B-A3B 为 56.7%
并发能力2×H100、256k 上下文下 18 路并发123B 版本同条件只有 3 路,故弃用

必须加的两个限定条件:

  1. 这批 benchmark 几乎全是 Aleph Alpha 自己的评测流水线跑的,发布才一天,没有任何第三方独立验证
  2. 官方自己也认了总榜上打不过密集模型:Qwen3.8 27B 在英语 80.2、德语 79.9,都高于 Kolibri 的 75.5——但那个模型每个 token 要用掉近 8 倍的参数。Kolibri 的官方定位一直是"单位服务成本下的质量",是效率主张,不是榜首主张

它在哪些场景真的有用 ​

Aleph Alpha 自己建了 5 套"客户代理"评测集(模拟真实业务,但从不用客户真实数据训练),从 Kolibri Origin 到 Kolibri 的分数变化是这样的:

垂直场景Kolibri OriginKolibri 1
汽车供应链0.720.99
半导体0.350.80
德国公共部门0.540.75
工业驱动技术0.310.60
航空航天0.140.59

注意,这些是公司用合成环境自建的内部评测,不是公开榜单,含金量要打折看。但涨幅本身至少说明方向对了。

说人话,适合它的局面其实很窄,但在窄的地方几乎没对手:

  • 德语长文档的 RAG(检索增强生成)——法律条文、合同、技术手册。分词器省 15%、上下文能到 100 万、还愿意说"文档里没写"——三项技能点全点在这一个场景上了
  • 数据绝对不能出域的机构:政府机关、银行、制造业。78 GB 显存换一套完全私有、且法律上干净的部署,对这类买家是笔划算交易
  • 受欧盟 AI 法案约束的合规场景:Aleph Alpha 签了欧盟的《通用 AI 行为准则》,宣称从设计之初就照着 AI Act 来做,这是它能拿去敲政府采购大门的门票
  • 宁可得不到答案、也不能得到错答案的决策支持:它的定位在模型卡里写得很清楚,是"给人类权衡证据的顾问",明确不主张当自动决策组件

不适合的情况我也直说:

  • 写代码 / 做 Agent——Terminal-Bench 27.7 对 Qwen3.5 的 39.7,这个差距不用测试也能下结论
  • 除德语英语之外的任何语言——词表里压根没给位置
  • 当百科全书问着玩——闭包问答垫底,它会不停摊手
  • 只有一张消费级显卡——78 GB 是硬门槛,RTX 4090 请绕行
  • 想要开箱即用的云服务——发布当天没有任何托管厂商上线,也没公布 API 价格,企业级部署要联系销售

我的个人判断:这不是一个"大家都会用"的模型,它是一个"某些机构非它不可"的模型。
在一个所有人都在卷通用排行榜的年份,有人把筹码全押在一个语言、一个垂直方向上——这种偏执挺值得尊敬的。

关于"主权",有两句话不得不说 ​

这个词是 Kolibri 最核心的卖点,也是最容易被引述过头的地方。我尽量公允:

站得住的部分: 团队在德国,训练硬件在德国和芬兰(768 张 B200),受欧洲和德国法律管辖,签署了欧盟行为准则,部署方完全自控。对于在意"谁能拔我电源"的机构,这些是实在的。

需要打折的部分:

  • 训练数据管线里确实碰过非欧洲模型:英文网页文本用 Google 的 Gemma 4 改写,德文用 Mistral-NeMo 改写,Qwen3-32B 给质量过滤器打标。 官方回应是之后又过滤了这些模型可能带入的政治偏见——这个回应你信几分自己判断,但至少人家写出来了
  • Apache 2.0 只覆盖权重。训练代码和方法论不公开,所以这不是那种"任何人都能完整复现"的开放
  • 公司层面有个不大不小的背景:今年 4 月 Aleph Alpha 与加拿大 Cohere 达成协议共建跨大西洋主权 AI 合资体,外界普遍将其解读为事实上的收购。 在这个背景下谈"独立主权",保留一点怀疑是合理的

主权从来不是一个二元开关,它是一个光谱。Kolibri 站得比大多数模型靠前,但没站在端点上。

初体验:把它跑起来 ​

老规矩,先泼冷水:你需要数据中心级显卡。 但好在它的部署门槛其实很低——一个 pip、一条 vLLM 命令。

装 ​

Kolibri 需要 Aleph Alpha 自己的 vLLM 插件(顺便说,这个插件同一时间只支持一个 vLLM 版本,发布当天是 0.29,别乱升 vLLM):

bash
pip install 'aleph-alpha-inference>=1'

或者通过源码仓库 Aleph-Alpha/aleph-alpha-inference 装,它会自动安装匹配的 vLLM 版本。

懒得折腾环境就用官方容器镜像:

bash
ghcr.io/aleph-alpha/aleph-alpha-inference

起服务 ​

一条命令,推理和工具调用全开:

bash
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

这就得到一个 OpenAI 兼容的服务端,任何现成的 OpenAI 客户端都能直接连上去。

想要 100 万上下文,再加两个参数:

bash
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'

调一次试试 ​

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="Aleph-Alpha/Kolibri-1",
    messages=[{
        "role": "user",
        "content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."
    }],
    extra_body={
        "chat_template_kwargs": {
            "reasoning_effort": "high",
            "enable_thinking": True,
        }
    },
)

print(response.choices[0].message.content)

几个上手前就该知道的点:

  • 采样参数别自作主张:官方推荐 temperature=1.0、top_p=0.97、top_k=128。这一组看上去很反直觉(温度给到 1.0?),但这是跟着它的长思考链路调出来的,先照着用再改
  • 想省时间就关思考:reasoning_effort="none" 或 enable_thinking=False,模型会直接给答案
  • 延迟敏感的场景别拉满长度:官方明确建议这类用途控制在 262,144 token 以内
  • 工具调用是 Hermes 风格,用标准 OpenAI tools 字段传函数 schema 就行

几句必须说的丑话 ​

  • 发布才一天。 没有一个第三方复现过那些跑分,没有一家云厂商托管,社区生态基本为零。现在所有关于它的二手信息,源头都是 Aleph Alpha 自己
  • 78 GB 显存是硬门槛。 说它是"35 亿参数的小模型"是错的——它按 35 亿参数算,按 781 亿参数买卡
  • 插件依赖锁死 vLLM 版本。 同一时间只支持一个版本,想跟着 vLLM 主线升级的团队会很难受
  • 只有两种语言。 这是官方刻意的取舍,不是待办事项,短期不会有第三种
  • 中间长度的上下文是洼地。 12.8 万这个量级它输给 Qwen3.5 一大截,用之前先确认你的文本到底有多长
  • 严格的总榜对比里它不是第一。 Qwen3.8 27B 在英德双语都压它一头,只是成本高得多。别把"效率高"读成"最强"

最后一句个人立场。
这两年"主权 AI"这个词被写在太多政策文件里,大多停留在表态层面。Kolibri 的价值在于它把一个抽象主张拆成了能验证的东西:**训练在哪国的卡上跑的、词表为哪种语言调过、愿不愿意承认自己不知道、能不能整套搬进自己家的机房。
你可以质疑它的主权纯度,可以指出它数据管线里的 Qwen 和 Gemma,甚至可以笑话它闭眼答卷垫底。
但至少它把答卷连同不及格的科目一起贴出来了。这个习惯,比榜单上的名次值钱。

进阶 ​

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区