---
url: /kolibri/introduction.md
description: >-
  Kolibri 是什么？德国 AI 公司 Aleph Alpha 于 2026 年 10 月 3 日发布的开源权重 MoE 大模型，781 亿总参数仅
  34.6 亿激活（每层 384 个专家选 6 个），原生 26.2 万上下文可扩展到 100 万 token，自研 UniBPE 分词器处理德语比
  GPT-5 分词器少 11.2% token，Merlin-Arthur 协议让它学会说"我不知道"，Apache 2.0 协议权重可商用，pip 一行 +
  一条 vLLM 命令即可本地部署，主打政务、金融、工业等监管敏感场景的欧洲主权 AI
---

# 认识 Kolibri —— 781 亿参数只唤醒 34.6 亿，德国人在统一日给欧洲发了一只「蜂鸟」

先说个让我看了两遍才信的数字。

**781 亿参数，但每一个 token 真正动用的只有 34.6 亿。比例是 4.4%。**

这事儿听着像白捡便宜，但我得马上把冷水泼上去：**省的是算力，不是显存。** 那 781 亿个参数，一个都不能少地躺在你的显存里，FP8 精度下大概 **78 GB**。少算的不代表少存——这就好比一家医院养着 384 个专科医生，你每次看病只有 6 个人出手，但工资得照发全员。

> MoE 的账从来都是这么算的：**它可以假装自己是 35 亿参数的小模型去干活，但你得照着 781 亿参数的大模型去买卡。**

就在昨天，**2026 年 10 月 3 日**（对，德国统一日，这个选日子的心思昭然若揭），总部在海德堡的 **Aleph Alpha** 把这只"蜂鸟"放了出来：**Kolibri**。

Kolibri 是德语里"蜂鸟"的意思。名字起得很贴切——翅膀扇得极快，体重轻得可怜。

先把最重要的事说清楚：**Apache 2.0 协议，权重直接挂在 Hugging Face 上，能下载、能微调、能做商业产品，不用跟任何人签合同。** 这在当下"开放权重但附一堆附加条款"的环境里，属于相当干净的一类。

## 什么是 Kolibri

一句话：**Kolibri 是 Aleph Alpha 发布的英德双语 MoE 大模型，主打"能在你自己机房里跑、用欧盟法律管着、德语比英语母语模型还溜"。**

注意几个容易搞混的点：

* **它不是聊天产品，是模型权重**。想直接对话请去别处，目前**还没有任何一家主流云厂商上线托管版**
* **它是 Kolibri 1，不是第一个**。此前有个前身叫 **Kolibri Origin**（300 亿总参数 / 30 亿激活，上下文只有 6.5 万），两个版本间隔很短，官方的说法是同一套训练流水线跑出来的第二只模型
* **开源权重 ≠ 完全开源**。**Apache 2.0 覆盖的是权重和配置文件，训练代码和方法论留在公司手里。** 这一点官方在模型卡里写得很直白，我挺欣赏这种坦白，但你要知道边界在哪

基本盘：

| 项目 | 情况 |
| --- | --- |
| 发布方 | Aleph Alpha（德国海德堡，约 200 人，德国境内 4 个办公点） |
| 发布日期 | **2026-10-03** |
| 模型名 | `Aleph-Alpha/Kolibri-1` |
| 架构 | MoE Transformer，**50 层**，每层 **384 个路由专家 + 1 个共享专家**，每 token 选 **6 个** |
| 参数量 | 总 **78.1B**，激活 **3.46B**（约 4.4%） |
| 上下文 | 原生 **262,144** token，验证到 **1,048,576**（100 万） |
| 语言 | **仅英语、德语**（官方原话：这是刻意的"深度优于广度"） |
| 训练量 | 约 **24 万亿** token，其中德语占 **21.3%**，用 **768 张 NVIDIA B200** |
| 知识截止 | **2026-06-18** |
| 开源协议 | **Apache 2.0**（权重 + 配置文件） |
| 推理档位 | `reasoning_effort`：`none` / `low` / `medium` / `high` |
| 估计能耗 | 约 **9.5×10² MWh**（含预训练、中期训练和长上下文训练，未含 SFT 与 RL） |

## 核心特点

### 一、MoE 的账：384 个专家里挑 6 个

先给小白补一分钟背景。**MoE（Mixture of Experts，混合专家）** 的核心心思是：别让所有参数对每个 token 都干活，每次只唤醒一小撮。

Kolibri 的做法是，每个 token 进来，一个**路由器（router）** 从 384 个专家里挑 6 个，外加上一个对谁都开放的**共享专家**。算下来每个 token 实际参与计算的只有 34.6 亿参数。

有个我觉得必须纠正的直觉：**这 384 个专家不是"一个管法律、一个管医学、一个管做菜"这种人类分科。** 研究者拆开 MoE 模型看过，里面多半是针对 token 模式形成的专家——标点、专有名词、某种句式结构。把它们想象成"科室"，只在你理解"路由"这一步时有用，别往深了推。

> 那为什么还要搞 384 个这么极端？因为**容量和算力被解耦了**：多加专家，模型"记住的东西"变多，但每个 token 的计算成本几乎不动。这是 Kolibri 敢同时做"德语好"和"便宜"的底气。

代价刚才说过了：**781 亿参数一个都得住进显存。** 官方给的最低配置是 2 张 **A100/H100 80GB**，或者单张 **H200 / B200 / B300**。笔记本？想都别想。

### 二、UniBPE：一个专门给德语复合词设计的分词器

这是全文我最想让你记住的部分，因为它回答了一个我以前从没认真想过的问题：**分词器是有国别的。**

模型不读字母也不读单词，它读 **token**——词表里的固定碎片。而德语有个英语没有的毛病：**喜欢把词粘起来。** 一个词可能是一整句话。

举个官方给的例子，德国联邦宪法法院的名字：

```
o200k_base（GPT-4o / GPT-5 用的分词器）：
Bund | es | ver | fass | ungs | gericht        → 6 个 token

Kolibri：
Bundes | verfassungsgericht                    → 2 个 token
```

粘得有多碎，吞得就有多亏。

Aleph Alpha 训练了一个 128,000 词表的分词器，算法叫 **UniBPE**：保留 BPE 那套自底向上合并的流程，但用 **Unigram 目标**给候选合并打分，让德语复合词能整体活下来。官方说法是德语文本比 GPT-5 的分词器**少 11.2%** 的 token。

有第三方（tej.as 那位老哥）不服，自己拿德国基本法全文（185 KB 密密麻麻的法律文本）跑了六个分词器复现了一遍：

| 分词器 | 德语 token 数 | 比 Kolibri 多 | 英语 token 数 | 比 Kolibri 多 |
| --- | --- | --- | --- | --- |
| **Kolibri** | **35,190** | — | 39,875 | — |
| o200k\_base（GPT-4o/5） | 41,482 | **+17.9%** | 39,737 | -0.3% |
| Qwen3.5 35B-A3B | 42,907 | +21.9% | 41,650 | +4.5% |
| Mistral Small 4 | 43,478 | +23.6% | 41,301 | +3.6% |
| Gemma 4 | 43,850 | +24.6% | 41,564 | +4.2% |

第三方实测在德语上省了 **15%**，比官方说的 11.2% 还夸张；而在英语上两边**基本打平**（Kolibri 甚至略输 0.3%）。

> 少 15% 的 token 意味着什么？**同样一段德语条文的推理费少了 15%，同样的上下文窗口里能多塞 15% 的法条。** 对一个天天处理德语长文档的机构来说，这是直接进账的钱。

顺带说句公道话：这套优化是**针对性**的，不是"Kolibri 分词器更强"。它法语不会更好，中文更是没戏。这是把筹码全压在一个语言上的打法。

### 三、混合注意力：40 层只看眼前，10 层看全局

100 万 token 上下文要是全用标准注意力，算力早就爆了。Kolibri 的解法是分层偷懒：

* **50 层里，40 层用滑动窗口注意力**：每个 token 只看它前面 **512 个** token
* **每隔 5 层做一次全注意力**：看得见前面所有内容

打个比方：读一份超长合同时，你绝大部分注意力其实在正在读的这一句；隔几页停下来，把整份文件在脑子里过一遍。这才是人真正的读法。

里面还有个我认为相当漂亮的细节：**位置信息（旋转位置编码）只加在滑动窗口层，全注意力层不带位置信息。** 正因为如此，模型才能在不做任何额外位置插值技巧的情况下，把上下文从训练时的 26.2 万拉到服务端可配的 100 万。

实际效果呢？**在 100 万 token 的 RULER 长上下文评测上，Kolibri 基座得 63.2 分，Qwen3.5 35B-A3B 基座 57.5 分。** 这个长度它确实是领先的。

但丑话我照说：**中间的尺度它是输的。** 在 128,000 token 长度上 RULER 分数是 **67.9**，Qwen3.5 的基座是 **89.9**——**差距不是一点半点。** 也就是说这模型属于"要么别用太长，要么干脆拉到百万级"，中间那段是它的洼地。

### 四、Merlin-Arthur 协议：被训练成会说"我不知道"

这部分我私心最喜欢，因为它戳的是大模型最要命的那个病：**一本正经地胡说八道。**

大部分模型被奖励的是"给出答案"，所以哪怕不知道，它也会凑一个出来。Kolibri 反过来，用了套叫 **Merlin-Arthur** 的训练协议，专门用**弃权数据**教它：上下文里没有的东西，就老实说没有。

官方在 **AA-Omniscience** 幻觉评测上的非幻觉率是 **44.0%**，而它的前身 Kolibri Origin 只有 **14.8%**。翻了差不多三倍。

不过我必须补一刀（这是诚实的一部分）：同一张表里，**Qwen3.6-35B-A3B 是 56.7%**，比 Kolibri 还高。所以这事的准确定性是：**相对自己有巨大进步，但没到同尺寸最强。**

更有意思的是这个"副作用"：**Kolibri 因为太爱承认不知道，闭包问答反而垫底。** 在 RGB（不给文档、纯靠记忆答）评测上得 **51.0** 分，在官方拿来对比的 12 个模型里排最后；AA-Omniscience 里答对的只有 **14.8%**（对照组 Qwen3.5 35B-A3B 是 22.2%）。

> 翻译过来：**给它文档，它极靠谱；让它凭脑子回答，它经常摊手。**&#x8FD9;其实是我见过最像专业人士的性格——手里有资料才敢下结论。但对指望它当百科全书的人，会是当头一棒。

### 五、四档思考强度 + 工具调用

用法上和其他现代推理模型差不多，几个开关值得知道：

* **`reasoning_effort`：`none` / `low` / `medium` / `high`**，通过 chat template 传，`none` 或者 `enable_thinking=false` 就是直接作答不想
* **工具调用**：服务端开启 Hermes 风格 parser（`--tool-call-parser kolibri1 --enable-auto-tool-choice`），用标准 OpenAI `tools` 字段传函数 schema
* **推荐采样参数**（模型卡给的，别自己瞎调）：`temperature=1.0`、`top_p=0.97`、`top_k=128`
* 官方建议：**对延迟敏感的场合，上下文控制在 262,144 以内**

### 六、为什么是 781 亿，而不是更大

这条不在发布会的 headline 里，但我认为是整篇最见工程判断的地方。

Aleph Alpha 试过更大的 **1230 亿**版本，然后砍掉了。原因是他们的实测：**在两张 H100 上，123B 版本在处理 25.6 万 token 上下文的并发查询时只能扛住 3 个并发，而 78B 版本能扛 18 个，而且解码速度还快 28%。**

> 多数人选模型看跑分，少数人选模型看"我这台机器到底能同时伺候几个人"。781 亿这个数字不是能力上限，是**服务成本的甜点**。这一点非常德国工程师。

## 关键数据一览

汇总一下，方便你直接抄去用（附带必要的限定条件）：

| 维度 | 数据 | 说明 |
| --- | --- | --- |
| 参数规模 | 78.1B 总 / 3.46B 激活，384 选 6 | 每层另有 1 个共享专家 |
| 德语分词效率 | 官方称少 **11.2%**，第三方实测少 **15%** | 对比 GPT-5 的 o200k\_base；英语打平 |
| 长上下文（100 万） | RULER **63.2** vs Qwen3.5 基座 57.5 | 这是它的主场 |
| 长上下文（12.8 万） | RULER **67.9** vs Qwen3.5 基座 **89.9** | **明显落后，别在这个区间用** |
| AIME 2025 | **96.9** | 官方自测 |
| 德语 AIME 2026 | **90.0** | 少见地单独提供了德语版数学评测 |
| GPQA Diamond | **84.3** | |
| LiveCodeBench v6 | **85.9** | |
| HumanEval+ | **92.7** | |
| SWE-bench Verified | **66.4** | Qwen3.6 35B-A3B 为 73.8，输 |
| BFCL v4 多轮工具调用 | **39.8** | GLM-4.7 Flash 58.2、Qwen3.5 54.0，**明显落后** |
| Terminal-Bench 2.1 | **27.7** | Qwen3.5 为 39.7，**不是好的编码 Agent** |
| AA-Omniscience 非幻觉率 | **44.0%**（前代 14.8%） | 但 Qwen3.6-35B-A3B 为 56.7% |
| 并发能力 | 2×H100、256k 上下文下 **18 路**并发 | 123B 版本同条件只有 3 路，故弃用 |

**必须加的两个限定条件：**

1. 这批 benchmark **几乎全是 Aleph Alpha 自己的评测流水线跑的**，发布才一天，**没有任何第三方独立验证**
2. 官方自己也认了总榜上打不过密集模型：**Qwen3.8 27B 在英语 80.2、德语 79.9，都高于 Kolibri 的 75.5**——但那个模型每个 token 要用掉近 8 倍的参数。Kolibri 的官方定位一直是"单位服务成本下的质量"，是**效率主张，不是榜首主张**

## 它在哪些场景真的有用

Aleph Alpha 自己建了 5 套"客户代理"评测集（模拟真实业务，但**从不用客户真实数据训练**），从 Kolibri Origin 到 Kolibri 的分数变化是这样的：

| 垂直场景 | Kolibri Origin | Kolibri 1 |
| --- | --- | --- |
| 汽车供应链 | 0.72 | **0.99** |
| 半导体 | 0.35 | **0.80** |
| 德国公共部门 | 0.54 | **0.75** |
| 工业驱动技术 | 0.31 | **0.60** |
| 航空航天 | 0.14 | **0.59** |

注意，**这些是公司用合成环境自建的内部评测，不是公开榜单**，含金量要打折看。但涨幅本身至少说明方向对了。

说人话，适合它的局面其实很窄，但在窄的地方几乎没对手：

* **德语长文档的 RAG（检索增强生成）**——法律条文、合同、技术手册。分词器省 15%、上下文能到 100 万、还愿意说"文档里没写"——**三项技能点全点在这一个场景上了**
* **数据绝对不能出域的机构**：政府机关、银行、制造业。**78 GB 显存换一套完全私有、且法律上干净的部署**，对这类买家是笔划算交易
* **受欧盟 AI 法案约束的合规场景**：Aleph Alpha 签了欧盟的《通用 AI 行为准则》，宣称从设计之初就照着 AI Act 来做，这是它能拿去敲政府采购大门的门票
* **宁可得不到答案、也不能得到错答案的决策支持**：它的定位在模型卡里写得很清楚，是"给人类权衡证据的顾问"，**明确不主张当自动决策组件**

不适合的情况我也直说：

* **写代码 / 做 Agent**——Terminal-Bench 27.7 对 Qwen3.5 的 39.7，**这个差距不用测试也能下结论**
* **除德语英语之外的任何语言**——词表里压根没给位置
* **当百科全书问着玩**——闭包问答垫底，它会不停摊手
* **只有一张消费级显卡**——78 GB 是硬门槛，RTX 4090 请绕行
* **想要开箱即用的云服务**——发布当天**没有任何托管厂商上线**，也没公布 API 价格，企业级部署要联系销售

> 我的个人判断：这不是一个"大家都会用"的模型，它是一个"某些机构非它不可"的模型。在一个所有人都在卷通用排行榜的年份，有人把筹码全押在一个语言、一个垂直方向上——这种偏执挺值得尊敬的。

## 关于"主权"，有两句话不得不说

这个词是 Kolibri 最核心的卖点，也是最容易被引述过头的地方。我尽量公允：

**站得住的部分：** 团队在德国，训练硬件在德国和芬兰（768 张 B200），受欧洲和德国法律管辖，签署了欧盟行为准则，部署方完全自控。对于在意"谁能拔我电源"的机构，这些是实在的。

**需要打折的部分：**

* 训练数据管线里确实碰过非欧洲模型：**英文网页文本用 Google 的 Gemma 4 改写，德文用 Mistral-NeMo 改写，Qwen3-32B 给质量过滤器打标。** 官方回应是之后又过滤了这些模型可能带入的政治偏见——这个回应你信几分自己判断，但至少人家写出来了
* **Apache 2.0 只覆盖权重**。训练代码和方法论不公开，所以这不是那种"任何人都能完整复现"的开放
* 公司层面有个不大不小的背景：**今年 4 月 Aleph Alpha 与加拿大 Cohere 达成协议共建跨大西洋主权 AI 合资体，外界普遍将其解读为事实上的收购。** 在这个背景下谈"独立主权"，保留一点怀疑是合理的

> 主权从来不是一个二元开关，它是一个光谱。Kolibri 站得比大多数模型靠前，但没站在端点上。

## 初体验：把它跑起来

老规矩，先泼冷水：**你需要数据中心级显卡。** 但好在它的部署门槛其实很低——一个 pip、一条 vLLM 命令。

### 装

Kolibri 需要 Aleph Alpha 自己的 vLLM 插件（顺便说，**这个插件同一时间只支持一个 vLLM 版本，发布当天是 0.29**，别乱升 vLLM）：

```bash
pip install 'aleph-alpha-inference>=1'
```

或者通过源码仓库 `Aleph-Alpha/aleph-alpha-inference` 装，**它会自动安装匹配的 vLLM 版本**。

懒得折腾环境就用官方容器镜像：

```bash
ghcr.io/aleph-alpha/aleph-alpha-inference
```

### 起服务

一条命令，推理和工具调用全开：

```bash
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice
```

这就得到一个 **OpenAI 兼容的服务端**，任何现成的 OpenAI 客户端都能直接连上去。

想要 100 万上下文，再加两个参数：

```bash
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'
```

### 调一次试试

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="Aleph-Alpha/Kolibri-1",
    messages=[{
        "role": "user",
        "content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."
    }],
    extra_body={
        "chat_template_kwargs": {
            "reasoning_effort": "high",
            "enable_thinking": True,
        }
    },
)

print(response.choices[0].message.content)
```

几个上手前就该知道的点：

* **采样参数别自作主张**：官方推荐 `temperature=1.0`、`top_p=0.97`、`top_k=128`。这一组看上去很反直觉（温度给到 1.0？），但这是跟着它的长思考链路调出来的，先照着用再改
* **想省时间就关思考**：`reasoning_effort="none"` 或 `enable_thinking=False`，模型会直接给答案
* **延迟敏感的场景别拉满长度**：官方明确建议这类用途控制在 262,144 token 以内
* **工具调用是 Hermes 风格**，用标准 OpenAI `tools` 字段传函数 schema 就行

## 几句必须说的丑话

* **发布才一天。** 没有一个第三方复现过那些跑分，没有一家云厂商托管，社区生态基本为零。现在所有关于它的二手信息，源头都是 Aleph Alpha 自己
* **78 GB 显存是硬门槛。** 说它是"35 亿参数的小模型"是错的——**它按 35 亿参数算，按 781 亿参数买卡**
* **插件依赖锁死 vLLM 版本。** 同一时间只支持一个版本，想跟着 vLLM 主线升级的团队会很难受
* **只有两种语言。** 这是官方刻意的取舍，不是待办事项，短期不会有第三种
* **中间长度的上下文是洼地。** 12.8 万这个量级它输给 Qwen3.5 一大截，用之前先确认你的文本到底有多长
* **严格的总榜对比里它不是第一。** Qwen3.8 27B 在英德双语都压它一头，只是成本高得多。别把"效率高"读成"最强"

> 最后一句个人立场。这两年"主权 AI"这个词被写在太多政策文件里，大多停留在表态层面。Kolibri 的价值在于它把一个抽象主张拆成了能验证的东西：\*\*训练在哪国的卡上跑的、词表为哪种语言调过、愿不愿意承认自己不知道、能不能整套搬进自己家的机房。你可以质疑它的主权纯度，可以指出它数据管线里的 Qwen 和 Gemma，甚至可以笑话它闭眼答卷垫底。但至少它把答卷连同不及格的科目一起贴出来了。这个习惯，比榜单上的名次值钱。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
