---
url: /lm/beam/introduction.md
description: >-
  Beam是什么？Reflection
  AI于2026年10月5日发布的首个开放权重模型，5010亿总参数、230亿激活的稀疏MoE，23.8万亿token预训练、10500张GB300跑4周强化学习，官方称推理算力仅为GLM
  5.2的1/3到1/4，Apache 2.0权重10月内开源。五分钟搞懂这个"美国版DeepSeek"到底几斤几两。
---

# 认识Beam：美版DeepSeek交卷了，5010亿参数只激活230亿，值得等吗

先看一组让人不太舒服的数字。

2026 年，Hugging Face 上**中国模型的下载量占了全平台的 41%**，月下载和累计下载都超过了美国。Vercel AI Gateway 的生产流量里，开放权重模型处理了 **56% 的 Token**——而去年 12 月这个数字**还不到 10%**。

也就是说，开源模型早就不是极客的玩具了，它已经跑在无数公司的生产链路里。而这些模型，绝大多数来自中国。

另一边，美国最强的模型基本都锁在 API 后面。你想自己部署？没有。你想改？不行。

于是 2026 年 10 月 5 日，一家成立才两年半、此前**一款模型都没发过**的公司 Reflection AI，掏出了 **Beam**。美国媒体和从业者几乎一致地把它称作"**美版 DeepSeek**"。

更有意思的是这家公司的行事风格：**模型还没发布，它已经签下了超过 70 亿美元的算力合同**——从 2026 年 7 月 1 日起，每个月给 SpaceX 打 **1.5 亿美元**，只为租它 Colossus 2 数据中心里的 NVIDIA GB300，一直打到 2029 年，总额约 **63 亿美元**。

> 一家还没发布过模型的公司，先花 70 亿美元锁算力。这说明投资人押注的根本不是 Beam 这一款模型，而是"美国需要重新拥有一个开放模型体系"这件事本身。

那 Beam 到底交出了一份什么样的答卷？我们先别急着站队，把数字摊开看。

## 什么是 Beam

**Beam 是 Reflection AI 于 2026 年 10 月 5 日发布的首个开放权重模型：一个 5010 亿总参数、每个 token 只激活 230 亿的稀疏 MoE（混合专家）模型，专注代码、推理和智能体任务，上下文 100 万 token，权重将在本月（2026 年 10 月）以 Apache 2.0 协议释出。**

先把几个容易搞混的点拆清楚：

**第一，5010 亿是"存着"的，230 亿是"跑着"的。** 稀疏 MoE 的意思是：专家网络全都存着，但每个 token 只调度相关的那一小撮。所以**你的知识容量按 5010 亿算，你的账单和显存按 230 亿算**。这个 230 亿的激活量，比 GLM-5.2（约 400 亿）、Nemotron 3 Ultra（550 亿）、Kimi K3（1040 亿）都低不少——这就是它"省"的底气。

顺手给个横向参照：DeepSeek-V3 是 6710 亿总参数 / 370 亿激活，Kimi K2 是 1 万亿 / 320 亿，GLM-4.5 是 3550 亿 / 320 亿。**Beam 走的是"总参数不小、激活参数刻意压低"的路线。**

**第二，它是纯文本模型，不吃图。** 这点很重要。对比表里的 Kimi K3、DeepSeek V4.1 Flash 都是文本+图像输入，Beam 只做文本。所以别指望它读截图、看设计稿。

**第三，创始人背景很硬。** Reflection AI 2024 年由两位前 Google DeepMind 研究员 **Misha Laskin** 和 **Ioannis Antonoglou** 创办，总部在布鲁克林。Antonoglou 是 **AlphaGo 的核心团队成员之一**，两人都参与过 Gemini 1 和 Gemini 1.5 的工作。

有个细节挺有意思：他们创业之初其实**压根没打算自己训基础模型**。当时的判断是"西方迟早会出现足够强的开放模型，我们站在上面做强化学习和 Agent 研究就行"。结果 DeepSeek V3 出来之后，中美开放模型的差距迅速拉大，他们又等了几个月——没等到。**于是自己下场，Beam 就是这次战略转向后的第一份答卷。**

**第四，也是现阶段最要紧的一条：你现在只能用，还不能拥有。** Beam 正在做最后的红队测试（red-teaming）和评估，早期体验走 waitlist；**权重、技术报告、模型卡和开发者工具包会在本月放出，协议已明确是 Apache 2.0**。

> 我知道这话听着像泼冷水。但"开放权重"这四个字在 2026 年越来越像预售——先发跑分，权重排期。**在权重真正落到你硬盘上之前，它只是一个承诺。**

## 它有什么特点

* **真·大规模强化学习，这是 Beam 的技术主线。** Reflection 的判断很明确：预训练已经越来越像一门成熟的工程，下一阶段能力提升的主要变量，来自**把强化学习本身继续 scale**。他们用 **10,500 张 NVIDIA GB300 GPU 连续跑了 4 周**，生成了**超过 1 亿次 rollout**，单个 rollout 上下文最长 256K token。训练和打分消耗了约 **13 亿个沙箱**，覆盖近 **100 万个**编码、智能体和 STEM 环境。
* **预训练用了 23.8 万亿 token，跑在 6,144 张 GB300 上，不到 4 周。** 作为对比，DeepSeek-V3 用了 14.8 万亿，Kimi K2 约 15.5 万亿。数据来自网页、开源仓库，以及用视觉语言 OCR 流水线解析的 STEM 文献。官方称其数据清洗管线剔除了约 95% 的原始网页 token，同时捞回了约 1.8 万亿"常规过滤器会误杀"的高质量 token。
* **效率是它唯一的、也是全部的主张。** 官方口径：完成相似难度的推理任务，Beam 消耗的 token 和推理算力约为 **GLM 5.3、GPT-6 Luna 的 1/3 到 1/4**，对标 GLM 5.2 时用 **3~4 倍更少的推理算力**拿到相近表现。Reflection 自己也很坦率：**Kimi K3 在绝对能力上仍然领先，Beam 的卖点是"每 token 的智能密度"，不是榜单第一。**
* **架构上做了不少"防炸"设计。** 52 层，局部注意力与全局注意力交错 + 细粒度路由专家。负载均衡沿用 DeepSeek-V3 的\*\*无辅助损失（auxiliary-loss-free）\*\*方法，并加上专家偏置更新的余弦衰减——预训练结束时，最忙的专家平均负载只有均衡值的 **1.04 倍**，说明路由没有塌缩。数值稳定性上叠了 **SandwichNorm、逐元素注意力门控、按深度的激活缩放、FP32 残差累积**四件套，官方称全程没有出现不可恢复的 loss 突刺。
* **推理强度可以调。** Beam 提供 reasoning effort 参数：调低就短平快，调高就在难题上多想一会儿。团队可以按任务难度和算力预算自己拨这个旋钮——这点在生产里其实比跑分更值钱。
* **安全走的是"双教师蒸馏"。** 他们从同一个预训练检查点单独训了一个安全对齐教师模型，再用**多教师在线策略蒸馏（MOPD）**把它和大规模 RL 教师合并。对齐训练用了 deliberative alignment，且数据集是**对抗式迭代**生成的：每轮训一个模型，再生成能诱导有害或过度拒答行为的提示，把成功的攻击折回下一轮 SFT。官方还承诺**开源他们内部开发的安全评测**，给社区留一套可检验的标准。
* **RL 基础设施的数字也很吓人。** 平均维持 **11 万条并发 rollout**；新权重推送到推理集群的**中位延迟约 12 秒**；71 次推理故障处理下来**没有中断过训练**。为了扛住异步策略梯度里的滞后，他们声称即使 rollout 比当前策略**落后 107 个权重版本**（约一天）也能保持稳定收敛。
* **开源策略是"全家桶"，不只是丢个权重。** Reflection 说自己要做的不只是开放模型，还有配套的开源软件（可部署容器、定制配方、agentic harness）以及基础设施——支持 API 调用，也支持私有云、本地服务器、\*\*物理隔离（air-gapped）\*\*和边缘环境部署。

官方自报的跑分（注意：**全部为 Reflection 自行公布，尚无第三方复现**）：

| 基准 | Beam | 对比参照 |
| --- | --- | --- |
| SWE-bench Verified | **80.9** | Inkling 77.6、Nemotron 3 Ultra 70.7 |
| SWE-bench Pro v2-Hard | **77.2** | Inkling 56.9 |
| SWE-bench Pro v1 | **65.5** | GLM 5.2 62.1、DeepSeek V4.1 Flash 67.7 |
| Terminal-Bench v2.1 | **80.1** | GLM 5.2 81.0、Kimi K3 88.3、DeepSeek V4.1 Flash 90.6 |
| SWEBench Multilingual | **78.0** | Nemotron 3 Ultra 67.7 |
| MCP Atlas | **78.7** | — |
| AIME 2026 | **97.8** | GLM 5.2 99.2、GLM 5.3 91.7 |
| GPQA Diamond | **90.5** | GLM 5.3 91.7、Qwen 3.8 Max 93.5 |
| HLE（无工具） | **36.2** | Kimi K3 46.9、Qwen 3.8 Max 43.6 |
| SciCode | **49.7** | GLM 5.3 59.0、Kimi K3 58.7 |
| SWE Atlas Codebase QnA | **34.6** | Kimi K3 68.0 |

看这张表有个很直观的感受：**Beam 在"写代码、改代码"这类工程任务上站得很稳（SWE-bench Verified 80.9、多语言 78.0），但在"硬核推理与知识"上明显还差一档**（HLE 36.2、SciCode 49.7 都被 GLM 5.3、Kimi K3 甩开）。至于 Terminal-Bench v2.1 的 80.1，说得直白点：**这张表里它只赢了 Inkling 和 Nemotron 3 Ultra，输给了其他所有对比对象。**

> 一句大实话：**Beam 现在不是最强的，它是最"划算"的之一。** 而且这张对比表里大量的 NR（未报告），说明这更像一份"精选对比"，不是完整大乱斗。

## 用在哪儿

先说清楚一件必须说清楚的事：**Beam 目前没有任何公开的、已上线的企业落地案例。** 权重还没放出来，谈部署案例为时过早。但它背后那一串合作关系，已经把目标客户画得很清楚了。

**Reflection 的定位不是普通消费者，而是大型企业、政府机构、公共部门和"主权 AI"客户。** CEO Misha Laskin 的原话大意是：他们要服务那些**不愿或无法使用中国模型、同时又希望拥有并控制自己 AI 能力**的客户。

**场景一：主权 AI 与政府部署（这是最实的那块）。**

* **韩国新世界集团（Shinsegae）**：2026 年 3 月签署合作备忘录，计划共建一座 **250MW 的"主权 AI 工厂"**，用 Reflection 的开放权重模型 + NVIDIA GPU，为韩国企业和政府机构提供主权 AI 服务。分工是 Shinsegae 出土地、电力、许可和融资，Reflection 出设备设计和运营。美国商务部长出席了签约活动。**注意：这是 MOU，不是已确认的客户合同。**
* **美国能源部 Genesis Mission 科研计划**：Reflection 官网称将参与其中，为美国国家实验室提供开放模型。
* **正在评估中的两家政府机构**：美国 CAISS（Center for Advancing Innovation and Standards for Super Intelligence）与**英国 AI 安全研究所（UK AI Security Institute）**。

**场景二：数据不能出境、又不能用中国模型的企业的自托管。** 这是 Beam 最核心的商业逻辑。Apache 2.0 意味着可以私有云、本地机房、甚至**物理隔离环境**部署。对受监管行业（金融、国防、公共部门）来说，这个组合——**美国血统 +  permissive 协议 + 可 air-gapped 部署**——在 2026 年是稀缺品。据报道，对冲基金和交易公司是对这类系统最积极的潜在买家之一。

**场景三：编码智能体与终端自动化。** 官方明确说 Beam 就是冲着 coding 和 agentic 训的。SWE-bench Verified 80.9、多语言 78.0 这两个数字，说明它在"读仓库、改代码、打补丁"这类活上是能打的。配合 reasoning effort 旋钮，团队可以按任务难度控制成本——**这比"一律长考"的推理模型省钱得多**。

**场景四：替掉昂贵闭源推理模型的成本敏感场景。** 如果你的 workloads 大量是长链条推理，官方宣称的 1/3~1/4 算力消耗就是直接的成本差额。当然，这个数字目前**只存在于 Reflection 自己的图里**。

## 现在到底能不能上手

**现阶段：不能自托管，只能排队。**

1. **申请 waitlist**：去 reflection.ai 官网注册早期访问，目前是"选择性开放"，模型还在做最终红队测试和安全评估。
2. **用 API 先试**：官方 API 的模型名是 **`Beam-501B-A23B`**，支持 reasoning effort 参数。**定价目前没有公开。**
3. **等权重**：官方承诺 **2026 年 10 月内**放出 Apache 2.0 权重、技术报告、模型卡，以及运行/评估/微调的全套工具链；生态上会同步接入一批开源推理运行时，并上架 Hugging Face（时间表官方给的是 11 月做社区集成）。

**权重释出之后，大概率是这么跑**（以 vLLM 为例，命令为预期用法，等权重落地后生效）：

```bash
# 安装支持该架构的推理引擎（以 vLLM 为例）
pip install -U vllm

# 多机多卡拉起服务（501B MoE，需张量并行 + 专家并行）
vllm serve reflection-ai/Beam-501B-A23B \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --max-model-len 1048576 \
  --served-model-name beam
```

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

resp = client.chat.completions.create(
    model="beam",
    messages=[
        {"role": "user", "content": "读一下这个仓库的 CI 配置，找出为什么 nightly 构建会超时。"}
    ],
    extra_body={"reasoning_effort": "high"},  # 按任务难度拨旋钮
)
print(resp.choices[0].message.content)
```

**硬件这块，先给个粗估（官方尚未给出显存指引，以下是按参数量推算的量级，别当准数）：**

* **FP8 权重**：501B × 1 字节 ≈ **500GB** 起，加 KV cache 和运行开销，**单节点 8 卡 H200/B200/GB300（共 1.1~1.4TB 显存）是起步线**
* **BF16 权重**：约 **1TB**，基本要把多机多卡顶满
* 量化版（社区常见的 INT4/FP4）通常在权重放出后几天到几周内跟上，门槛会降一大截
* 1M 上下文是"有效长度"，真跑满长上下文，KV cache 才是吃显存的大头

> 如果你只是想先摸摸它的脾气，走 API 最省事；真要自托管，等社区量化版，别急着当第一批吃螃蟹的人。

## 该不该押它

说点个人立场。

Beam 让我觉得靠谱的地方不是跑分，是**它把"效率"当成了唯一卖点，并且坦白承认自己不是最强**。在一个人人都在刷榜的行业里，这种"我不第一，但我便宜三倍"的表述反而更像真话。加上他们承诺开源内部安全评测、会放出完整技术报告——**这家公司至少愿意被检验**。

让我保留意见的地方也很明确：**所有数据都是自报的，对比表里塞满了 NR，权重还没落地。** 一家估值 250 亿美元的公司发布的第一款模型，跑分表由自己出，这在 2026 年已经不算稀奇，但也不该被当成事实。

另外有个结构性风险值得单独提一句：**NVIDIA 既是 Reflection 的最大投资方之一（单独投了 8 亿美元），又是它通过 SpaceX 租到的 GB300 的供应商。** 换句话说，NVIDIA 一边是股东，一边是间接卖家。这不算问题，但你得知道这层关系存在。

至于"美国版 DeepSeek"这个称号——**等权重真放出来、第三方复现跑完，再叫也不迟。**

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
