Skip to content

认识Beam:美版DeepSeek交卷了,5010亿参数只激活230亿,值得等吗 ​

先看一组让人不太舒服的数字。

2026 年,Hugging Face 上中国模型的下载量占了全平台的 41%,月下载和累计下载都超过了美国。Vercel AI Gateway 的生产流量里,开放权重模型处理了 56% 的 Token——而去年 12 月这个数字还不到 10%。

也就是说,开源模型早就不是极客的玩具了,它已经跑在无数公司的生产链路里。而这些模型,绝大多数来自中国。

另一边,美国最强的模型基本都锁在 API 后面。你想自己部署?没有。你想改?不行。

于是 2026 年 10 月 5 日,一家成立才两年半、此前一款模型都没发过的公司 Reflection AI,掏出了 Beam。美国媒体和从业者几乎一致地把它称作"美版 DeepSeek"。

更有意思的是这家公司的行事风格:模型还没发布,它已经签下了超过 70 亿美元的算力合同——从 2026 年 7 月 1 日起,每个月给 SpaceX 打 1.5 亿美元,只为租它 Colossus 2 数据中心里的 NVIDIA GB300,一直打到 2029 年,总额约 63 亿美元。

一家还没发布过模型的公司,先花 70 亿美元锁算力。这说明投资人押注的根本不是 Beam 这一款模型,而是"美国需要重新拥有一个开放模型体系"这件事本身。

那 Beam 到底交出了一份什么样的答卷?我们先别急着站队,把数字摊开看。

什么是 Beam ​

Beam 是 Reflection AI 于 2026 年 10 月 5 日发布的首个开放权重模型:一个 5010 亿总参数、每个 token 只激活 230 亿的稀疏 MoE(混合专家)模型,专注代码、推理和智能体任务,上下文 100 万 token,权重将在本月(2026 年 10 月)以 Apache 2.0 协议释出。

先把几个容易搞混的点拆清楚:

第一,5010 亿是"存着"的,230 亿是"跑着"的。 稀疏 MoE 的意思是:专家网络全都存着,但每个 token 只调度相关的那一小撮。所以你的知识容量按 5010 亿算,你的账单和显存按 230 亿算。这个 230 亿的激活量,比 GLM-5.2(约 400 亿)、Nemotron 3 Ultra(550 亿)、Kimi K3(1040 亿)都低不少——这就是它"省"的底气。

顺手给个横向参照:DeepSeek-V3 是 6710 亿总参数 / 370 亿激活,Kimi K2 是 1 万亿 / 320 亿,GLM-4.5 是 3550 亿 / 320 亿。Beam 走的是"总参数不小、激活参数刻意压低"的路线。

第二,它是纯文本模型,不吃图。 这点很重要。对比表里的 Kimi K3、DeepSeek V4.1 Flash 都是文本+图像输入,Beam 只做文本。所以别指望它读截图、看设计稿。

第三,创始人背景很硬。 Reflection AI 2024 年由两位前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 创办,总部在布鲁克林。Antonoglou 是 AlphaGo 的核心团队成员之一,两人都参与过 Gemini 1 和 Gemini 1.5 的工作。

有个细节挺有意思:他们创业之初其实压根没打算自己训基础模型。当时的判断是"西方迟早会出现足够强的开放模型,我们站在上面做强化学习和 Agent 研究就行"。结果 DeepSeek V3 出来之后,中美开放模型的差距迅速拉大,他们又等了几个月——没等到。于是自己下场,Beam 就是这次战略转向后的第一份答卷。

第四,也是现阶段最要紧的一条:你现在只能用,还不能拥有。 Beam 正在做最后的红队测试(red-teaming)和评估,早期体验走 waitlist;权重、技术报告、模型卡和开发者工具包会在本月放出,协议已明确是 Apache 2.0。

我知道这话听着像泼冷水。但"开放权重"这四个字在 2026 年越来越像预售——先发跑分,权重排期。在权重真正落到你硬盘上之前,它只是一个承诺。

它有什么特点 ​

  • 真·大规模强化学习,这是 Beam 的技术主线。 Reflection 的判断很明确:预训练已经越来越像一门成熟的工程,下一阶段能力提升的主要变量,来自把强化学习本身继续 scale。他们用 10,500 张 NVIDIA GB300 GPU 连续跑了 4 周,生成了超过 1 亿次 rollout,单个 rollout 上下文最长 256K token。训练和打分消耗了约 13 亿个沙箱,覆盖近 100 万个编码、智能体和 STEM 环境。
  • 预训练用了 23.8 万亿 token,跑在 6,144 张 GB300 上,不到 4 周。 作为对比,DeepSeek-V3 用了 14.8 万亿,Kimi K2 约 15.5 万亿。数据来自网页、开源仓库,以及用视觉语言 OCR 流水线解析的 STEM 文献。官方称其数据清洗管线剔除了约 95% 的原始网页 token,同时捞回了约 1.8 万亿"常规过滤器会误杀"的高质量 token。
  • 效率是它唯一的、也是全部的主张。 官方口径:完成相似难度的推理任务,Beam 消耗的 token 和推理算力约为 GLM 5.3、GPT-6 Luna 的 1/3 到 1/4,对标 GLM 5.2 时用 3~4 倍更少的推理算力拿到相近表现。Reflection 自己也很坦率:Kimi K3 在绝对能力上仍然领先,Beam 的卖点是"每 token 的智能密度",不是榜单第一。
  • 架构上做了不少"防炸"设计。 52 层,局部注意力与全局注意力交错 + 细粒度路由专家。负载均衡沿用 DeepSeek-V3 的**无辅助损失(auxiliary-loss-free)**方法,并加上专家偏置更新的余弦衰减——预训练结束时,最忙的专家平均负载只有均衡值的 1.04 倍,说明路由没有塌缩。数值稳定性上叠了 SandwichNorm、逐元素注意力门控、按深度的激活缩放、FP32 残差累积四件套,官方称全程没有出现不可恢复的 loss 突刺。
  • 推理强度可以调。 Beam 提供 reasoning effort 参数:调低就短平快,调高就在难题上多想一会儿。团队可以按任务难度和算力预算自己拨这个旋钮——这点在生产里其实比跑分更值钱。
  • 安全走的是"双教师蒸馏"。 他们从同一个预训练检查点单独训了一个安全对齐教师模型,再用多教师在线策略蒸馏(MOPD)把它和大规模 RL 教师合并。对齐训练用了 deliberative alignment,且数据集是对抗式迭代生成的:每轮训一个模型,再生成能诱导有害或过度拒答行为的提示,把成功的攻击折回下一轮 SFT。官方还承诺开源他们内部开发的安全评测,给社区留一套可检验的标准。
  • RL 基础设施的数字也很吓人。 平均维持 11 万条并发 rollout;新权重推送到推理集群的中位延迟约 12 秒;71 次推理故障处理下来没有中断过训练。为了扛住异步策略梯度里的滞后,他们声称即使 rollout 比当前策略落后 107 个权重版本(约一天)也能保持稳定收敛。
  • 开源策略是"全家桶",不只是丢个权重。 Reflection 说自己要做的不只是开放模型,还有配套的开源软件(可部署容器、定制配方、agentic harness)以及基础设施——支持 API 调用,也支持私有云、本地服务器、**物理隔离(air-gapped)**和边缘环境部署。

官方自报的跑分(注意:全部为 Reflection 自行公布,尚无第三方复现):

基准Beam对比参照
SWE-bench Verified80.9Inkling 77.6、Nemotron 3 Ultra 70.7
SWE-bench Pro v2-Hard77.2Inkling 56.9
SWE-bench Pro v165.5GLM 5.2 62.1、DeepSeek V4.1 Flash 67.7
Terminal-Bench v2.180.1GLM 5.2 81.0、Kimi K3 88.3、DeepSeek V4.1 Flash 90.6
SWEBench Multilingual78.0Nemotron 3 Ultra 67.7
MCP Atlas78.7—
AIME 202697.8GLM 5.2 99.2、GLM 5.3 91.7
GPQA Diamond90.5GLM 5.3 91.7、Qwen 3.8 Max 93.5
HLE(无工具)36.2Kimi K3 46.9、Qwen 3.8 Max 43.6
SciCode49.7GLM 5.3 59.0、Kimi K3 58.7
SWE Atlas Codebase QnA34.6Kimi K3 68.0

看这张表有个很直观的感受:Beam 在"写代码、改代码"这类工程任务上站得很稳(SWE-bench Verified 80.9、多语言 78.0),但在"硬核推理与知识"上明显还差一档(HLE 36.2、SciCode 49.7 都被 GLM 5.3、Kimi K3 甩开)。至于 Terminal-Bench v2.1 的 80.1,说得直白点:这张表里它只赢了 Inkling 和 Nemotron 3 Ultra,输给了其他所有对比对象。

一句大实话:Beam 现在不是最强的,它是最"划算"的之一。 而且这张对比表里大量的 NR(未报告),说明这更像一份"精选对比",不是完整大乱斗。

用在哪儿 ​

先说清楚一件必须说清楚的事:Beam 目前没有任何公开的、已上线的企业落地案例。 权重还没放出来,谈部署案例为时过早。但它背后那一串合作关系,已经把目标客户画得很清楚了。

Reflection 的定位不是普通消费者,而是大型企业、政府机构、公共部门和"主权 AI"客户。 CEO Misha Laskin 的原话大意是:他们要服务那些不愿或无法使用中国模型、同时又希望拥有并控制自己 AI 能力的客户。

场景一:主权 AI 与政府部署(这是最实的那块)。

  • 韩国新世界集团(Shinsegae):2026 年 3 月签署合作备忘录,计划共建一座 250MW 的"主权 AI 工厂",用 Reflection 的开放权重模型 + NVIDIA GPU,为韩国企业和政府机构提供主权 AI 服务。分工是 Shinsegae 出土地、电力、许可和融资,Reflection 出设备设计和运营。美国商务部长出席了签约活动。注意:这是 MOU,不是已确认的客户合同。
  • 美国能源部 Genesis Mission 科研计划:Reflection 官网称将参与其中,为美国国家实验室提供开放模型。
  • 正在评估中的两家政府机构:美国 CAISS(Center for Advancing Innovation and Standards for Super Intelligence)与英国 AI 安全研究所(UK AI Security Institute)。

场景二:数据不能出境、又不能用中国模型的企业的自托管。 这是 Beam 最核心的商业逻辑。Apache 2.0 意味着可以私有云、本地机房、甚至物理隔离环境部署。对受监管行业(金融、国防、公共部门)来说,这个组合——美国血统 + permissive 协议 + 可 air-gapped 部署——在 2026 年是稀缺品。据报道,对冲基金和交易公司是对这类系统最积极的潜在买家之一。

场景三:编码智能体与终端自动化。 官方明确说 Beam 就是冲着 coding 和 agentic 训的。SWE-bench Verified 80.9、多语言 78.0 这两个数字,说明它在"读仓库、改代码、打补丁"这类活上是能打的。配合 reasoning effort 旋钮,团队可以按任务难度控制成本——这比"一律长考"的推理模型省钱得多。

场景四:替掉昂贵闭源推理模型的成本敏感场景。 如果你的 workloads 大量是长链条推理,官方宣称的 1/3~1/4 算力消耗就是直接的成本差额。当然,这个数字目前只存在于 Reflection 自己的图里。

现在到底能不能上手 ​

现阶段:不能自托管,只能排队。

  1. 申请 waitlist:去 reflection.ai 官网注册早期访问,目前是"选择性开放",模型还在做最终红队测试和安全评估。
  2. 用 API 先试:官方 API 的模型名是 Beam-501B-A23B,支持 reasoning effort 参数。定价目前没有公开。
  3. 等权重:官方承诺 2026 年 10 月内放出 Apache 2.0 权重、技术报告、模型卡,以及运行/评估/微调的全套工具链;生态上会同步接入一批开源推理运行时,并上架 Hugging Face(时间表官方给的是 11 月做社区集成)。

权重释出之后,大概率是这么跑(以 vLLM 为例,命令为预期用法,等权重落地后生效):

bash
# 安装支持该架构的推理引擎(以 vLLM 为例)
pip install -U vllm

# 多机多卡拉起服务(501B MoE,需张量并行 + 专家并行)
vllm serve reflection-ai/Beam-501B-A23B \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --max-model-len 1048576 \
  --served-model-name beam
python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

resp = client.chat.completions.create(
    model="beam",
    messages=[
        {"role": "user", "content": "读一下这个仓库的 CI 配置,找出为什么 nightly 构建会超时。"}
    ],
    extra_body={"reasoning_effort": "high"},  # 按任务难度拨旋钮
)
print(resp.choices[0].message.content)

硬件这块,先给个粗估(官方尚未给出显存指引,以下是按参数量推算的量级,别当准数):

  • FP8 权重:501B × 1 字节 ≈ 500GB 起,加 KV cache 和运行开销,单节点 8 卡 H200/B200/GB300(共 1.1~1.4TB 显存)是起步线
  • BF16 权重:约 1TB,基本要把多机多卡顶满
  • 量化版(社区常见的 INT4/FP4)通常在权重放出后几天到几周内跟上,门槛会降一大截
  • 1M 上下文是"有效长度",真跑满长上下文,KV cache 才是吃显存的大头

如果你只是想先摸摸它的脾气,走 API 最省事;真要自托管,等社区量化版,别急着当第一批吃螃蟹的人。

该不该押它 ​

说点个人立场。

Beam 让我觉得靠谱的地方不是跑分,是它把"效率"当成了唯一卖点,并且坦白承认自己不是最强。在一个人人都在刷榜的行业里,这种"我不第一,但我便宜三倍"的表述反而更像真话。加上他们承诺开源内部安全评测、会放出完整技术报告——这家公司至少愿意被检验。

让我保留意见的地方也很明确:所有数据都是自报的,对比表里塞满了 NR,权重还没落地。 一家估值 250 亿美元的公司发布的第一款模型,跑分表由自己出,这在 2026 年已经不算稀奇,但也不该被当成事实。

另外有个结构性风险值得单独提一句:NVIDIA 既是 Reflection 的最大投资方之一(单独投了 8 亿美元),又是它通过 SpaceX 租到的 GB300 的供应商。 换句话说,NVIDIA 一边是股东,一边是间接卖家。这不算问题,但你得知道这层关系存在。

至于"美国版 DeepSeek"这个称号——等权重真放出来、第三方复现跑完,再叫也不迟。

进阶 ​

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区