认识Beam:美版DeepSeek交卷了,5010亿参数只激活230亿,值得等吗
先看一组让人不太舒服的数字。
2026 年,Hugging Face 上中国模型的下载量占了全平台的 41%,月下载和累计下载都超过了美国。Vercel AI Gateway 的生产流量里,开放权重模型处理了 56% 的 Token——而去年 12 月这个数字还不到 10%。
也就是说,开源模型早就不是极客的玩具了,它已经跑在无数公司的生产链路里。而这些模型,绝大多数来自中国。
另一边,美国最强的模型基本都锁在 API 后面。你想自己部署?没有。你想改?不行。
于是 2026 年 10 月 5 日,一家成立才两年半、此前一款模型都没发过的公司 Reflection AI,掏出了 Beam。美国媒体和从业者几乎一致地把它称作"美版 DeepSeek"。
更有意思的是这家公司的行事风格:模型还没发布,它已经签下了超过 70 亿美元的算力合同——从 2026 年 7 月 1 日起,每个月给 SpaceX 打 1.5 亿美元,只为租它 Colossus 2 数据中心里的 NVIDIA GB300,一直打到 2029 年,总额约 63 亿美元。
一家还没发布过模型的公司,先花 70 亿美元锁算力。这说明投资人押注的根本不是 Beam 这一款模型,而是"美国需要重新拥有一个开放模型体系"这件事本身。
那 Beam 到底交出了一份什么样的答卷?我们先别急着站队,把数字摊开看。
什么是 Beam
Beam 是 Reflection AI 于 2026 年 10 月 5 日发布的首个开放权重模型:一个 5010 亿总参数、每个 token 只激活 230 亿的稀疏 MoE(混合专家)模型,专注代码、推理和智能体任务,上下文 100 万 token,权重将在本月(2026 年 10 月)以 Apache 2.0 协议释出。
先把几个容易搞混的点拆清楚:
第一,5010 亿是"存着"的,230 亿是"跑着"的。 稀疏 MoE 的意思是:专家网络全都存着,但每个 token 只调度相关的那一小撮。所以你的知识容量按 5010 亿算,你的账单和显存按 230 亿算。这个 230 亿的激活量,比 GLM-5.2(约 400 亿)、Nemotron 3 Ultra(550 亿)、Kimi K3(1040 亿)都低不少——这就是它"省"的底气。
顺手给个横向参照:DeepSeek-V3 是 6710 亿总参数 / 370 亿激活,Kimi K2 是 1 万亿 / 320 亿,GLM-4.5 是 3550 亿 / 320 亿。Beam 走的是"总参数不小、激活参数刻意压低"的路线。
第二,它是纯文本模型,不吃图。 这点很重要。对比表里的 Kimi K3、DeepSeek V4.1 Flash 都是文本+图像输入,Beam 只做文本。所以别指望它读截图、看设计稿。
第三,创始人背景很硬。 Reflection AI 2024 年由两位前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 创办,总部在布鲁克林。Antonoglou 是 AlphaGo 的核心团队成员之一,两人都参与过 Gemini 1 和 Gemini 1.5 的工作。
有个细节挺有意思:他们创业之初其实压根没打算自己训基础模型。当时的判断是"西方迟早会出现足够强的开放模型,我们站在上面做强化学习和 Agent 研究就行"。结果 DeepSeek V3 出来之后,中美开放模型的差距迅速拉大,他们又等了几个月——没等到。于是自己下场,Beam 就是这次战略转向后的第一份答卷。
第四,也是现阶段最要紧的一条:你现在只能用,还不能拥有。 Beam 正在做最后的红队测试(red-teaming)和评估,早期体验走 waitlist;权重、技术报告、模型卡和开发者工具包会在本月放出,协议已明确是 Apache 2.0。
我知道这话听着像泼冷水。但"开放权重"这四个字在 2026 年越来越像预售——先发跑分,权重排期。在权重真正落到你硬盘上之前,它只是一个承诺。
它有什么特点
- 真·大规模强化学习,这是 Beam 的技术主线。 Reflection 的判断很明确:预训练已经越来越像一门成熟的工程,下一阶段能力提升的主要变量,来自把强化学习本身继续 scale。他们用 10,500 张 NVIDIA GB300 GPU 连续跑了 4 周,生成了超过 1 亿次 rollout,单个 rollout 上下文最长 256K token。训练和打分消耗了约 13 亿个沙箱,覆盖近 100 万个编码、智能体和 STEM 环境。
- 预训练用了 23.8 万亿 token,跑在 6,144 张 GB300 上,不到 4 周。 作为对比,DeepSeek-V3 用了 14.8 万亿,Kimi K2 约 15.5 万亿。数据来自网页、开源仓库,以及用视觉语言 OCR 流水线解析的 STEM 文献。官方称其数据清洗管线剔除了约 95% 的原始网页 token,同时捞回了约 1.8 万亿"常规过滤器会误杀"的高质量 token。
- 效率是它唯一的、也是全部的主张。 官方口径:完成相似难度的推理任务,Beam 消耗的 token 和推理算力约为 GLM 5.3、GPT-6 Luna 的 1/3 到 1/4,对标 GLM 5.2 时用 3~4 倍更少的推理算力拿到相近表现。Reflection 自己也很坦率:Kimi K3 在绝对能力上仍然领先,Beam 的卖点是"每 token 的智能密度",不是榜单第一。
- 架构上做了不少"防炸"设计。 52 层,局部注意力与全局注意力交错 + 细粒度路由专家。负载均衡沿用 DeepSeek-V3 的**无辅助损失(auxiliary-loss-free)**方法,并加上专家偏置更新的余弦衰减——预训练结束时,最忙的专家平均负载只有均衡值的 1.04 倍,说明路由没有塌缩。数值稳定性上叠了 SandwichNorm、逐元素注意力门控、按深度的激活缩放、FP32 残差累积四件套,官方称全程没有出现不可恢复的 loss 突刺。
- 推理强度可以调。 Beam 提供 reasoning effort 参数:调低就短平快,调高就在难题上多想一会儿。团队可以按任务难度和算力预算自己拨这个旋钮——这点在生产里其实比跑分更值钱。
- 安全走的是"双教师蒸馏"。 他们从同一个预训练检查点单独训了一个安全对齐教师模型,再用多教师在线策略蒸馏(MOPD)把它和大规模 RL 教师合并。对齐训练用了 deliberative alignment,且数据集是对抗式迭代生成的:每轮训一个模型,再生成能诱导有害或过度拒答行为的提示,把成功的攻击折回下一轮 SFT。官方还承诺开源他们内部开发的安全评测,给社区留一套可检验的标准。
- RL 基础设施的数字也很吓人。 平均维持 11 万条并发 rollout;新权重推送到推理集群的中位延迟约 12 秒;71 次推理故障处理下来没有中断过训练。为了扛住异步策略梯度里的滞后,他们声称即使 rollout 比当前策略落后 107 个权重版本(约一天)也能保持稳定收敛。
- 开源策略是"全家桶",不只是丢个权重。 Reflection 说自己要做的不只是开放模型,还有配套的开源软件(可部署容器、定制配方、agentic harness)以及基础设施——支持 API 调用,也支持私有云、本地服务器、**物理隔离(air-gapped)**和边缘环境部署。
官方自报的跑分(注意:全部为 Reflection 自行公布,尚无第三方复现):
| 基准 | Beam | 对比参照 |
|---|---|---|
| SWE-bench Verified | 80.9 | Inkling 77.6、Nemotron 3 Ultra 70.7 |
| SWE-bench Pro v2-Hard | 77.2 | Inkling 56.9 |
| SWE-bench Pro v1 | 65.5 | GLM 5.2 62.1、DeepSeek V4.1 Flash 67.7 |
| Terminal-Bench v2.1 | 80.1 | GLM 5.2 81.0、Kimi K3 88.3、DeepSeek V4.1 Flash 90.6 |
| SWEBench Multilingual | 78.0 | Nemotron 3 Ultra 67.7 |
| MCP Atlas | 78.7 | — |
| AIME 2026 | 97.8 | GLM 5.2 99.2、GLM 5.3 91.7 |
| GPQA Diamond | 90.5 | GLM 5.3 91.7、Qwen 3.8 Max 93.5 |
| HLE(无工具) | 36.2 | Kimi K3 46.9、Qwen 3.8 Max 43.6 |
| SciCode | 49.7 | GLM 5.3 59.0、Kimi K3 58.7 |
| SWE Atlas Codebase QnA | 34.6 | Kimi K3 68.0 |
看这张表有个很直观的感受:Beam 在"写代码、改代码"这类工程任务上站得很稳(SWE-bench Verified 80.9、多语言 78.0),但在"硬核推理与知识"上明显还差一档(HLE 36.2、SciCode 49.7 都被 GLM 5.3、Kimi K3 甩开)。至于 Terminal-Bench v2.1 的 80.1,说得直白点:这张表里它只赢了 Inkling 和 Nemotron 3 Ultra,输给了其他所有对比对象。
一句大实话:Beam 现在不是最强的,它是最"划算"的之一。 而且这张对比表里大量的 NR(未报告),说明这更像一份"精选对比",不是完整大乱斗。
用在哪儿
先说清楚一件必须说清楚的事:Beam 目前没有任何公开的、已上线的企业落地案例。 权重还没放出来,谈部署案例为时过早。但它背后那一串合作关系,已经把目标客户画得很清楚了。
Reflection 的定位不是普通消费者,而是大型企业、政府机构、公共部门和"主权 AI"客户。 CEO Misha Laskin 的原话大意是:他们要服务那些不愿或无法使用中国模型、同时又希望拥有并控制自己 AI 能力的客户。
场景一:主权 AI 与政府部署(这是最实的那块)。
- 韩国新世界集团(Shinsegae):2026 年 3 月签署合作备忘录,计划共建一座 250MW 的"主权 AI 工厂",用 Reflection 的开放权重模型 + NVIDIA GPU,为韩国企业和政府机构提供主权 AI 服务。分工是 Shinsegae 出土地、电力、许可和融资,Reflection 出设备设计和运营。美国商务部长出席了签约活动。注意:这是 MOU,不是已确认的客户合同。
- 美国能源部 Genesis Mission 科研计划:Reflection 官网称将参与其中,为美国国家实验室提供开放模型。
- 正在评估中的两家政府机构:美国 CAISS(Center for Advancing Innovation and Standards for Super Intelligence)与英国 AI 安全研究所(UK AI Security Institute)。
场景二:数据不能出境、又不能用中国模型的企业的自托管。 这是 Beam 最核心的商业逻辑。Apache 2.0 意味着可以私有云、本地机房、甚至物理隔离环境部署。对受监管行业(金融、国防、公共部门)来说,这个组合——美国血统 + permissive 协议 + 可 air-gapped 部署——在 2026 年是稀缺品。据报道,对冲基金和交易公司是对这类系统最积极的潜在买家之一。
场景三:编码智能体与终端自动化。 官方明确说 Beam 就是冲着 coding 和 agentic 训的。SWE-bench Verified 80.9、多语言 78.0 这两个数字,说明它在"读仓库、改代码、打补丁"这类活上是能打的。配合 reasoning effort 旋钮,团队可以按任务难度控制成本——这比"一律长考"的推理模型省钱得多。
场景四:替掉昂贵闭源推理模型的成本敏感场景。 如果你的 workloads 大量是长链条推理,官方宣称的 1/3~1/4 算力消耗就是直接的成本差额。当然,这个数字目前只存在于 Reflection 自己的图里。
现在到底能不能上手
现阶段:不能自托管,只能排队。
- 申请 waitlist:去 reflection.ai 官网注册早期访问,目前是"选择性开放",模型还在做最终红队测试和安全评估。
- 用 API 先试:官方 API 的模型名是
Beam-501B-A23B,支持 reasoning effort 参数。定价目前没有公开。 - 等权重:官方承诺 2026 年 10 月内放出 Apache 2.0 权重、技术报告、模型卡,以及运行/评估/微调的全套工具链;生态上会同步接入一批开源推理运行时,并上架 Hugging Face(时间表官方给的是 11 月做社区集成)。
权重释出之后,大概率是这么跑(以 vLLM 为例,命令为预期用法,等权重落地后生效):
# 安装支持该架构的推理引擎(以 vLLM 为例)
pip install -U vllm
# 多机多卡拉起服务(501B MoE,需张量并行 + 专家并行)
vllm serve reflection-ai/Beam-501B-A23B \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--max-model-len 1048576 \
--served-model-name beamfrom openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="beam",
messages=[
{"role": "user", "content": "读一下这个仓库的 CI 配置,找出为什么 nightly 构建会超时。"}
],
extra_body={"reasoning_effort": "high"}, # 按任务难度拨旋钮
)
print(resp.choices[0].message.content)硬件这块,先给个粗估(官方尚未给出显存指引,以下是按参数量推算的量级,别当准数):
- FP8 权重:501B × 1 字节 ≈ 500GB 起,加 KV cache 和运行开销,单节点 8 卡 H200/B200/GB300(共 1.1~1.4TB 显存)是起步线
- BF16 权重:约 1TB,基本要把多机多卡顶满
- 量化版(社区常见的 INT4/FP4)通常在权重放出后几天到几周内跟上,门槛会降一大截
- 1M 上下文是"有效长度",真跑满长上下文,KV cache 才是吃显存的大头
如果你只是想先摸摸它的脾气,走 API 最省事;真要自托管,等社区量化版,别急着当第一批吃螃蟹的人。
该不该押它
说点个人立场。
Beam 让我觉得靠谱的地方不是跑分,是它把"效率"当成了唯一卖点,并且坦白承认自己不是最强。在一个人人都在刷榜的行业里,这种"我不第一,但我便宜三倍"的表述反而更像真话。加上他们承诺开源内部安全评测、会放出完整技术报告——这家公司至少愿意被检验。
让我保留意见的地方也很明确:所有数据都是自报的,对比表里塞满了 NR,权重还没落地。 一家估值 250 亿美元的公司发布的第一款模型,跑分表由自己出,这在 2026 年已经不算稀奇,但也不该被当成事实。
另外有个结构性风险值得单独提一句:NVIDIA 既是 Reflection 的最大投资方之一(单独投了 8 亿美元),又是它通过 SpaceX 租到的 GB300 的供应商。 换句话说,NVIDIA 一边是股东,一边是间接卖家。这不算问题,但你得知道这层关系存在。
至于"美国版 DeepSeek"这个称号——等权重真放出来、第三方复现跑完,再叫也不迟。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
