认识 LongCat-2.0:美团用五万张国产芯片,训出 1.6 万亿参数的开源模型
2026 年 9 月 9 日,北京首钢园,中国国际服务贸易交易会。
美团连续第七年参展。如果你对美团的印象还停留在"黄衣服骑手 + 30 分钟送达",那这次展台上最扎眼的东西可能会让你愣一下——一个总参数 1.6 万亿的开源大模型,LongCat-2.0,就摆在 AI 经营工作台 CatPaw 旁边,作为整个展台的技术底座对外讲。
一家给你送外卖的公司,训了个万亿参数模型出来。
更要命的是后半句:这个模型的完整训练流程和大规模部署,全部跑在国产算力集群上,一张英伟达的卡都没用。 5 万余张国产算力芯片,35 万亿 token 预训练,官方原话是"全程无回滚、无不可恢复的 loss 突刺"。
我第一次读到这句"无回滚"的时候,心里咯噔了一下。不是因为它听起来牛,而是因为这句话在国产芯片上成立的难度,比在 H100 集群上高一个数量级。在成熟生态里,训练崩了有现成的工具链兜底;在软件社区还欠发达的平台上,五万卡规模跑一个多月不出事,这背后是算子、通信、故障恢复全栈自己重写。
然后还有个更反直觉的数字。1.6 万亿参数,每个 token 只激活约 480 亿——3%。
我一直觉得,MoE 最性感的地方不是"参数大",而是它让"模型的知识容量"和"你为每次回答付的钱"彻底脱钩了。 1.6 万亿是它的藏书量,480 亿是它为了回答你这一句实际翻开的页数。
什么是 LongCat-2.0
LongCat-2.0 是美团 LongCat 团队开发并开源的 MoE 大语言模型,总参数 1.6 万亿,每 token 动态激活 330 亿至 560 亿参数(平均约 480 亿),原生支持 100 万 token 上下文,最大输出 131,072 token。架构上提出 LongCat 稀疏注意力(LSA)、N-gram Embedding 与 MOPD 多教师在线蒸馏后训练方案;预训练在 5 万余张国产算力芯片上完成,消耗超 35 万亿 token;以 MIT 协议在 GitHub 与 Hugging Face 开放 BF16 / FP8 / INT8 三种权重,允许免费商用。
时间线先捋清楚,这个很容易搞混:
- 2025 年 9 月 1 日:LongCat-Flash 发布,560B 总参、约 27B 激活、128K 上下文,MIT 协议,当时是跑在英伟达 H800 上训的。
- 2026 年 6 月 30 日:LongCat-2.0 正式发布并开源,权重同步上线 GitHub、Hugging Face 与 longcat.chat。
- 2026 年 7 月初:华为昇腾、摩尔线程、沐曦等国产芯片厂商集体宣布完成推理适配。
- 2026 年 9 月 9 日:作为核心展品亮相服贸会,被环球网、中证网、北京日报、新京报等媒体集中报道。
也就是说,它不算"刚发的新模型",但服贸会这一波把它重新推到了台前——真正值得聊的也不是"美团发了个模型"这条新闻本身,而是它证明的那件事。
先把三个最容易误读的地方说在前面:
第一,"1.6 万亿"不是让你买的显存数字,是让你下载的文件大小数字。 每 token 激活 480 亿,这才是决定推理成本的数。MoE 的精髓就在这儿:参数量和算力开销已经不是一回事了。
第二,LongCat-2.0 主攻的是编程与智能体,不是聊天。 官方原话是它"深度适配 Claude Code、OpenClaw、Hermes 等主流 Harness",在代码理解、仓库级修改、自动化任务执行上发力。指望它陪你谈心的,方向就错了。
第三,MIT 协议归 MIT,但你大概率跑不动。 1.6T 参数,BF16 权重是 TB 量级。官方给的参考部署是 SGLang + 16 张 H20 跑 FP8 检查点。这东西的定位是"给你权重、给你技术报告、你可以商用",不是"租张卡试试"。
它有什么特点
- 1.6T 参数 / 480 亿激活,激活还是动态的。 官方设计了一个叫 Zero-Computation Experts(零计算专家) 的门控机制:简单的 token 走近乎免费的子网络,复杂的 token 才调用真正的专家。激活量因此在 33B–56B 之间浮动,而不是像传统 MoE 那样交一笔固定的"每 token 过路费"。把算力花在输入真正需要的地方——这个思路我觉得比单纯堆专家数更聪明。
- LongCat 稀疏注意力(LSA):把"索引"这件事优化到极致。 它从 DeepSeek 稀疏注意力(DSA)演进而来。美团做性能分析后发现,DSA 里的轻量索引器(Lightning Indexer)才是端到端延迟的真正瓶颈——因为索引输出不连续、评分开销还是二次方。于是他们塞进去三项正交优化:流感知索引(SI) 把碎片化显存访问改造成可预知的顺序读取,实现合并的 HBM 访问;跨层索引(CLI) 利用"重要 token 在相邻层高度一致"这个经验规律,一次索引给好几层复用(靠训练时的跨层蒸馏实现);层级化索引(HI) 用先 block 级粗召回、再细粒度选择的二级打分,缩小候选空间。三项可以独立开关,HI 在 2.0 里是免训练、按任务插拔的。
- N-gram Embedding:135B 参数,不放在专家上。 这是我觉得整个架构里最"反共识"的一步。LongCat-2.0 的 MoE 稀疏度已经接近 97%——官方的判断是稀疏度已经越过甜点区,再加 135B 专家参数收益微乎其微;不如把这 135B 放到与 MoE 正交的维度上,用 n-gram(size 设为 5)token 组合把 embedding 空间扩展 100 倍以上。官方给了两条约束原则:MoE 稀疏度过甜点后 N-gram 更划算;N-gram 占比必须控制在 10% 以内(超过 50% 优势就消失)。额外好处是推理时大 batch 解码的显存 I/O 降了。简单说:与其继续招更多"专家",不如给所有人换一本更厚的词典。
- 3-step MTP 投机解码,连索引都复用。 三项索引策略被扩展到了 MTP 草稿模块:Target 模型里每两个连续层共享一次索引,而多步 MTP 中三个草稿步共用一次索引,Step 2 和 Step 3 直接复用 Step 1 的索引结果。投机解码本身的收益再叠一层。
- MOPD 后训练:三类专家组,最后再融合。 这是"多教师在线蒸馏"的落地形态。美团把后训练拆成三个隔离的专家组——Agent 能力专家组(代码、办公、检索,重点优化工具调用精度、多轮 API 参数解析、防死循环的自我纠错)、推理能力专家组(数学、STEM、多跳知识)、交互体验专家组(细粒度指令遵循、抑制幻觉、安全边界)。最后用 MOPD 架构在数万卡集群上把三者融合。我挺喜欢这个分工的——它承认了"会写代码""会推理""会说话"是三种不同的能力,硬塞进一个目标函数里训本来就是妥协。
- 5 万余张国产芯片,35 万亿 token,训练吞吐提升 35%+。 关键工程手段包括:6D 并行(TP/CP/EP/DP/PP 之外,额外引入 EMBP 给 N-gram Embedding 做并行)、物理超节点(每个最多 48 台机器,节点内全互联、节点间 RoCE,把高带宽通信域扩到数百张卡,额外带来约 30% 预训练吞吐)、ZeRO-1 + 选择性重计算 + 分配器层 OOM 自动卸载、以及在国产芯片上大规模部署 Muon 优化器。
- 确定性与可靠性是自己造的。 通信与计算两条路径都保证确定性,自研了覆盖 Embedding、FA、LSA、MoE 的确定性算子;规约类算子全改成二叉树分段累加以减少浮点误差累积;部分计算密集型算子加了比特翻转检测;链路故障做到识别、切流、恢复全程无人介入,修复后还得通过压测才能重新上岗。
- 推理侧是 PD 分离 + 一堆国产芯片特调。 Prefill 节点用多节点 Chunked Pipeline Parallel(CPP)缩小 EP 域,每个 stage 内用 Attention Sequence Parallelism 分担长序列;Decode 节点用 KV-cache 并行(KVP)切分显存,配 EP128 并行度 + EPLB 负载均衡。针对国产芯片还做了 Super Kernel(减少算子数、降低启动开销)、Weight Prefetch(利用较大的 L2 cache 预取权重,把 I/O 延迟藏进前一个算子的计算里)、以及用内置 200Gbps 网卡做 layer-wise 的 KV-cache 传输。
成绩放这儿(分数归一化到 0–100,标 * 的为外部公开报告指标,其余为美团内部统一框架实测):
| 评测 | LongCat-2.0 | Gemini 3.1 Pro | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.8 | 70.7* | 73.8* | 78.9* |
| SWE-bench Pro | 59.5 | 54.2* | 58.6* | 69.2* |
| SWE-bench Multilingual | 77.3 | 76.9* | — | 84.8* |
| FORTE(办公 Agent) | 73.2 | 70.3 | 77.8 | 77.2 |
| RWSearch | 78.8 | 76.3 | 85.3 | 77.3 |
| Writing Bench | 83.8 | 83.7 | 84.7 | 85.2 |
| IFEval | 90.0 | 96.1 | 95.0 | 86.0 |
| GPQA-diamond | 88.9 | 94.3* | 93.6* | 92.4 |
泼盆冷水,这张表得连着看:它赢在"干活",没赢在"全知"。 SWE-bench Pro 的 59.5 确实压过 GPT-5.5 的 58.6,Terminal-Bench 2.1 的 70.8 也压过 Gemini 3.1 Pro;但 GPQA-diamond 88.9、IFEval 90.0 都明显落后,BrowseComp 79.9 更是被一众对手甩开。 别看着 coding 榜单就开始幻想它什么都能干。
用在哪儿
最有说服力的部分其实不在 benchmark 表上,而在美团自己的业务里——毕竟这是一家把模型塞进真实流水线的公司。
场景一:长程编程 Agent。 官方演示里最狠的一个是"代码库迁移":模型同时读完整代码库和迁移文档,梳理整体架构,把整个插件重写到新 SDK——保留全部既有功能、发现潜藏 bug,首次构建即编译通过。这类任务的门槛就是上下文长度和跨文件推理,1M 上下文是硬前提。
场景二:商家经营,这是美团真正的护城河场景。 服贸会上公开的数据:
- 「智能掌柜」(面向堂食商家):已服务全国超 130 万 餐饮商家,累计解决商家问题 860 万个,覆盖评价分析、市场洞察、选址判断、门店巡检、同行对比。
- 「袋鼠管家」(面向外卖商家):把菜单优化、经营诊断、评价管理、门店巡检封装成一支 Agent 专家团,已有超 1.3 万 商家在用。举个工作流例子——商家问"业绩为什么下滑",系统会依次巡检商品、活动、差评、食品安全状况,然后给出菜单调整和营销推广建议。
- CatPaw(AI 经营工作台):2026 年 7 月 27 日正式上线,在美团内部已覆盖 9 万员工、搭建 3 万个 Agent。它采用"脑手分离"架构——Agent Loop 负责理解意图与规划,Sandbox 负责实际执行(读文件、操作浏览器、跑终端命令)。
场景三:消费端 Agent「小团」。 能识别时间、地点、预算、偏好等条件,结合商家供给与评价输出方案,覆盖找餐厅、攻略、预订、外卖、购商品、按症状寻药等 12 类 需求,累计响应超 7 亿次用户需求。
场景四:即时配送的硬件侧。 这块虽然不直接跑 LongCat,但能看出这轮 AI 落地的成色:智能头盔已服务超 170 万 骑手,碰撞检测准确度超 95%,事故核实时效从 382 分钟压缩到 2 分钟;室内外自主配送机器人「小黄蜂」累计配送订单超 5.5 万单。
场景五:给国产芯片当"万亿参数级的真实考场"。 这一步我认为意义被低估了。华为昇腾在 LongCat-2.0 开源后迅速在昇腾 910 系列完成适配——难点很具体:单卡显存只有 64GB(昇腾 A2),却要跑 1.6 万亿参数 + 百万级长序列,CANN 推理团队用 PD 分离架构做了针对性优化。摩尔线程、沐曦也在同日宣布完成推理适配。对国产算力厂商来说,一个万亿参数的真实负载,比一百个 benchmark 更能暴露问题。
我自己的看法:LongCat-2.0 最特别的不是它多强,而是它是唯一一个"训练方、使用方、受益方"是同一家公司的万亿模型。 大部分开源模型是实验室训出来找场景,它是先有 130 万商家的具体问题,再训模型去解决。这条路径产出的东西,可能 benchmark 不是最亮眼,但工业上更耐造。
初体验
先泼一盆现实主义的冷水:1.6T 参数,本地部署这件事对 99% 的人不成立。
BF16 权重是 TB 量级,官方参考配置是 SGLang + 16 张 H20 跑 meituan-longcat/LongCat-2.0-FP8 检查点。这是集群活儿,不是 workstation 活儿。
所以对多数人来说,"初体验"其实有三条更现实的路:
1. 直接在网页上聊
最简单的一条:打开 longcat.chat,注册即用。想直观感受它的 Agent 能力,官方博客上还挂了几个演示(软件工程、智能体任务、内容生成三类,含代码库迁移、Web 应用开发、数据分析、知识库搭建、演示文稿生成等)。
2. 用 API(OpenAI 兼容)
from openai import OpenAI
client = OpenAI(
api_key="你的密钥",
base_url="https://api.longcat.chat/openai", # 以官方控制台实际地址为准
)
resp = client.chat.completions.create(
model="LongCat-2.0",
messages=[
{"role": "user", "content": "读一下我这段埋点日志,找出三个最异常的上报模式"}
],
)
print(resp.choices[0].message.content)3. 塞进你已有的 Agent 工作流
这是官方主推的用法——LongCat-2.0 已经深度适配 Claude Code、OpenClaw、Hermes 等主流 Harness。如果你日常就在用这些工具,切换模型后端基本就是改个配置项的事,不用重写任何东西。
这一点我觉得比"发个新模型"本身更重要:模型竞争的主战场已经从"谁的分高"转移到"谁的 Harness 生态里能无痛替换"了。
想自己部署的话
权重在 Hugging Face 的 meituan-longcat 组织下,提供 BF16 / FP8 / INT8 三档,MIT 协议。大致流程是:
# 1. 安装推理框架(官方参考实现基于 SGLang)
pip install "sglang[all]"
# 2. 拉 FP8 权重
huggingface-cli download meituan-longcat/LongCat-2.0-FP8 \
--local-dir /path/to/LongCat-2.0-FP8
# 3. 多节点起服务(示意,按实际卡数与并行策略调整)
python -m sglang.launch_server \
--model-path /path/to/LongCat-2.0-FP8 \
--tp 16 --enable-ep-moe --trust-remote-code想跑在国产卡上,直接查昇腾(CANN)、摩尔线程(MUSA)、沐曦的官方适配文档,三家都有现成的推理方案。
说句实在话:这套流程的真正价值是"读"而不是"跑"。 MIT 权重 + 完整技术报告(含 LSA、N-gram Embedding、MOPD、6D 并行、PD 分离的全部细节),对想搞懂"万亿参数模型到底怎么训出来、怎么部署"的人来说,是份难得的一手教材。 想在生产上用,先调 API;等你的业务量把 API 账单撑到肉疼了,再考虑自建。
进阶
我的核心判断:LongCat-2.0 最重要的意义不在模型本身,而在它把"国产算力能不能训万亿模型"从一个疑问句变成了陈述句。
过去几年行业的隐含假设是:先进制程被卡住 → 算力不够 → 前沿模型训练落后。LongCat-2.0 提供的是一个反例——五万张国产芯片、35 万亿 token、一个多月、无回滚。它不能证明国产芯片已经追平英伟达(单片显存更小、软件生态更弱这些痛点,官方技术报告里写得很诚实,也正因为如此才有了 6D 并行、Super Kernel、Weight Prefetch 这一堆补丁),但它证明了这条路上没有物理意义上的死墙,只有工程问题。
而工程问题,是能靠堆人堆时间解决的。
第二个我觉得值得记住的点,是 N-gram Embedding 那条设计原则:当 MoE 稀疏度到 97% 之后,继续加专家的边际收益已经趋近于零,把参数挪到正交维度反而更划算。这是"参数效率"这条曲线第一次被公开地、成体系地讨论。 后面别的模型大概率会跟进。
当然,冷水还是得泼:
- benchmark 主要来自美团自述,带 * 的对比数字是外部公开报告拼的,评测条件(Claude Code 作为 scaffold、沙盒规格、temperature 设置)对结果影响很大,第三方复现还需要时间。
- 它在知识类和 BrowseComp 类任务上明显不占优,别拿它当通用全能选手用。
- 本地部署门槛极高,个人和小团队基本只能走 API。
- 服贸会上的"业界首个完全依靠国产算力完成训练和推理全流程的万亿参数开源大模型"这一表述来自媒体报道,官方技术报告的表述是"完整训练流程与大规模部署均全部使用国产算力集群"——两个说法的边界略有差别,引用时心里有数就行。
一个务实的起步建议:别一上来就替换主力模型。 挑一类你业务里高频、但容错高的任务(日志归因、工单分类、批量字段抽取),用 LongCat-2.0 跑 1000 条真实数据,同时盯三个数——准确率、端到端延迟、实际账单。跑通了再谈扩大范围。
毕竟,一个让五万张国产芯片连续跑一个多月没崩的模型,值得你认真测一测——但不值得你无脑切过去。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
