Skip to content

认识 Atria Dawn Preview:7440 亿参数的智能体模型,被上海 AI 实验室"一声不吭"扔了出来

2026 年 9 月 11 日,一个叫 Atria-Dawn-Preview 的仓库出现在 GitHub 上。

没有发布会,没有直播,没有价格页,没有朋友圈刷屏。就那么静静地出现了——权重、模型卡、一句 MIT 许可。第二天补了个 FP8 checkpoint,三天后才把论文挂上 arXiv。

放出来的是什么?一个 7440 亿参数的智能体模型

我做内容这么久,见过的"前沿模型发布"基本都是同一套剧本:先技术报告,再直播,再定价,再一堆联动稿。这次全反过来。一个实验室把前沿级 Agent 能力直接丢到了公网上,用最宽松的 MIT 协议,连句"欢迎使用"都没说。

说实话,这种反差感比任何发布会都让人上头。

什么是 Atria Dawn Preview

Atria Dawn Preview 是上海人工智能实验室(Shanghai AI Lab)Atria 团队开源的下一代智能体基础模型,构建在 7440 亿参数的 MoE 基座 GLM-5.2 之上,每 token 只激活约 400 亿参数(走 8 个专家),256K 上下文,MIT 协议,权重在 Hugging Face 和魔搭同步开放。

先把三件事说清楚,不然很容易看错它的定位。

第一,它不是从零预训练的,是"后训练转岗"。 基座 GLM-5.2 是智谱(Z.ai)在 2026 年 6 月放出来的 744B MoE 基础模型,本身就带着 MIT 许可。上海 AI 实验室没重训一遍,而是在它上面做后训练,把一个通用基座专门化成"能干长活"的 Agent。这个路径现在越来越常见了:基座厂商开源 → 别的机构后训练 → 再开源,一个季度内完成一轮。

第二,它不是一个聊天模型,官方甚至懒得装。 模型卡里明确写着,这东西面向的是需要持续理解环境、调用工具、多步执行并能从失败里恢复的科研与工程工作流。换句话说,评价单位是"一件事有没有办完",不是"这一轮答得漂不漂亮"。

第三,"可验证经验流水线"是它的核心主张。 这个叫 Verifiable Experience Pipeline(可验证经验流水线) 的训练方法,是把工具调用接到真实的可执行环境上,最后用外部信号(测试是否通过、指标是否达标、文件状态、几何结构、信源证据)来判定结果。

这句话值得反复读:评判标准不是"这个回答看起来对不对",而是"这一跑有没有产出可核验的结果"。 过去我们给模型加 Agent 能力,靠的是提示词工程把技能"外挂"上去。Atria 想干的是在训练阶段就把这种能力内化进去

它有什么特点

  • MIT 协议 + 744B 前沿级 Agent,这个组合极其罕见。 允许商用、允许修改、允许再分发,没有任何使用限制条款。OpenAI 和 Anthropic 都没在旗舰模型上给过这种条件。这是目前可自托管的最大规模开放许可智能体模型之一
  • 16 项基准里 5 项拿到自己表格上的最高分。 DeepSearchQA 96.0、BrowseComp 92.5、CyberGym 86.5、MLE-bench Lite 86.2、BFCL v4 77.0、AutomationBench 53.8领先最宽的正好是长程智能体任务——浏览器式深度检索和网络安全。
  • 官方把短板也一起贴在表上了,这点我挺respect。 看这张对比表(官方 model card 数据):
基准Atria DawnDeepSeek V4 ProKimi K3Qwen 3.8 MaxGLM 5.3GPT-5.6 SolClaude Opus 5
DeepSearchQA96.095.994.793.2
BrowseComp92.583.491.292.290.8
CyberGym86.583.378.773.884.583.6
MLE-bench Lite86.286.885.881.380.888.988.0
BFCL v477.071.469.174.1
AutomationBench53.841.745.949.749.245.749.4
SWE-bench Pro59.658.361.665.160.361.474.7
Terminal-Bench 2.178.378.789.385.485.190.2
GDPval1583151716111722166716821768
JobBench50.354.154.352.758.245.468.0

一眼就能看出画像:研究探索类强,工程交付类弱。 SWE-bench Pro 59.6 对 Opus 5 的 74.7,JobBench 50.3 对 68.0,Terminal-Bench 2.1 78.3 对 90.2。敢把自己不行的地方原样贴出来,比开一场发布会更值钱。

  • 能力被组织成四个维度,不是一锅粥。 模型卡把能力分成 Discovery(检索与组织证据、深度研究、把问题转成可执行的实验方案)Creation(软件、交互应用、游戏、数据可视化、机器学习系统)Delivery(把文档、数据、设计需求变成报告和演示)Cybersecurity(分析问题、验证漏洞、打补丁、在授权环境内复验)
  • 两个 checkpoint 都给,FP8 专门用来拉低硬件门槛。 instruct 全精度版 + FP8 量化版,都是 256K 上下文。FP8 约 756GB 起,BF16 接近 1.5TB——是的,你没看错,这是一台机器的重量。
  • 部署文档把 SGLang、vLLM、Codex、Claude Code 都覆盖了。 不是丢个权重让你自己想办法。
  • 论文 143 位作者,还附了人机协作研究。 从 56 名参与者那里收集了 769 条任务记录,其中约三分之一被人类参与者评为"没有 AI 协助就做不成"

我特别想说"研究探索强、工程交付弱"这个画像。 这不是黑点,这是诚实。绝大多数的模型卡都在挑自己赢的那几项讲,Atria 这张表把输的地方全列了。一个愿意告诉你"我在哪儿不行"的团队,比一个只给你看高光的团队可信得多。

用在哪儿

先说句实话:它是 2026 年 9 月 11 日刚放出来的 Preview 版,目前没有公开的大规模生产落地案例。 我不会给你编一个"某某大厂已用上"。但官方放出来的两个 demo 和那张基准表,能很清楚地反推出它适合什么。

深度研究与证据整理 Agent。 这是它最硬的一块。DeepSearchQA 96.0、BrowseComp 92.5、WideSearch 81.9 全部领先。适合做竞品调研、技术尽调、文献综述、把"一个问题"变成"一份带引用的可执行实验方案"。

长程科研与工程实验。 官网最狠的那个 demo:在关闭联网搜索的环境里,给它 100GB 全球气象数据,它自己设计了一个 4 亿参数以上的 ViT 网络,训了 45,000 步,建模了 69 个气象变量的演化,做出了一个一分钟内预报未来一周全球天气的系统——官方称部分预测指标超过了 NVIDIA 的经典模型 FourCastNet。另一个 demo 是从零搭一个 MiniOS,20 分钟

100GB 数据 → 自己设计网络 → 训 4.5 万步 → 跑出超过 FourCastNet 的预报系统。 如果这个 demo 是真的,那"AI 做科研"这句话的分量就完全不一样了。它不是在帮你写文献综述,它是自己把实验跑完了

授权环境下的安全验证。 CyberGym 86.5 是全场最高,能力维度里专门列了 Cybersecurity:分析问题、验证漏洞、打补丁、再复验。这一项我得加个括号——它的前提是"授权环境",别拿去干别的。

自托管的 Agent 底座。 这是 MIT 协议真正的价值所在。对数据不出内网的金融、医疗、政务场景,或者对不想被按 token 计费的成本敏感团队,一个能自己下载、自己改、自己部署的 744B Agent 是很有吸引力的——前提是你有卡。

不适合的地方也直说它是纯文本模型,不吃图像。官方 Codex 配置里明确写了,端点会拒绝图片并报 400 Atria-Dawn-Preview is not a multimodal model。另外 256K 上下文在当下不算大(竞品已经有 500K 甚至 1M 的),SWE-bench Pro 59.6 说明它在真实代码库工程交付上还落后前沿一截,τ³-Bench Banking 41.2 也说明复杂文档推理和模拟用户交互不是强项。

一句话总结定位:它是个"科研合伙人",不是"更会写代码的员工"。 想让它替你把 PR 写漂亮,现在还差点意思;想让它把一个开放性的研究问题推进到"有可核验产出",这才是它的主场。

初体验

先说硬件,这个最劝退。 FP8 权重约 756GB 起,BF16 接近 1.5TB。也就是说,你至少需要 8 张 H200/H800 级别的大显存卡(单机 8 卡约 1.1TB)才能把 FP8 塞进去;BF16 基本要上 16 卡。别拿一张 4090 来试,会很难看。

路线一:自托管(SGLang,官方要求 v0.5.13.post1 或更高)

bash
python -m sglang.launch_server \
  --model-path internlm/Atria-Dawn-Preview-FP8 \
  --port 8000 \
  --tp-size 8 \
  --mem-fraction-static 0.85 \
  --context-length 262144

路线二:自托管(vLLM,官方要求 v0.23.0 或更高)

bash
vllm serve internlm/Atria-Dawn-Preview-FP8 \
  --port 8000 \
  --tensor-parallel-size 8 \
  --max-model-len 262144

两条路起完都是标准 OpenAI 兼容接口,落在 http://localhost:8000/v1--tp-size 按你实际的卡数调。

路线三:直接用托管 API(不想买卡的看这里)

  • 国际:https://api.atria-asi.ai(模型 ID Atria-Dawn-Preview
  • 国内:https://discovery.intern-ai.org.cn
python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.atria-asi.ai/v1",
    api_key="YOUR_API_KEY",
)
resp = client.chat.completions.create(
    model="Atria-Dawn-Preview",
    messages=[{
        "role": "user",
        "content": "帮我调研近三年时序预测基础模型的进展,给出可执行实验方案和引用来源。"
    }],
    max_tokens=32768,
)
print(resp.choices[0].message.content)

三个必须注意的坑:

一是别发图片。它是纯文本模型,图文混着发会直接 400。如果你用 Codex 类客户端,记得把 provider 配成 text-only 模态。

二是架构是 glm_moe_dsa(MoE + DeepSeek 稀疏注意力)。官方部署文档直接指向 GLM-5.2 的 SGLang cookbook 和 vLLM recipe,照着 GLM-5.2 那套走,别自己发明

三是它是 Preview,不是 GA。官方没说稳定版什么时候来,也没说这个 Preview 之后怎么办。生产接入前请务必在自己的 harness 上复现一遍,尤其是 AutomationBench 和长程工具链这类对脚手架极度敏感的指标。

进阶

如果这篇文章你只记住一件事,我希望是这个判断:2026 年 Agent 赛道的竞争维度,正在从"榜单分数"转向"验证信号来自哪里"。

Atria 最有价值的不是那五个第一,而是它把验证放进了训练闭环。工具调用接真实环境,结果由外部信号判定——测试过了没有、指标到没到、文件状态对不对。当分数取决于"有没有真的跑出可核验的结果"时,这个分数的含金量就和"看起来像不像对的"完全不同量级。

随着各家从"任务助手"往"项目级协作者"推,验证信号的来源会决定一个分数到底值多少钱

冷水照例要泼,而且这次要泼得狠一点:

那 16 项基准全是厂商自报的(vendor-reported),目前没有任何中立实验室复现过。 智能体类基准对脚手架、工具权限、评测 harness 极其敏感,self-reported 的 agent 分数,是行业里最容易失真的数字。在第三方复现结果出来之前,这些分数请当作"声明",不是"事实"。权重是可验证的,榜单行不是——这就是当下开源模型最微妙的地方。

另外,它是纯文本、256K 上下文、Preview 状态,且 756GB 起的权重意味着部署成本全压在你自己身上。MIT 免掉了按 token 计费的风险,但把服务成本甩给了部署方。这笔账要自己算。

我的建议很具体:如果你有卡,用 vLLM 起一个 FP8 版本,挑一个你业务里最"开放性"的问题——不是"把这个 bug 修了",而是"调研一下这个方向,给我一份能跑的验证方案"——跑 20 次,看它能不能真的走到"产出可核验结果"这一步。这一步能不能走完,决定了 Agent 对你到底是玩具还是生产力。

再往深一层,我更推荐你去读那篇论文(arXiv:2609.15818,2026 年 9 月 14 日提交,143 位作者)里关于可验证经验流水线的部分,以及那个 769 条任务记录的人机协作研究。"三分之一的任务没有 AI 就做不成"这句话,比任何榜单分数都更值得琢磨。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区