---
url: /lm/atria-dawn/introduction.md
description: >-
  Atria Dawn Preview 是上海人工智能实验室 Atria 团队于 2026 年 9 月 11 日开源的智能体基础模型，7440 亿参数 MoE
  基于 GLM-5.2、每 token 激活约 400 亿（8 个专家），256K 上下文，MIT
  协议可自由商用。以"可验证经验流水线"把训练奖励绑定在真实执行环境的可核验结果上，16 项基准中 5 项拿到最高分（DeepSearchQA
  96.0、BrowseComp 92.5、CyberGym 86.5、MLE-bench Lite 86.2、BFCL v4
  77.0）。没有发布会、没有价格页，只有权重和一个 GitHub 仓库。
---

# 认识 Atria Dawn Preview：7440 亿参数的智能体模型，被上海 AI 实验室"一声不吭"扔了出来

2026 年 9 月 11 日，一个叫 `Atria-Dawn-Preview` 的仓库出现在 GitHub 上。

没有发布会，没有直播，没有价格页，没有朋友圈刷屏。就那么静静地出现了——权重、模型卡、一句 MIT 许可。第二天补了个 FP8 checkpoint，三天后才把论文挂上 arXiv。

放出来的是什么？一个 **7440 亿参数的智能体模型**。

我做内容这么久，见过的"前沿模型发布"基本都是同一套剧本：先技术报告，再直播，再定价，再一堆联动稿。这次全反过来。**一个实验室把前沿级 Agent 能力直接丢到了公网上，用最宽松的 MIT 协议，连句"欢迎使用"都没说。**

说实话，这种反差感比任何发布会都让人上头。

## 什么是 Atria Dawn Preview

**Atria Dawn Preview 是上海人工智能实验室（Shanghai AI Lab）Atria 团队开源的下一代智能体基础模型，构建在 7440 亿参数的 MoE 基座 GLM-5.2 之上，每 token 只激活约 400 亿参数（走 8 个专家），256K 上下文，MIT 协议，权重在 [Hugging Face](https://huggingface.co/internlm/Atria-Dawn-Preview) 和魔搭同步开放。**

先把三件事说清楚，不然很容易看错它的定位。

**第一，它不是从零预训练的，是"后训练转岗"。** 基座 GLM-5.2 是智谱（Z.ai）在 2026 年 6 月放出来的 744B MoE 基础模型，本身就带着 MIT 许可。上海 AI 实验室没重训一遍，而是在它上面做后训练，**把一个通用基座专门化成"能干长活"的 Agent**。这个路径现在越来越常见了：基座厂商开源 → 别的机构后训练 → 再开源，一个季度内完成一轮。

**第二，它不是一个聊天模型，官方甚至懒得装。** 模型卡里明确写着，这东西面向的是**需要持续理解环境、调用工具、多步执行并能从失败里恢复**的科研与工程工作流。换句话说，评价单位是"**一件事有没有办完**"，不是"这一轮答得漂不漂亮"。

**第三，"可验证经验流水线"是它的核心主张。** 这个叫 **Verifiable Experience Pipeline（可验证经验流水线）** 的训练方法，是把工具调用接到**真实的可执行环境**上，最后用**外部信号**（测试是否通过、指标是否达标、文件状态、几何结构、信源证据）来判定结果。

> 这句话值得反复读：**评判标准不是"这个回答看起来对不对"，而是"这一跑有没有产出可核验的结果"。**
> 过去我们给模型加 Agent 能力，靠的是提示词工程把技能"外挂"上去。Atria 想干的是**在训练阶段就把这种能力内化进去**。

## 它有什么特点

* **MIT 协议 + 744B 前沿级 Agent，这个组合极其罕见。** 允许商用、允许修改、允许再分发，没有任何使用限制条款。OpenAI 和 Anthropic 都没在旗舰模型上给过这种条件。这是目前**可自托管的最大规模开放许可智能体模型之一**。
* **16 项基准里 5 项拿到自己表格上的最高分。** DeepSearchQA **96.0**、BrowseComp **92.5**、CyberGym **86.5**、MLE-bench Lite **86.2**、BFCL v4 **77.0**、AutomationBench **53.8**。**领先最宽的正好是长程智能体任务**——浏览器式深度检索和网络安全。
* **官方把短板也一起贴在表上了，这点我挺respect。** 看这张对比表（官方 model card 数据）：

| 基准 | Atria Dawn | DeepSeek V4 Pro | Kimi K3 | Qwen 3.8 Max | GLM 5.3 | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|---|---|
| DeepSearchQA | **96.0** | — | 95.9 | — | 94.7 | 93.2 | — |
| BrowseComp | **92.5** | 83.4 | 91.2 | — | — | 92.2 | 90.8 |
| CyberGym | **86.5** | 83.3 | 78.7 | 73.8 | 84.5 | 83.6 | — |
| MLE-bench Lite | 86.2 | **86.8** | 85.8 | 81.3 | 80.8 | 88.9 | **88.0** |
| BFCL v4 | **77.0** | 71.4 | 69.1 | — | 74.1 | — | — |
| AutomationBench | **53.8** | 41.7 | 45.9 | 49.7 | 49.2 | 45.7 | 49.4 |
| SWE-bench Pro | 59.6 | 58.3 | 61.6 | 65.1 | 60.3 | 61.4 | **74.7** |
| Terminal-Bench 2.1 | 78.3 | 78.7 | — | **89.3** | 85.4 | 85.1 | **90.2** |
| GDPval | 1583 | 1517 | 1611 | 1722 | 1667 | 1682 | **1768** |
| JobBench | 50.3 | 54.1 | 54.3 | 52.7 | **58.2** | 45.4 | **68.0** |

一眼就能看出画像：**研究探索类强，工程交付类弱。** SWE-bench Pro 59.6 对 Opus 5 的 74.7，JobBench 50.3 对 68.0，Terminal-Bench 2.1 78.3 对 90.2。**敢把自己不行的地方原样贴出来，比开一场发布会更值钱。**

* **能力被组织成四个维度，不是一锅粥。** 模型卡把能力分成 **Discovery（检索与组织证据、深度研究、把问题转成可执行的实验方案）**、**Creation（软件、交互应用、游戏、数据可视化、机器学习系统）**、**Delivery（把文档、数据、设计需求变成报告和演示）**、**Cybersecurity（分析问题、验证漏洞、打补丁、在授权环境内复验）**。
* **两个 checkpoint 都给，FP8 专门用来拉低硬件门槛。** instruct 全精度版 + FP8 量化版，都是 256K 上下文。FP8 约 756GB 起，BF16 接近 1.5TB——**是的，你没看错，这是一台机器的重量。**
* **部署文档把 SGLang、vLLM、Codex、Claude Code 都覆盖了。** 不是丢个权重让你自己想办法。
* **论文 143 位作者，还附了人机协作研究。** 从 56 名参与者那里收集了 769 条任务记录，其中**约三分之一被人类参与者评为"没有 AI 协助就做不成"**。

> 我特别想说"研究探索强、工程交付弱"这个画像。
> 这不是黑点，这是**诚实**。绝大多数的模型卡都在挑自己赢的那几项讲，Atria 这张表把输的地方全列了。**一个愿意告诉你"我在哪儿不行"的团队，比一个只给你看高光的团队可信得多。**

## 用在哪儿

先说句实话：**它是 2026 年 9 月 11 日刚放出来的 Preview 版，目前没有公开的大规模生产落地案例。** 我不会给你编一个"某某大厂已用上"。但官方放出来的两个 demo 和那张基准表，能很清楚地反推出它适合什么。

**深度研究与证据整理 Agent。** 这是它最硬的一块。DeepSearchQA 96.0、BrowseComp 92.5、WideSearch 81.9 全部领先。适合做竞品调研、技术尽调、文献综述、把"一个问题"变成"一份带引用的可执行实验方案"。

**长程科研与工程实验。** 官网最狠的那个 demo：在关闭联网搜索的环境里，给它 **100GB 全球气象数据**，它自己设计了一个 **4 亿参数以上的 ViT 网络**，训了 **45,000 步**，建模了 **69 个气象变量的演化**，做出了一个**一分钟内预报未来一周全球天气**的系统——官方称部分预测指标超过了 NVIDIA 的经典模型 FourCastNet。另一个 demo 是**从零搭一个 MiniOS，20 分钟**。

> 100GB 数据 → 自己设计网络 → 训 4.5 万步 → 跑出超过 FourCastNet 的预报系统。
> 如果这个 demo 是真的，那"AI 做科研"这句话的分量就完全不一样了。它不是在帮你写文献综述，它是**自己把实验跑完了**。

**授权环境下的安全验证。** CyberGym 86.5 是全场最高，能力维度里专门列了 Cybersecurity：分析问题、验证漏洞、打补丁、再复验。这一项我得加个括号——**它的前提是"授权环境"**，别拿去干别的。

**自托管的 Agent 底座。** 这是 MIT 协议真正的价值所在。对数据不出内网的金融、医疗、政务场景，或者对**不想被按 token 计费**的成本敏感团队，一个能自己下载、自己改、自己部署的 744B Agent 是很有吸引力的——前提是你有卡。

**不适合的地方也直说**：**它是纯文本模型，不吃图像**。官方 Codex 配置里明确写了，端点会拒绝图片并报 `400 Atria-Dawn-Preview is not a multimodal model`。另外 **256K 上下文在当下不算大**（竞品已经有 500K 甚至 1M 的），**SWE-bench Pro 59.6 说明它在真实代码库工程交付上还落后前沿一截**，τ³-Bench Banking 41.2 也说明复杂文档推理和模拟用户交互不是强项。

> 一句话总结定位：**它是个"科研合伙人"，不是"更会写代码的员工"。**
> 想让它替你把 PR 写漂亮，现在还差点意思；想让它把一个开放性的研究问题推进到"有可核验产出"，这才是它的主场。

## 初体验

**先说硬件，这个最劝退。** FP8 权重约 **756GB 起**，BF16 接近 **1.5TB**。也就是说，你至少需要 **8 张 H200/H800 级别的大显存卡**（单机 8 卡约 1.1TB）才能把 FP8 塞进去；BF16 基本要上 16 卡。**别拿一张 4090 来试，会很难看。**

**路线一：自托管（SGLang，官方要求 v0.5.13.post1 或更高）**

```bash
python -m sglang.launch_server \
  --model-path internlm/Atria-Dawn-Preview-FP8 \
  --port 8000 \
  --tp-size 8 \
  --mem-fraction-static 0.85 \
  --context-length 262144
```

**路线二：自托管（vLLM，官方要求 v0.23.0 或更高）**

```bash
vllm serve internlm/Atria-Dawn-Preview-FP8 \
  --port 8000 \
  --tensor-parallel-size 8 \
  --max-model-len 262144
```

两条路起完都是标准 OpenAI 兼容接口，落在 `http://localhost:8000/v1`。`--tp-size` 按你实际的卡数调。

**路线三：直接用托管 API（不想买卡的看这里）**

* 国际：`https://api.atria-asi.ai`（模型 ID `Atria-Dawn-Preview`）
* 国内：`https://discovery.intern-ai.org.cn`

```python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.atria-asi.ai/v1",
    api_key="YOUR_API_KEY",
)
resp = client.chat.completions.create(
    model="Atria-Dawn-Preview",
    messages=[{
        "role": "user",
        "content": "帮我调研近三年时序预测基础模型的进展，给出可执行实验方案和引用来源。"
    }],
    max_tokens=32768,
)
print(resp.choices[0].message.content)
```

**三个必须注意的坑：**

一是**别发图片**。它是纯文本模型，图文混着发会直接 400。如果你用 Codex 类客户端，记得把 provider 配成 text-only 模态。

二是**架构是 `glm_moe_dsa`**（MoE + DeepSeek 稀疏注意力）。官方部署文档直接指向 GLM-5.2 的 SGLang cookbook 和 vLLM recipe，**照着 GLM-5.2 那套走，别自己发明**。

三是**它是 Preview，不是 GA**。官方没说稳定版什么时候来，也没说这个 Preview 之后怎么办。**生产接入前请务必在自己的 harness 上复现一遍**，尤其是 AutomationBench 和长程工具链这类对脚手架极度敏感的指标。

## 进阶

如果这篇文章你只记住一件事，我希望是这个判断：**2026 年 Agent 赛道的竞争维度，正在从"榜单分数"转向"验证信号来自哪里"。**

Atria 最有价值的不是那五个第一，而是它把**验证放进了训练闭环**。工具调用接真实环境，结果由外部信号判定——测试过了没有、指标到没到、文件状态对不对。**当分数取决于"有没有真的跑出可核验的结果"时，这个分数的含金量就和"看起来像不像对的"完全不同量级。**

随着各家从"任务助手"往"项目级协作者"推，**验证信号的来源会决定一个分数到底值多少钱**。

冷水照例要泼，而且这次要泼得狠一点：

**那 16 项基准全是厂商自报的（vendor-reported），目前没有任何中立实验室复现过。** 智能体类基准对脚手架、工具权限、评测 harness 极其敏感，**self-reported 的 agent 分数，是行业里最容易失真的数字**。在第三方复现结果出来之前，这些分数请当作"声明"，不是"事实"。权重是可验证的，榜单行不是——这就是当下开源模型最微妙的地方。

另外，**它是纯文本、256K 上下文、Preview 状态，且 756GB 起的权重意味着部署成本全压在你自己身上**。MIT 免掉了按 token 计费的风险，但把服务成本甩给了部署方。**这笔账要自己算。**

我的建议很具体：如果你有卡，**用 vLLM 起一个 FP8 版本，挑一个你业务里最"开放性"的问题**——不是"把这个 bug 修了"，而是"调研一下这个方向，给我一份能跑的验证方案"——跑 20 次，看它能不能真的走到"产出可核验结果"这一步。**这一步能不能走完，决定了 Agent 对你到底是玩具还是生产力。**

再往深一层，我更推荐你去读那篇论文（arXiv:2609.15818，2026 年 9 月 14 日提交，143 位作者）里关于**可验证经验流水线**的部分，以及那个 769 条任务记录的人机协作研究。**"三分之一的任务没有 AI 就做不成"这句话，比任何榜单分数都更值得琢磨。**

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
