---
url: /lm/dots3-note/introduction.md
description: >-
  小红书开源的2800亿参数多模态MoE大模型dots3-note是什么？512K上下文、文本/图像/视频/音频全理解、Apache
  2.0开放权重，IMO满分同系列，五分钟搞懂这个能装进"小红书"的大模型
---

# 认识dots3-note

你每天刷的小红书，上周悄悄干了一件狠事。

8 月 14 日，这个你拿来做菜谱、找攻略、种草口红的 App，开源了一个 **2800 亿参数**的大模型。不是"做个 demo 秀肌肉"那种，是权重、代码、技术报告全甩出来的那种——而且协议是 **Apache 2.0**，商用不卡你。

更反常识的一点是：它总参数 2800 亿，但**每次推理只激活 160 亿**。

你以为这是个走路带风的大块头，结果人家是个精算师——肚子里装了 280B 的家底，干活时只点 16B 的兵。这就是为什么它能用"小身板"去够那些比它大好几倍的模型才够得着的能力。

> 还记得我们上周聊的 Muse Glimmer 吗？那是个能塞进你笔记本的 30B 小钢炮。今天这个完全相反——它是给机房准备的巨兽，但思路一脉相承：把"能不能真的跑起来"当成第一性原理。

## 什么是 dots3-note

dots3-note preview 是小红书旗下 **dots 模型实验室**发布的 **dots3 系列第一个开放权重的模型**。一句话定位：**面向长程真实生活任务的轻量多模态智能体基座**。

它是个 **MoE（混合专家）模型**：

* 总参数 **280B**（2800 亿）
* 每次推理只激活 **16B**（160 亿）
* 支持 **512K** 超长上下文（约 50 万 token）
* 能理解**文本、图像、视频、音频**四种输入，输出目前是文本

注意"轻量"这两个字。在 dots3 家族里（后续还会有 jazz、aria 等成员，覆盖不同复杂度、速度和成本），note 是**最轻的那个**。它的目标不是在所有榜单上碾压一切，而是用 16B 的激活成本，去够那些"参数规模数倍于自己"的大模型才够得着的效果——尤其是**复杂推理和长程 Agent 任务**。

它是 Apache 2.0 开源的，权重挂在 **Hugging Face、ModelScope、GitHub** 三处，提供 **BF16 和 FP8** 两种精度。

### 核心架构（官方模型卡拆解）

拆开看，这个"轻量"是怎么做到的：

* **45 层 MoE + 1 层 Dense**：总共 1 个稠密层 + 45 个专家层
* **256 个路由专家 + 1 个共享专家，每次 top-8**：所以激活参数被压在 16B
* **注意力是 13 层 DSA + 33 层 SWA（约 1:3）**：DSA 全局注意力只看 top-2048，其余用滑动窗口省算力——这是它撑起 512K 上下文还不爆显存的关键
* **MoE ViT 视觉编码器**：7B 总参数、激活 1.2B，负责图像和视频理解
* **800M 稠密音频编码器**：负责语音/音频理解
* **MTP（多 token 预测）**：1 个共享层 + 1.13B，用来做投机解码加速
* 词表 15.2 万，隐藏维度 5120

> 一句话总结架构哲学：**用 MoE 把"知识容量"和"推理成本"解耦**。280B 负责"什么都懂"，16B 负责"算得快"。这是 2026 年大模型的主流打法，但小红书把它用在了多模态 + 长程 Agent 这个更刁钻的场景上。

## dots3-note 的核心特点

* **真·开放权重**：Apache 2.0，权重+代码+（一周内）技术报告全给，HF / ModelScope / GitHub 三处可下
* **多模态全理解**：文本、图像、视频、音频一把抓，输出为文本（当前预览版）
* **512K 超长上下文**：一本几百页 PDF、一整段几小时的会议录音+录屏，它能一口气吞下去
* **MoE 高效架构**：280B 家底、16B 激活，长程任务上能逼近数倍于己的大模型
* **为 Agent 而生**：原生支持工具调用、多步任务编排、记忆更新与自我适应
* **IMO 满分同系列**：它的一个分支版本，在 IMO 2026 拿下了官方认证的 **42/42 满分金牌**
* **主流框架原生支持**：vLLM、SGLang、Transformers 都已对接（或 PR 在审）
* **国产全栈适配**：华为昇腾已完成 0-Day 全量适配，国产算力可直接跑

## 性能与能力边界

模型卡里的评测分表还没完全放出（技术报告一周内补），但从官方披露的**能力清单**能看清它的主攻方向——几乎全压在"难"的任务上：

| 能力方向 | 涉及的评测基准（官方列出） |
|---------|--------------------------|
| 通用推理 / Agent | ARC-AGI-2/3、Claw-Eval、Codeforces、WildClawBench |
| 代码 | SWE-bench、NL2repo（生成完整仓库）、Terminal-Bench |
| 深度搜索 | BrowseComp、DeepSearchQA、VibeSearchBench（多轮模糊搜索） |
| 视觉理解 | Charxiv-RQ、GDP pdf（文档/图表）、WorldVQA、SimpleVQA |
| 视频 | MMEVideo v2（启用音频输入） |
| 音频 | MMAU-Pro、VoiceBench |
| 真实生活长程模拟 | VibeLifeBench（婚礼筹备、咖啡电商经营、全周期旅游管家） |

最硬的一条证据是 **IMO 2026 满分**：团队基于 dots3-note preview 的**分支版本**搭了一套内部 harness，让 Agent 递归生成证明、通过工具调用自我评估与增强，最终拿到 IMO 官方认证的 **42/42 满分金牌**。注意，满分的是它的"分支"而非直接发布的预览版本身——但这足以证明它"递归自我评价、长程推理"的能力不是吹的。

> 说句公道话：当前还是 **preview（预览版）**，RL 训练还没吃饱。官方自己承认在"幻觉抑制、多模态平衡、稳定性"上还有不足，真实生活任务目前只在模拟环境里验证过。所以它适合尝鲜、做研究和搭 Agent 原型，离"直接上生产替你管公司"还有距离。

## 谁在用：发布 48 小时内的真实信号

这模型 8 月 14 日才出，谈"客户案例"还太早。但有两个**真实、具体、可核实**的采用信号，比编造案例更有说服力：

**1. 华为昇腾：0-Day 全量适配（这是教科书级的大厂采用）**

8 月 16 日，小红书发布后仅两天，华为官方宣布：昇腾 **Atlas 800 A3**、**Atlas 900 A3 SuperPoD** 超节点已完成 dots3-note preview 的**全量适配**，并基于 **vLLM Ascend** 开源推理引擎提供完整部署与推理能力。换句话说，国产算力上它能"开箱即跑"，不用等社区移植。

**2. 小红书自己就是第一个用户**

dots 实验室本就是小红书内部的团队。这个模型从设计第一天就不是"为发论文而生"，而是为了理解小红书上海量的**图文笔记、短视频、语音**——它的多模态基因，根子就在自家业务里。官方还提到用它来做"小红书 VR 版"的开发。

**3. dots 系列早就在开源了**

这不是小红书第一次开源。此前他们已经放出过做文档解析的 **dots.ocr**、视觉理解的 **dots.vlm1**、语言模型 **dots.llm1** 等。dots3-note 是这套"dots 开源家族"里第一个多模态大模型，路线是连贯的。

## 初体验：三种打开方式

它和 Muse Glimmer 不一样——**280B 装不进你的笔记本**。FP8 权重需要一台 **8 卡 H100** 的机器。所以普通人最现实的入口是 API。

**方式一：最省力——申请官方 API**

去 [dots.ai/platform](https://dots.ai/platform) 申请模型 API，拿到后直接用 OpenAI 兼容客户端调：

```python
from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")

# enable_thinking=True 开启推理模式；False 直接给答案
response = client.chat.completions.create(
    model="dots3-note-prev",
    messages=[{"role": "user", "content": "用一句话介绍你自己"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(response.choices[0].message.content)
```

多模态也一样简单，把 content 换成图文/音频/视频即可：

```python
messages = [{"role": "user", "content": [
    {"type": "image_url", "image_url": {"url": "https://.../chart.png"}},
    {"type": "text", "text": "这张图里哪个季度下滑最明显？"}
]}]
```

**方式二：自己部署——vLLM（8×H100，FP8）**

```bash
# 需要 vLLM main 分支（或近期 nightly）
vllm serve dots-studio/dots3-note-prev-fp8 \
  --served-model-name dots3-note-prev \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --moe-backend deep_gemm \
  --max-model-len 262144
```

起来后就是个 OpenAI 兼容服务，上面那段 Python 代码把 `base_url` 指向它就能用。想开工具调用，加 `--enable-auto-tool-choice --tool-call-parser dots`；想再快一点，加 MTP 投机解码 `--speculative-config '{"method":"mtp","num_speculative_tokens":3}'`。

**方式三：SGLang（官方给了 Docker 一键镜像）**

```bash
docker run --gpus all --ipc=host -p 8000:8000 \
  lmsysorg/sglang:dev-dots3-note \
  sglang serve --model-path dots-studio/dots3-note-prev-fp8 \
  --context-length 524288 --tp-size 8 --ep-size 8 \
  --enable-multimodal --trust-remote-code
```

权重地址记一下：Hugging Face 搜 `dots-studio/dots3-note-prev`（FP8 版是 `dots3-note-prev-fp8`），ModelScope 同名，GitHub 在 `studio-dots-ai/dots3-note-prev`。

> 一个小提醒：别被"开源"两个字冲昏头去想"本地跑"。这个模型的体感是"机房级"的——FP8 都要 8 张 H100。对个人来说，**API 试用 + 等社区出更小蒸馏版**才是正路。真要自建，云上按量租 8 卡 H100 比买划算得多。

## 为什么这件事值得你关注

抛开参数和榜单，小红书开源 dots3-note 有几个信号意味深长：

第一，**多模态 + 长程 Agent 正在成为开源主战场**。上半年大家还在比"谁文本推理强"，下半年 dots3-note、Muse Glimmer 这类"能看、能听、能干活、能长跑"的模型开始成批冒头。2026 年开源模型的竞争维度，已经从"聊天"升级到了"替你办完一整件事"。

第二，**国产模型 + 国产算力闭环在提速**。小红书发模型，华为昇腾两天内 0-Day 适配——这种"发布即适配"的节奏，放在一年前是不敢想的。对做私有化部署、数据不能出内网的团队，这是实打实的好消息。

第三，**MoE 把"大模型"的门槛拆开了**。280B 的总参数听着吓人，但 16B 的激活成本意味着：未来你可能用"中等算力"就用上了"超大模型"的能力。这对中小企业是利好。

> 我们做技术内容的，最怕两件事：一是追了个假热点，二是把预览版当成品吹。dots3-note 是个真开源、有硬架构、有 IMO 满分背书、有华为适配的真热点；但它也明明白白标着"preview"。这篇就当给你开扇窗——知道有这么个东西、它大概怎么回事、怎么上手，比一次讲透更重要。剩下的，等你真要用时再深挖。

## 进阶

dots3-note preview 代表的是 2026 年开源大模型一个很清晰的方向：**把模型从"聊天机器人"变成"能理解真实世界、能跑长程任务的智能体基座"**。多模态 MoE、512K 上下文、16B 激活成本、Apache 2.0 全开放——每一项都在说同一件事：开源模型正在从"能用"走向"能办事"。

它不完美，preview 版的幻觉和稳定性还要打磨，512K 长上下文对显存和框架的考验也才刚开始。但如果你关心国产开源大模型、多模态 Agent，或者单纯想看看"小红书做的模型长啥样"，dots3-note 值得你拉下来玩一玩——至少，从 API 申请开始，成本为零。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
