认识dots3-note
你每天刷的小红书,上周悄悄干了一件狠事。
8 月 14 日,这个你拿来做菜谱、找攻略、种草口红的 App,开源了一个 2800 亿参数的大模型。不是"做个 demo 秀肌肉"那种,是权重、代码、技术报告全甩出来的那种——而且协议是 Apache 2.0,商用不卡你。
更反常识的一点是:它总参数 2800 亿,但每次推理只激活 160 亿。
你以为这是个走路带风的大块头,结果人家是个精算师——肚子里装了 280B 的家底,干活时只点 16B 的兵。这就是为什么它能用"小身板"去够那些比它大好几倍的模型才够得着的能力。
还记得我们上周聊的 Muse Glimmer 吗?那是个能塞进你笔记本的 30B 小钢炮。今天这个完全相反——它是给机房准备的巨兽,但思路一脉相承:把"能不能真的跑起来"当成第一性原理。
什么是 dots3-note
dots3-note preview 是小红书旗下 dots 模型实验室发布的 dots3 系列第一个开放权重的模型。一句话定位:面向长程真实生活任务的轻量多模态智能体基座。
它是个 MoE(混合专家)模型:
- 总参数 280B(2800 亿)
- 每次推理只激活 16B(160 亿)
- 支持 512K 超长上下文(约 50 万 token)
- 能理解文本、图像、视频、音频四种输入,输出目前是文本
注意"轻量"这两个字。在 dots3 家族里(后续还会有 jazz、aria 等成员,覆盖不同复杂度、速度和成本),note 是最轻的那个。它的目标不是在所有榜单上碾压一切,而是用 16B 的激活成本,去够那些"参数规模数倍于自己"的大模型才够得着的效果——尤其是复杂推理和长程 Agent 任务。
它是 Apache 2.0 开源的,权重挂在 Hugging Face、ModelScope、GitHub 三处,提供 BF16 和 FP8 两种精度。
核心架构(官方模型卡拆解)
拆开看,这个"轻量"是怎么做到的:
- 45 层 MoE + 1 层 Dense:总共 1 个稠密层 + 45 个专家层
- 256 个路由专家 + 1 个共享专家,每次 top-8:所以激活参数被压在 16B
- 注意力是 13 层 DSA + 33 层 SWA(约 1:3):DSA 全局注意力只看 top-2048,其余用滑动窗口省算力——这是它撑起 512K 上下文还不爆显存的关键
- MoE ViT 视觉编码器:7B 总参数、激活 1.2B,负责图像和视频理解
- 800M 稠密音频编码器:负责语音/音频理解
- MTP(多 token 预测):1 个共享层 + 1.13B,用来做投机解码加速
- 词表 15.2 万,隐藏维度 5120
一句话总结架构哲学:用 MoE 把"知识容量"和"推理成本"解耦。280B 负责"什么都懂",16B 负责"算得快"。这是 2026 年大模型的主流打法,但小红书把它用在了多模态 + 长程 Agent 这个更刁钻的场景上。
dots3-note 的核心特点
- 真·开放权重:Apache 2.0,权重+代码+(一周内)技术报告全给,HF / ModelScope / GitHub 三处可下
- 多模态全理解:文本、图像、视频、音频一把抓,输出为文本(当前预览版)
- 512K 超长上下文:一本几百页 PDF、一整段几小时的会议录音+录屏,它能一口气吞下去
- MoE 高效架构:280B 家底、16B 激活,长程任务上能逼近数倍于己的大模型
- 为 Agent 而生:原生支持工具调用、多步任务编排、记忆更新与自我适应
- IMO 满分同系列:它的一个分支版本,在 IMO 2026 拿下了官方认证的 42/42 满分金牌
- 主流框架原生支持:vLLM、SGLang、Transformers 都已对接(或 PR 在审)
- 国产全栈适配:华为昇腾已完成 0-Day 全量适配,国产算力可直接跑
性能与能力边界
模型卡里的评测分表还没完全放出(技术报告一周内补),但从官方披露的能力清单能看清它的主攻方向——几乎全压在"难"的任务上:
| 能力方向 | 涉及的评测基准(官方列出) |
|---|---|
| 通用推理 / Agent | ARC-AGI-2/3、Claw-Eval、Codeforces、WildClawBench |
| 代码 | SWE-bench、NL2repo(生成完整仓库)、Terminal-Bench |
| 深度搜索 | BrowseComp、DeepSearchQA、VibeSearchBench(多轮模糊搜索) |
| 视觉理解 | Charxiv-RQ、GDP pdf(文档/图表)、WorldVQA、SimpleVQA |
| 视频 | MMEVideo v2(启用音频输入) |
| 音频 | MMAU-Pro、VoiceBench |
| 真实生活长程模拟 | VibeLifeBench(婚礼筹备、咖啡电商经营、全周期旅游管家) |
最硬的一条证据是 IMO 2026 满分:团队基于 dots3-note preview 的分支版本搭了一套内部 harness,让 Agent 递归生成证明、通过工具调用自我评估与增强,最终拿到 IMO 官方认证的 42/42 满分金牌。注意,满分的是它的"分支"而非直接发布的预览版本身——但这足以证明它"递归自我评价、长程推理"的能力不是吹的。
说句公道话:当前还是 preview(预览版),RL 训练还没吃饱。官方自己承认在"幻觉抑制、多模态平衡、稳定性"上还有不足,真实生活任务目前只在模拟环境里验证过。所以它适合尝鲜、做研究和搭 Agent 原型,离"直接上生产替你管公司"还有距离。
谁在用:发布 48 小时内的真实信号
这模型 8 月 14 日才出,谈"客户案例"还太早。但有两个真实、具体、可核实的采用信号,比编造案例更有说服力:
1. 华为昇腾:0-Day 全量适配(这是教科书级的大厂采用)
8 月 16 日,小红书发布后仅两天,华为官方宣布:昇腾 Atlas 800 A3、Atlas 900 A3 SuperPoD 超节点已完成 dots3-note preview 的全量适配,并基于 vLLM Ascend 开源推理引擎提供完整部署与推理能力。换句话说,国产算力上它能"开箱即跑",不用等社区移植。
2. 小红书自己就是第一个用户
dots 实验室本就是小红书内部的团队。这个模型从设计第一天就不是"为发论文而生",而是为了理解小红书上海量的图文笔记、短视频、语音——它的多模态基因,根子就在自家业务里。官方还提到用它来做"小红书 VR 版"的开发。
3. dots 系列早就在开源了
这不是小红书第一次开源。此前他们已经放出过做文档解析的 dots.ocr、视觉理解的 dots.vlm1、语言模型 dots.llm1 等。dots3-note 是这套"dots 开源家族"里第一个多模态大模型,路线是连贯的。
初体验:三种打开方式
它和 Muse Glimmer 不一样——280B 装不进你的笔记本。FP8 权重需要一台 8 卡 H100 的机器。所以普通人最现实的入口是 API。
方式一:最省力——申请官方 API
去 dots.ai/platform 申请模型 API,拿到后直接用 OpenAI 兼容客户端调:
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")
# enable_thinking=True 开启推理模式;False 直接给答案
response = client.chat.completions.create(
model="dots3-note-prev",
messages=[{"role": "user", "content": "用一句话介绍你自己"}],
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(response.choices[0].message.content)多模态也一样简单,把 content 换成图文/音频/视频即可:
messages = [{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": "https://.../chart.png"}},
{"type": "text", "text": "这张图里哪个季度下滑最明显?"}
]}]方式二:自己部署——vLLM(8×H100,FP8)
# 需要 vLLM main 分支(或近期 nightly)
vllm serve dots-studio/dots3-note-prev-fp8 \
--served-model-name dots3-note-prev \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--moe-backend deep_gemm \
--max-model-len 262144起来后就是个 OpenAI 兼容服务,上面那段 Python 代码把 base_url 指向它就能用。想开工具调用,加 --enable-auto-tool-choice --tool-call-parser dots;想再快一点,加 MTP 投机解码 --speculative-config '{"method":"mtp","num_speculative_tokens":3}'。
方式三:SGLang(官方给了 Docker 一键镜像)
docker run --gpus all --ipc=host -p 8000:8000 \
lmsysorg/sglang:dev-dots3-note \
sglang serve --model-path dots-studio/dots3-note-prev-fp8 \
--context-length 524288 --tp-size 8 --ep-size 8 \
--enable-multimodal --trust-remote-code权重地址记一下:Hugging Face 搜 dots-studio/dots3-note-prev(FP8 版是 dots3-note-prev-fp8),ModelScope 同名,GitHub 在 studio-dots-ai/dots3-note-prev。
一个小提醒:别被"开源"两个字冲昏头去想"本地跑"。这个模型的体感是"机房级"的——FP8 都要 8 张 H100。对个人来说,API 试用 + 等社区出更小蒸馏版才是正路。真要自建,云上按量租 8 卡 H100 比买划算得多。
为什么这件事值得你关注
抛开参数和榜单,小红书开源 dots3-note 有几个信号意味深长:
第一,多模态 + 长程 Agent 正在成为开源主战场。上半年大家还在比"谁文本推理强",下半年 dots3-note、Muse Glimmer 这类"能看、能听、能干活、能长跑"的模型开始成批冒头。2026 年开源模型的竞争维度,已经从"聊天"升级到了"替你办完一整件事"。
第二,国产模型 + 国产算力闭环在提速。小红书发模型,华为昇腾两天内 0-Day 适配——这种"发布即适配"的节奏,放在一年前是不敢想的。对做私有化部署、数据不能出内网的团队,这是实打实的好消息。
第三,MoE 把"大模型"的门槛拆开了。280B 的总参数听着吓人,但 16B 的激活成本意味着:未来你可能用"中等算力"就用上了"超大模型"的能力。这对中小企业是利好。
我们做技术内容的,最怕两件事:一是追了个假热点,二是把预览版当成品吹。dots3-note 是个真开源、有硬架构、有 IMO 满分背书、有华为适配的真热点;但它也明明白白标着"preview"。这篇就当给你开扇窗——知道有这么个东西、它大概怎么回事、怎么上手,比一次讲透更重要。剩下的,等你真要用时再深挖。
进阶
dots3-note preview 代表的是 2026 年开源大模型一个很清晰的方向:把模型从"聊天机器人"变成"能理解真实世界、能跑长程任务的智能体基座"。多模态 MoE、512K 上下文、16B 激活成本、Apache 2.0 全开放——每一项都在说同一件事:开源模型正在从"能用"走向"能办事"。
它不完美,preview 版的幻觉和稳定性还要打磨,512K 长上下文对显存和框架的考验也才刚开始。但如果你关心国产开源大模型、多模态 Agent,或者单纯想看看"小红书做的模型长啥样",dots3-note 值得你拉下来玩一玩——至少,从 API 申请开始,成本为零。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
