AREX Feed Article
dots3-note 开源首日,vLLM 官宣 Day-0 支持
北京时间 8 月 14 日 11:09,vLLM 官方账号 ,宣布对 dots3-note preview 提供 Day-0 支持。推文给出的规格:280B 参数 MoE、16B 激活、512K 上下文,可读图像、音频与视频;据称经训练可在陌生环境中探索,并随进程更新自己的记忆。
同一天,dots studio(X 账号 @dotsstudioai)在宣布开源 dots3-note preview,以 Apache 2.0 协议在 Hugging Face 与 GitHub 发布权重与建模代码。推文附带的链接正是 vLLM 的。
模型开源当天,vLLM main 分支原生支持已就位
模型卡与配方页写明:原生支持已在 vLLM main 分支,稳定版本发布前,用户用最近的 nightly 构建即可部署。对比另两个开源推理栈: 与 仍在 review,合并前只能装 PR 版本。vLLM 是唯一把适配并入 main 的。
dots3-note preview 是 dots3 系列第一个开放权重模型,也是系列中最轻的一员。完整系列将包括 note、jazz、aria 三档,对应不同能力、延迟与推理成本。
vLLM 的招呼:RedNote 带着更大的模型回来了
推文第一句:「Good to see @RedNote back with a new open model, and a much bigger one built for long-horizon agent work」,意思是 RedNote 带着新的开源模型回来了,而且是更大的一个,为长时程智能体工作而生。推文结尾另起一行,向 @dotsstudioai 团队致谢。
RedNote 与发布方的关系能在公开页面上查到。许可证一栏写着「Copyright (c) 2026 Xiaohongshu. Developed and released by dots studio.」; 的徽章栏里,「RedNote-Dots Studio」入口指向 xhslink.cn 短链,与 X、Discord 并列。
dots studio 给这次发布定的标题是「A Small but Mighty Step Toward Long-Horizon Agency in Real Life」,译意为迈向真实生活长时程智能体的一小步,但有力。随模型一起开源的还有两个真实场景评测环境:VibeSearchBench 与 VibeLifeBench。
截至发稿,推文有 5 条回复。产品账号 :「day-0 vLLM support is the quiet hero of open releases」,即 Day-0 的 vLLM 支持是开源发布的幕后功臣。
X 用户 :16B 激活让推理变便宜,但服务时仍要把全部 280B 装进显存,决定 GPU 数量的是总参数而非激活参数。配方页印证了这一点:BF16 权重约 576.9GB,官方按 692GB 总显存做预算。
小红书 dots lab 不是第一次开源
模型卡的版权行把 dots studio 与 Xiaohongshu(小红书)直接挂钩。机器之心 8 月 14 日在 36Kr 刊发的称其为「小红书 Dots 模型实验室」,并回顾此前的开源记录:文本大模型 dots.llm1、多语言文档解析模型 dots.ocr、多模态视觉模型 dots.vlm1。vLLM 推文里的「back」,对应的正是这条时间线。
显示,dots-studio 名下现有 11 个模型,包括 2025 年 8 月更新的 143B 文本生成模型与 672B 图像文本模型。
7 月举行的 IMO 2026 是这次开源的直接背景。博客称,团队围绕 dots3-note preview 的一个分支搭建内部评测装置,让模型递归生成证明并用工具自评改进,最终拿到官方认证的满分 42/42 与 IMO 金牌。机器之心称这是 AI 首次在 IMO 取得官方认证满分,并写道:之后社区最关心的问题就是模型何时开源。
单机 8 卡跑 FP8,BF16 的显存账单是 692GB
dots3-note preview 是原生多模态 MoE:1 个 dense 层加 45 个 MoE 层,256 个路由专家加 1 个共享专家,每次激活 top-8;注意力混用 13 层 DSA(top-2048)与 33 层 SWA,约 1:3。
视觉编码器是 7B 总参、1.2B 激活的 MoE ViT,音频编码器是 800M dense 网络,词表 152K。输入支持文本、图像、视频、音频,输出只有文本。
部署上,官方推荐用 在单节点 8 张 80GB GPU 上以 TP=8、EP=8 运行。模型配置支持到 524,288 token,配方页把 262,144 token 定为验证过的服务上限。
BF16 权重约 576.9GB,另需运行与 KV cache 空间,配方按 692GB 总显存做预算。模型还带 MTP 投机解码:1 个共享 MTP 层、1.13B 参数,vLLM 侧可一次投机 3 个 token。
几十小时的长任务,RL 训练信号从哪来
dots3-note 的训练叙事围绕一个具体矛盾:长时程任务单次 rollout 要几十小时,靠轨迹终点的稀疏奖励做强化学习,训练慢,还难以归因到具体步骤。博客称,团队造了数千个无需先验知识的新环境,训练模型在陌生环境里在线学习、更新记忆;ARC-AGI-3 的复杂任务要 40 到 50 小时、数千次交互。
解法是 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization):把超长轨迹切成多个宏步,每个宏步结束时,模型从 actor 切换成 critic,用测试时算力估计当前状态的剩余回报,不等整条轨迹跑完就能更新策略。博客给出的数据:TEMPO 在 ARC-AGI-3 上的平均分比基线高 31.5%,比 GRPO 高 20.6%。
博客用 place knights 训练局展示了 critic 的用处:两条轨迹各跑 64 轮,环境奖励完全相同,critic 却给分支 B 估 2.29、给分支 A 估 3.8。原因是分支 A 已经发现真正的规则并找到接近可行的摆法,分支 B 还在错误的假设上打转。另一个例子是 Slay the Spire 2:模型连续运行几十小时并持续更新记忆。
机器之心的上手测试补充了细节:模型在 ARC-AGI-3 上 320 步解完全部 6 关,把修正后的规则写进 memory.md;Slay the Spire 2 打到第 33 层;ARC-AGI-3 拿到约 0.35 分的成本不到 500 美元。
博客的基准对比把 dots3-note preview 与 Hy3、GLM 5.2、DeepSeek-v4-flash-0731、Seed 2.1 turbo、Kimi K3、Opus 4.8、GPT-5.5 同台,称其在多个任务上「与数倍于自身规模的领先模型持平甚至超越」。这是发布方自己的评测结论,详细评测信息要等技术报告。
完整技术报告:一周内见
博客承诺一周内发布覆盖架构、训练与评测细节的完整技术报告; 已开放申请。权重本体在 Hugging Face 与 放出 BF16 与 FP8 两个版本。
Day-0 支持让「发布当天就能部署」成为这次开源可立即核验的部分。至于 TEMPO 那 31.5% 的提升和「数倍规模持平」的基准结论,要等一周后的技术报告给出详细评测信息才能检验。