AREX Feed Article
上海人工智能实验室发布科学多模态模型 Intern-S2-397B,vLLM 与 SGLang 给出 day-0 支持
9 月 14 日,上海人工智能实验室的 Intern 系列模型官方账号 @intern_lm 发布 Intern-S2-397B,官方称这是面向长期科学研究与科学 Agent 的多模态基础模型()。权重以 BF16 与 FP8 两种精度上线 与 。
vLLM 与 SGLang 的公告确认的是这个模型能在两家的推理引擎上运行。vLLM 官方账号在 9 月 14 日 10:18(UTC)宣布提供 day-0 支持(发布当日即可运行),并附上部署 recipe();SGLang 官方账号当天 16:19(UTC,北京时间已是 9 月 15 日凌晨)发布同类公告()。公告中「通用能力居开源模型前列」「在 Biology-Instructions、Mol-Instructions 等科学任务上领先」「在 IMO-Proof、AdvancedMathBench 上达到 Gemini 3.1 Pro 级别」这些表述,都出自实验室一方。
模型卡里的对比表:科学任务分差悬殊,通用任务互有胜负
模型卡的这张表把成绩分成科学、多模态、Agent、通用四组,对照 Qwen3.5-397B-A17B、DeepSeek-V4-pro、Kimi K2.7-Code、GLM-5.2、GPT-5.5、Gemini-3.1-Pro 与 Claude-Opus-4.8。按模型卡的注释,下划线表示开源模型中的最好成绩,加粗表示所有模型中的最好成绩。
科学任务这一组给出的差距很直接。Biology-Instructions 一栏,Intern-S2-397B 为 55.71,同一栏 Gemini-3.1-Pro 是 13.87、GPT-5.5 是 10.52;Mol-Instructions 为 53.95,GPT-5.5 为 40.49;SciReasoner 1.5 为 63.28。同一张表里也有落后的项:MolecularIQ 62.35,低于 GPT-5.5 的 76.41;MicroVQA 69.67,低于 Gemini-3.1-Pro 的 71.02。
Agent 与通用能力这一组互有胜负。FrontierScience-Olympiad 拿到 87.00,表中其余模型在 65.67~79.67 之间;SWE-bench Multilingual 为 84.00;SWE-bench-Pro 的 68.54 与 GLM-5.2 持平;SciCode 47.63,低于 Claude-Opus-4.8 的 56.21。MMLU Pro 的 89.77 低于 Gemini-3.1-Pro 的 91.00,HMMT-2026 的 93.56 低于 GPT-5.5 的 97.06,TerminalBench 2.1 的 64.04 低于 Claude-Opus-4.8 的 84.60。
评测设置写在模型卡里:所有模型都用 OpenCompass、VLMEvalKit 与 AgentCompass 评测;文本推理基准的最大推理长度为 256K tokens,多模态基准为 64K tokens;TerminalBench 2.1 用 Terminus 2 评测,SWE-bench-Pro 与 SWE-bench-Multilingual 用 Mini-SWE-Agent 评测,SWE-bench-Pro 另采用了防作弊配置。
397B 总量、17B 激活,512 个专家
模型卡把这一代的训练拆成三条线:视觉预训练直接读科学文献的原始页面,跳过中间解析步骤,把符号语义与版式关系放进同一个表示空间;把 20 多个科学领域的强化学习任务放在一起训练,覆盖科学理解、生成与设计,模型卡举的例子是生物分子相互作用设计与材料结构生成;把多个 Agent 框架接入大规模沙箱做黑盒 Agent 强化学习,目标是提升长任务上的泛化。
给出了更硬的规格:397B 总参数、17B 激活参数、512 个专家,架构是 Qwen3.5 的 MoE(混合专家,Mixture-of-Experts),混合线性注意力与全注意力,上下文 262K,另有一个共享权重的 MTP(多 token 预测)头用于投机解码。仓库里的 显示 max_position_embeddings 为 262,144,60 层里每 4 层有 1 层全注意力,每个 token 激活 10 个专家;视觉塔 27 层,配置中同时存在 image_token_id 与 video_token_id,图像与视频输入都在支持范围内。模型名里的 397B 与 Hugging Face 页面侧栏标注的 403B parameters 并不一致,recipe 采用的是 397B 总量 / 17B 激活的写法。
Apache-2.0 许可、托管 API 与权重上线时间
ModelScope 的仓库元数据把许可标为 Apache-2.0。vLLM 的 recipe 提到官方还有一个 ,显存占用约为 BF16 的一半,也是厂商验证过的配置。按 Hugging Face 上的仓库记录,BF16 仓库创建于 9 月 13 日 03:20(UTC),FP8 仓库创建于 9 月 11 日 14:32(UTC),都早于 9 月 14 日的公告。
自建之外还有托管路线:模型卡给出 OpenAI 兼容的官方 Intern API,模型名写作 intern-s2-397b,附了接 Claude Code 与 OpenClaw、Hermes 等 Agent 框架的配置示例,官方在线入口是 。模型卡提醒,thinking 模式默认打开、可按请求关闭,但不建议在 Agent 任务中关闭。
8 张 H100 或 H200 起步
vLLM 的 recipe 要求 vLLM 0.22.1 或更新版本。推荐的 FP8 配置是在 8 张 H100 或 8 张 H200 上以 TP=8(张量并行 8 路)启动;BF16 需要 8 张 H200(每张 141 GB)。由于仓库自带分词器 tokenizer(InternS1Tokenizer),需要打开 --trust-remote-code;MoE 内核方面,recipe 关闭了 DeepGEMM(VLLM_USE_DEEP_GEMM=0),在 NVIDIA 上自动选择 FlashInfer TRTLLM 后端。
限制也写得很直接。跑满 262K 上下文时如果显存不足,recipe 建议把 --max-model-len 降到 65,536 或 131,072;需要更长上下文时可开 YaRN(factor 4.0),把窗口推到约 1,010,000 tokens,但 recipe 提醒静态 YaRN 会固定缩放系数,只在确实要服务长提示时开启。时序列输入(time_series_url)目前只在 LMDeploy 上支持,vLLM 不处理这类输入。recipe 列出的 FP8 与 BF16 两种配置都从 8 张 GPU 起步。
从 7 月的预览版到这次的正式版
397B 型号在 7 月已经以预览版出现过。7 月 17 日,同一账号发布 Intern-S2-Preview-397B,官方描述与这次几乎相同(),Hugging Face 上的预览版仓库创建于 7 月 16 日,与正式版仓库分开存在。
8 月 13 日,arXiv 出现题为 Intern-S2-Preview: Scientific Agentic Foundation Model 的论文():训练管线由科学多模态预训练、监督微调、多任务强化学习、黑盒与白盒 Agent 强化学习和 on-policy distillation 组成;论文还记录了预览版配套的记忆增强扩展 Intern-MemDec-4B,在不改动冻结的 397B 主干的前提下把 Biology-Instructions 平均分从 56.92 提到 60.32。这次的公告则把「探索一种可持续扩展专业科学知识的新架构」列为第四个卖点。
IMO-Proof 与 AdvancedMathBench 的两项结论
公告称模型在 IMO-Proof 与 AdvancedMathBench 上达到 Gemini 3.1 Pro 级别。公告文字给出的是结论,没有附这两项的具体分数;模型卡里那张对比表覆盖科学、多模态、Agent 与通用四组基准,表中没有这两项。