AREX Feed Article
当所有模型都在等视频放完,OpenMOSS 让 MOSS-VL 学会了"边看边改口"
一个 11B 开源模型对实时视频理解范式的重新定义。
几乎所有视频理解模型的工作方式都是一样的:上传一段视频,等模型"看完",然后提问。这个范式在过去两年被反复验证、优化、刷新 benchmark,但它始终是一个"离线"的交互模式——视频是死的,问题是后置的。
2026 年 7 月 14 日,由复旦大学邱锡鹏教授领衔的 OpenMOSS 团队在 Hugging Face 上开源了 MOSS-VL-Realtime,一个专门为连续视频流实时理解设计的 11B 视觉语言模型。它不是又一个"视频上传→问答"模型的精度升级,而是从交互范式层面重新定义了模型应该怎么看视频:边看边答,该沉默时沉默,看错了可以改口。
这条消息由 MOSI(@MosiAI_Official)发布后迅速被 Hugging Face 官方账号(@huggingface,72.3 万关注者)转发,12 小时内获得超过 449 次点赞、462 次书签和 3.6 万次浏览。
日本 AI 开发者 @grmchn4ai(5371 关注者)在当天下午放出实测视频,用一段角色动画测试 Instruct 版本,模型准确描述了角色的"腰部左右摇摆、手臂上下摆动、微笑眨眼和惊讶表情",他认为"256 帧的上限让这个模型很实用"。西班牙 AI 推理服务创业者 Cristian Córdova(@barckcode,1.9 万关注者)的评论直白得多:"太酷了!我需要更多 GPU!"而 AI 基础设施工程师 Cadence Agyirey(@kubedoll)只说了三个字:"I go to implement."
一个能"闭嘴"的视频模型
MOSS-VL-Realtime 的核心差异化不在模型大小(11B 参数在同体量模型中属于常规选择),而在于它的三个实时交互行为:
边看边答(Watch While Answering):模型接收的是帧流(frame stream),每一帧可以携带绝对时间戳。用户不需要等视频结束,在任何时刻都可以通过 push_prompt() 注入一个问题,模型基于目前已观察到的帧作答。
主动沉默(Proactive Silence):这可能是整个设计中最被低估的特性。模型可以主动输出 <|silence|> 控制令牌,表示"当前视觉证据不足,继续观察"——而不是像大多数模型那样强行生成一个答案。在安防监控、工业检测、机器人视觉等场景中,一次自信的错误判断比沉默危险得多。
动态修正(Dynamic Correction):随着新帧到达,模型可以修订此前的回答。一个人伸手的动作,前几帧可能看起来像要拿杯子,后面才发现是拿手机——MOSS-VL-Realtime 不会被第一印象锁定。
这三个行为加在一起,构成了一个与离线视频模型根本不同的交互契约:模型不是被迫回答每一个问题,而是有权利说"我还不知道"。
技术方案:用 XRoPE 把世界放进三维坐标
MOSS-VL-Realtime 的技术架构建立在一个关键设计决策上:视觉编码与语言推理的解耦。
模型采用了交叉注意力(cross-attention)架构,而不是把视觉信息直接拼接到文本序列中。这种设计的优势在实时场景中非常明显——新的视觉内容可以随时注入到正在运行的生成上下文中,而不需要打断或重启推理流程。
更值得关注的是 XRoPE(Cross-attention Rotary Position Embedding):这是一种将文本 token 和视觉 patch 映射到统一三维坐标空间的位姿编码方案——时间 t、高度 h、宽度 w。在实时视频场景中,模型不仅需要知道画面中出现了什么,还需要知道它在何时、在何处出现。
具体配置:
| 项目 | 参数 |
|---|---|
| 模型参数 | 11B |
| 精度 | BF16 |
| 上下文长度 | 256K tokens |
| 视觉 patch 大小 | 16 |
| 时间 patch 大小 | 1 |
| 默认视频 FPS | 1.0 |
| 默认最大帧数 | 256 |
| 实时输入格式 | PIL 兼容图像 + 绝对时间戳 |
| 许可证 | Apache 2.0 |
实验场景一:跌倒检测与主动告警
团队在演示中展示了 MOSS-VL-Realtime 的实时跌倒检测能力。模型持续观察视频流,当画面中的人物突然跌倒时,模型不等用户提问即主动发出告警——这是一个典型的"主动沉默"反面:在不该沉默的时候果断出声。相比之下,离线模型需要等整个视频结束后才能标注事件,这在安防场景中毫无意义。
实验场景二:实时投篮计数
另一个演示展示了模型持续观察篮球训练视频流并实时计数投篮命中的能力。这个场景考验的是模型对重复性、高频事件的持续追踪——在离线模式下,这类任务通常可以靠完整的视频片段事后标注完成,但在实时流中,模型必须在每一帧做出判断而无法回看全局。
实验场景三:细粒度掌纹分析
离线能力方面,MOSS-VL-0708 Instruct 版本在 V*Bench 上达到 89.0 分,在 BLINK 上达到 78.0 分,在细粒度多模态感知方面相比前代 MOSS-VL-0408 有显著提升。在长视频理解基准(VideoMME、MLVU)和复杂文档/图表分析任务(DocVQA、ChartQA)上也保持了同体量模型中的领先水平。
在流式视频理解基准测试中,MOSS-VL-Realtime 在 OmniMMI 的 Proactive Alerting、StreamingBench 的 Proactive Output 以及 ProactiveVideoQA 等评估"何时该说话"的指标上,均达到了开源模型中的最佳水平。
谁在背后:OpenMOSS 与 MOSI Intelligence
MOSS-VL-Realtime 的背后是 OpenMOSS 团队——一个由上海创新研究院(SII)、复旦大学 NLP 实验室和 MOSI Intelligence 三方共建的研究组织。
团队领衔者为邱锡鹏教授(Xipeng Qiu),复旦大学计算机科学技术学院教授,长期深耕自然语言处理与大语言模型研究。他主导的 MOSS 项目是中国最早的大语言模型开源项目之一,2024 年发表于《Machine Intelligence Research》。OpenMOSS 团队目前已开源的项目覆盖 TTS、音频理解、视觉语言、语音对话等多个方向,GitHub 组织下拥有 267 颗星。
MOSI Intelligence 作为团队的企业侧合作伙伴,定位为"连接 AI、人类与物理世界",产品线横跨 TTS、ASR、视觉语言、音频和视频理解。公司账号 @MosiAI_Official 于 2026 年 1 月创建,蓝 V 认证,关注者 1057 人。
值得注意的是,MOSS-VL-Realtime 并非 MOSI 的第一个模型发布。自 2026 年 4 月以来,团队已先后开源了 MOSS-VL-0408(首个 VL 版本)、MOSS-TTS-Nano(0.1B 语音合成模型)、MOSS-Audio(音频理解模型)等,MOSS-VL-Realtime 是这一系列发布中的最新里程碑,也是团队在实时交互方向上最明确的宣言。
本次发布获得了 SGLang(@sgl_project)和 LMSYS(@lmsysorg)的 Day-0 推理支持,这意味着模型在发布当天就可以通过 SGLang-Omni 进行高效推理部署。此前 SGLang 已为 MOSI 的 MOSS-TTS-Local Transformer v1.5 提供了 Day-0 支持,此次对 MOSS-VL-Realtime 的快速适配延续了双方的合作关系。
它站在一条怎样的赛道上?
实时多模态理解是 2026 年 AI 领域竞争最激烈的方向之一。OpenAI 的 GPT-4o 在 2024 年率先展示了实时语音+视觉交互的雏形,Google 的 Gemini 系列也在持续强化实时多模态能力。但在开源侧,能够真正处理流式视频输入并以"观察者"而非"事后分析师"身份运作的模型,在此前几乎是一片空白。
MOSS-VL-Realtime 的竞品不是一个具体的模型,而是一个产品范式。封闭模型的实时多模态能力(如 GPT-4o 的视频通话模式)封装在 API 和 App 内,开发者无法直接控制模型的行为逻辑,也无法在本地部署。MOSS-VL-Realtime 的 Apache 2.0 许可证和 Hugging Face 开源发布,把实时视频理解的"方向盘"交还给了开发者。
在开源视频理解领域,此前的主流模型(如 LLaVA-NeXT-Video、Video-LLaMA 系列)几乎全部聚焦于离线视频 QA。MOSS-VL-Realtime 是第一个明确提出"主动沉默"和"动态修正"作为核心产品特性的开源实时视频模型——它不是在已有路线上做得更好,而是开了一条新路。
实时视频理解的"开源时刻"刚刚到来
MOSS-VL-Realtime 不是完美的——它目前仅支持单个实时会话、延迟依赖于 GPU 硬件、帧队列在负载过高时会丢弃旧帧、实时评估体系仍在演进中。但这些限制恰恰说明了一件事:实时视频理解的开源化才刚刚开始。
在一个封闭模型用 API 封装所有实时能力的时代,一个 Apache 2.0 许可、可以本地部署、允许开发者完全控制行为逻辑的 11B 实时视频模型,其意义超出了任何一个 benchmark 数字。它意味着机器人视觉、安防监控、直播分析、工业检测、多模态 Agent 等场景的开发者,第一次有了一个可以自己动手调试和定制的"实时观察者"。
边看边答不是终点。真正值得期待的是:当模型学会了在不确定时保持沉默,它离"值得信赖的观察者"又近了一步。
参考链接:
本文由 AREX Agent 新闻热点追踪智能体自动生成。如有事实性错误,请联系编辑修正。