AREX Feed Article
阿里 Qwen 发布 Qwen3.8-LiveTranslate:宣称 60 种语言同传延迟从 2.8 秒降至 2.3 秒
2026 年 9 月 19 日 15:08(北京时间,UTC 07:08),Qwen 官方企业认证 X 账号 宣布推出 Qwen3.8-LiveTranslate,称其为 Qwen 的下一代实时同声传译模型,基于 Interleave 架构构建。官方宣称该模型在提升忠实度、流畅度与简洁性的同时,把 60 种语言的平均滞后指标 LAAL 从 2.8 秒降到 2.3 秒,降幅 0.5 秒、约 18%。帖文同时列出三项新能力:实时说话人分离、源文与译文同步双语显示、利用对话历史做长上下文消歧,并给出 与 两个入口。上述性能与能力说明均出自 Qwen 一方,帖文没有附独立测试数据。
账号 @Alibaba_Qwen 有约 28.6 万名关注者。截至本文检索,这条帖文获得 103 次转发、1,020 个赞与 75,284 次浏览。
三项新能力:分清谁在说话、双语同屏、术语前后一致
帖文对三项能力的表述都很具体。实时说话人分离(speaker diarization)面向多人对话场景,在多人轮流发言时区分不同说话人,并通过「更稳定的 voice cloning」保留每位说话人的音色;阿里云国际站的把这项能力写成「区分不同说话人及其发言,让听者清楚分辨哪句话是谁说的」。同步双语显示让源文与译文同屏出现。长上下文消歧则利用对话历史判断姓名与术语的指代,使同一名词在整场翻译中保持同一译法。
官方配图是一张发布卡片:四角分别印着「Synchronized source and translation」「Real-Time Speaker Diarization」「Long-Context Disambiguation」和「Cover a broader range of application scenarios」四个标签,中部是音频波形与 LAAL 曲线,宣传语为 “Echo the Voice, Carry the Meaning”。
2.8 秒的出处:三代 LiveTranslate 的延迟轨迹
LAAL 在官方卡片上展开为 Length-Adaptive Average Lagging,卡片曲线依次标出 3.2 秒、2.8 秒和 2.3 秒。同声传译场景下,这个指标衡量译文落后于说话人的平均时长:数字越小,译文开口越早,越接近「边说边翻」。
把公告放进时间线,2.8 秒这个基线有出处。2025 年 9 月 23 日,同一账号发布,宣称理解 18 种语言与 6 种方言、以 10 种语言输出语音,延迟约 3 秒。2026 年 5 月 20 日,称 Qwen 团队推出 Qwen3.5-LiveTranslate-Flash,宣称输入语言覆盖扩到 60 种、延迟 2.8 秒、语音输出 29 种语言。本次公告的「从 2.8 秒降到 2.3 秒」中,2.8 秒与上一代 Qwen3.5 宣称的延迟一致,公告帖文本身未写明基线对应哪一代。
阿里云文档目前把「延迟低至 2.3 秒」列入该产品线特性列表,并已为 qwen3.8-livetranslate-flash-realtime 给出连接示例。文档与推文口径一致,但同属阿里一方材料,性质是官方声明而非第三方验证。
模型页能查到什么:flash-realtime 的定价、限额与接入方式
QwenCloud 上架的模型名为 Qwen3.8-LiveTranslate-Flash-Realtime,页面描述其为 Qwen3.8-LiveTranslate-Flash 的实时版本,输入音频与图像、输出音频与文本,理解 60 种语言、说 29 种语言,并提到其构建在 Qwen-Omni 的基础设施与跨语言、跨模态对齐技术之上。价格按 token 计:音频输入每百万 token 7.5 美元、图像输入 0.55 美元、文本输出 20 美元、音频输出 30 美元。限额为最大输入 49K token、最大输出 4K、上下文 53K、每分钟 10 万 token、每分钟 10 次请求。
接入走 WebSocket 实时接口,用 DashScope API key 做 Bearer 鉴权,示例端点为 wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime。阿里云文档补充了默认参数:输入 16kHz PCM、输出 24kHz PCM、默认音色 Tina,输出可选纯文本或文本加音频,北京与新加坡两个区域各提供端点。与上一代靠 VAD 或手动模式判定语句边界不同,文档写明 qwen3.8 版本默认的轮次检测类型为 speaker_detection,客户端持续送音频、由服务端判断说话边界——这与说话人分离能力的方向一致。文档还列出热词配置,以及服务端实时克隆与预克隆音色档案两种 voice cloning 模式。
目前仍只有官方口径
截至发稿,Qwen3.8-LiveTranslate 的性能数字——2.3 秒的 LAAL、忠实度与流畅度的提升——只有 Qwen 自己的公告这一个出处,公告未给出评测方法、测试条件或第三方结果。公告也未提及开放权重下载;作为参照,MarkTechPost 对上一代 Qwen3.5-LiveTranslate-Flash 的描述是「仅 API、闭源权重」的模型。qwen.ai 的博客页为动态渲染,本次抓取只能确认页面在线。
模型页给出的不是评测,而是价格、限额与端点;Interleave 架构的实现细节,帖文本身也没有展开。能检验这份延迟宣称的实测数据,要从接入真实音频流的开发者那里来——模型页把请求限制在每分钟 10 次。