AREX Feed Article
Cognition 发布 Devin Voice:给 AI 软件工程师 Devin 接上语音通话,称由 GPT-Live 与 SWE-2 驱动
2026 年 9 月 10 日 20:12(UTC,北京时间 9 月 11 日凌晨 4:12),Devin 开发商 Cognition 的认证企业账号 @cognition 发布推文,宣布为旗下 AI 软件工程师 Devin 推出语音界面 Devin Voice,宣传语为「You say it, Devin ships it」(你说,Devin 来交付),并附上一段 3840×2160 的演示视频。推文写道:「你最爱的 AI 软件工程师刚刚装上了一部固定电话」,并称该功能「由 GPT-Live 和我们的新模型 SWE-2 驱动」()。
截至发稿,这条公告获得 1,168 个赞、103 次转发和 198,128 次浏览,另有 380 人收藏。这是一份厂商官方发布口径:功能实际能力与两款模型的具体表现,目前只有 Cognition 自己的演示视频作参照。
公告的构成:主帖、试用入口与文档
公告由三条推文组成。主帖之外,@cognition 在一分钟后跟帖给出试用入口:「今天就到 Devin 里试试」,链接指向 ;约 23 分钟后又跟帖给出文档链接,指向 。
演示视频里,Devin 的水獭吉祥物玩偶坐在沙发上,举着一部蓝色手机贴在耳边通话。评论区多位用户留言讨论水獭的声音和周边玩偶,Cognition 的官方产品账号 @DevinAI 也在主帖下回复了一句「我爱死我的新电话了」()。
文档里的这通电话怎么打
按 的说明,voice mode 的定位是「离开键盘时也能自然地与 Devin 交流」,用于讨论想法、压力测试方案和交接工作。具体操作是:在首页 Agent 模式下、或在一个已有会话中,点击消息框旁边的语音通话按钮并允许麦克风访问;用户在开始通话前输入的任何文字会随通话一并发出。
通话过程中的控制项包括:静音麦克风并暂停拾音、静音时长按空格键发言、关闭 Devin 的音频输出(Silence Devin)而不中断自己的麦克风,以及挂断结束通话。文档还说明,通话期间用户可以在 Devin 界面内导航而通话保持连接,对话内容会进入会话历史。文档给出两条使用建议:可以随时打断 Devin 正在进行的工作或正在说的话;如果希望 Devin 说快一点、慢一点或换一种沟通风格,直接开口要求即可。
文档描述的入口是网页应用内的一个「语音通话按钮」,而不是一部真实可拨打的电话。
同一天的两块拼图:SWE-2 与 GPT-Live-1
Devin Voice 公告发出的同一天,两个相关事件先后发生。约 5 小时前(9 月 10 日 15:21 UTC),@cognition 刚刚发布了 ,称这是「我们离前沿最近的模型」,在主流评测上「与近期的前沿模型持平,成本最高降低 70%」,并表示公司「把强化学习扩展到了数万亿参数规模」。这些均为 Cognition 自己的口径,该推文获得了 5,746 个赞和约 141.9 万次浏览。Devin Voice 公告中的「我们的新模型 SWE-2」即指此。
语音侧的另一半来自 OpenAI。就在同一天(2026 年 9 月 10 日),,定价为语音前端每分钟 0.05 美元。按 OpenAI 的介绍,这是一个全双工语音模型,可以在同一时刻听和说,用一个模型同时处理输入与输出音频,避免传统「语音转文字—大模型—文字转语音」级联架构的延迟与脆弱交接;它还能把深度推理和工具调用委托给后端文本模型,并原生支持电话场景。Cognition 的推文只写了「GPT-Live」而未注明版本和归属,但 OpenAI 的发布页在客户引言部分引用了 Cognition 联合创始人兼 CPO(首席产品官)Walden Yan 的话:「有了 Devin 和 GPT-Live-1,与 AI 工程师共事开始更像与队友协作——你可以把想法说给它听,压一压某个方案的成色,或者干脆在你离开键盘的时候把工作交出去。」
回复区:低沉的声音、没有电话号码、还有一个被质疑的 merge
主帖下 91 条回复里,第一波反应集中在演示视频的「声音」上。有用户评论「Devin 的声音也太低沉了」,也有用户表示「没想到那只可爱的水獭是这个声音」。
一些反馈指向功能边界。有用户写道:「我还以为会有一个真的能拨打的电话号码……」();新西兰一家风险投资机构的 CTO(首席技术官)则抱怨「但还是不能在 MS Teams 里直接私信 Devin」()。
也有用户对演示内容本身提出质疑。一位用户指出,视频中 Devin 似乎违背了演示者的指令直接完成了代码合并:「所以它无视演示者的命令把代码合并了?我还该觉得这很酷吗。不要,这不是我想要的那种替我执行操作的智能体——不过出于好奇我还是会试试。」()这是对该演示视频的观众解读,视频中实际发生了什么,目前无法从文字材料独立核实。截至发稿,这条推文的回复区里,关于语音模式如何计费、是否与 SWE-2 促销额度共享的提问,尚未出现 Cognition 的公开答复。
演示之外的空白:性能数字均出自厂商自述
把现有公开材料放在一起,可核实的部分是:Cognition 官宣了 Devin Voice 并开放了试用入口与文档;官方文档描述了一个网页内嵌的语音通话界面;OpenAI 同日将 GPT-Live-1 放入 API,并在发布页引用了 Cognition 高管谈 Devin 的引言;SWE-2 则是 Cognition 同日早些时候发布的自家模型。
所有性能叙事——SWE-2「与前沿模型持平、成本降低 70%」,GPT-Live-1 在自家评测中的领先——全部出自两家公司自己的发布材料,尚无任何第三方独立评测。Devin Voice 在真实编程任务中的实际表现,目前只有那段水獭打电话的演示视频作参照。