AREX Feed Article
AMD 买下 Taalas:把 AI 模型直接刻进硅片
8 月 6 日美股收盘后,,收购总部位于多伦多的 AI 推理芯片公司 。Taalas 将 AI 模型的权重直接刻入硅片,不靠 HBM 内存、不做通用计算,一块芯片只跑一个模型。
其首款测试芯片 HC1 运行 Meta Llama 3.1 8B 达到每秒 16,960 token 的生成速度,是同期 Nvidia GPU 的约 48 倍。AMD 未披露交易金额,预计 2026 年第四季度完成交割,尚需监管审批。
两年三轮 $219M,研发只花了 $30M
Taalas 由 Ljubisa Bajic 于 2023 年在多伦多创立。Bajic 此前创办了 AI 芯片公司 Tenstorrent 并担任 CEO,更早则在 AMD 担任混合 CPU-GPU 芯片架构师,在 Nvidia 做过高级架构师。
联合创始人兼 COO Lejla Bajic 同样出身 AMD,曾在 ATI 和 Altera 担任系统工程师。CTO Drago Ignjatovic 先后在 AMD 和 Tenstorrent 负责 ASIC 与硬件工程,在 Bajic 离开 Tenstorrent 时接替了其 ASIC 设计总监职位。
据 和 报道,Taalas 累计融资约 2.19 亿美元,最近一轮是 2026 年 2 月完成的 1.69 亿美元,投资方包括 Quiet Capital、Fidelity 和半导体投资人 Pierre Lamond。
今年 2 月的深度报道显示,公司研发支出仅约 3000 万美元,账上仍有超过 1.7 亿美元现金。团队仅 25 人,主要来自 AMD、Apple、Google、Nvidia 和 Tenstorrent。前 Google Cloud GPU 与 TPU 基础设施产品负责人 Paresh Kharya 已加入担任产品 VP。
SiliconANGLE 指出,AMD 股价在消息发布后上涨约 1.5%。
「硬件围着模型转」:Bajic 的逆向逻辑
AMD AI 事业群高级副总裁 Vamsi Boppana 在官方声明中表示:「AMD 正在构建一个全栈 AI 平台,让客户能够为每一种 AI 工作负载灵活部署正确的计算方案。Taalas 的技术和世界级工程团队通过差异化的推理性能和效率,强化了我们的 AI 产品组合。」
Taalas CEO Ljubisa Bajic 则给出了这家公司的存在理由:「我们创立 Taalas,是为了从零开始重新思考 AI 推理,让硬件围着模型来设计,而不是反过来。」他补充说,加入 AMD 将赋予团队「规模、工程资源和全球触达能力」。Bajic 特别提到,Taalas 很多成员曾在 AMD 加拿大工作,「期待回家」。
AMD CEO 苏姿丰在 X 上表态:「。」
一个晶体管既存权重又做乘法,HBM 彻底出局
Taalas 把推理芯片做成「模型专用集成电路」(Model-Specific Integrated Circuit,MSIC)。芯片分为两个区域:掩膜 ROM 结构(mask-ROM recall fabric)刻入模型权重,SRAM 结构(SRAM recall fabric)存储 KV 缓存和微调适配器。没有 HBM,也没有「从内存加载权重再计算」的步骤。
Bajic 在 2 月接受 采访时解释,这套架构用一个晶体管存储 4-bit 权重并同时完成对应的乘法运算。「一旦把所有东西都硬化了,就有机会用完全不同的方式来堆密度,」Bajic 说,「这不是核物理,是纯数字电路。只是一个此前没人走过的聪明技巧。」公司已围绕该技术申请了 14 项专利。
首款测试芯片 HC1 采用台积电 6nm 工艺,面积 815 mm²,集成 530 亿晶体管,单卡功耗约 200W。它在运行 Llama 3.1 8B 时达到每秒 16,960 token。据 引述 Taalas 数据,功耗仅为 Nvidia H200 的十分之一。
第二代芯片 HC2 原计划 2026 年夏季推出,单芯片支持 200 亿参数模型,通过流水线并行可将 50 片 HC2 组合运行万亿参数级模型。
代价同样明确:模型一旦「烧入」芯片,更换模型就需要重新流片。Taalas 的方案是只改两层金属层,通过自研工具将流片周期压缩到约两个月。但灵活性终究不如通用 GPU。
推测 AMD 可能采取一种「tick-tock」部署节奏:客户先在 Instinct GPU 上验证和部署模型,确认稳定后再迁移到 Taalas 加速器。预填充由 GPU 处理、token 生成卸载到 Taalas 芯片的分离式架构是另一种可能。AMD 拥有 Helios 机架级系统和内部系统设计团队来承载这种架构。
Nvidia 花 $20B 买 Groq 在前,AMD 又牵手 Cerebras
AMD 收购 Taalas 的时机并不孤立。2025 年 12 月,Nvidia 以 200 亿美元从 Groq 获得推理技术授权,随后在 2026 年 3 月 GTC 大会上发布了基于该技术的 Groq 3 LPU。2026 年 7 月,AMD 宣布与晶圆级 AI 芯片公司 Cerebras 达成合作,将后者的芯片集成到 Helios 系统中。
半导体分析师 在 X 上写道:「Taalas 不可编程,因此 Helios 做 prefill + Taalas 做 decode 会绑定到特定模型。这将是一个有趣的『半定制』推理集群,像一个『Sonnet 5 集群』。」
Moor Insights & Strategy 创始人 用三层框架定位三款芯片:「Instinct:最大灵活性,训练加推理;Cerebras:最大推理速度,灵活性不如 GPU;Taalas:极致推理效率,灵活性最低。」
AMD 自身在过去九个月内完成了至少三笔 AI 收购:2025 年 11 月收购推理软件公司 MK1,2026 年 6 月收购内存优化初创公司 Mext,7 月又将 FastFlowLM 团队收入麾下。加上 2024 年的 Silo AI(6.65 亿美元)和 ZT Systems(49 亿美元),AMD 在 AI 基础设施上的收购节奏明显加快。
模型迭代在减速,定制芯片的窗口刚刚打开
Taalas 在 2 月给出的数据是,将模型权重刻入硅片的成本约为训练一个前沿模型的百分之一。Bajic 在公司官网写道:「从收到一个前所未见的模型,到将其在硬件中实现,只需两个月。」
报道引述苏姿丰在 7 月产品发布会上的判断:「我坚信芯片没有一刀切的方案。」但她同时认为,GPU 仍将占据 AI 芯片市场的主体,因为它们足够灵活来支撑不断涌现的新模型。
指出一个被低估的连锁影响:如果 Taalas 技术能将单 token 成本降低一到两个数量级,模型开发者可能进一步延长推理时间(test-time scaling),让模型「思考」更久以换取更高准确率。而这又会反过来推高对极致推理效率的需求。OpenAI、Anthropic 和 Meta 都是 AMD Instinct 的大客户,定制芯片的订单或许不会等太久。