AMD 收购 Taalas:把模型权重刻进硅片

AIAMD硬件

2026 年 8 月 6 日,AMD 宣布收购多伦多 AI 芯片创业公司 Taalas。交易金额未披露,预计在第四季度完成监管审批后正式交割。这笔收购的特殊之处在于 Taalas 的技术路线:他们不把模型权重存在显存里,而是直接刻进硅片。

Taalas HC1 推理卡

Taalas HC1 推理卡,芯片上印着 TAALAS 品牌名

模型专用集成电路

GPU、Groq LPU、Cerebras 晶圆级加速器——这些方案的共同点是:芯片是通用硬件,模型权重存储在外部(HBM 或 SRAM),运行时从内存读入计算单元。推理的主要瓶颈在内存带宽,不在计算能力本身。这就是所谓的 Memory Wall(内存墙)。

Taalas 走了一条完全不同的路。他们把模型的权重直接固化到芯片的物理结构中,通过芯片制造过程中的光刻掩模(photomask)来"记住"权重值。这种芯片在物理层面就是一种 MSIC(Model-Specific Integrated Circuit,模型专用集成电路)——每个芯片只服务一个特定模型,不存在"切换模型"这回事。

Taalas 的处理器包含两个核心区域:

  • Mask-ROM recall fabric:权重被永久刻入掩模 ROM,这是芯片物理结构的一部分。不需要从内存读取权重,因为权重本身就是硬件。
  • SRAM recall fabric:用于存储 KV cache 和 LoRA 微调适配器。这部分是可写的,支持在固定模型基础上做轻量级调整。

HC1 测试芯片的 benchmark

2026 年 2 月,Taalas 在 TSMC 6nm 工艺上流片了第一代测试芯片 HC1。关键规格:

参数数值
制程TSMC 6nm
芯片面积815 mm²
晶体管数量530 亿
推理速度16,960 tokens/s
测试模型Llama 3.1 8B

16,960 tokens/s 的数字需要放在上下文中理解。在同一组 benchmark 中,其他硬件的表现:

Taalas HC1 与竞品的推理性能对比

HC1 运行 Llama 3.1 8B 的推理速度对比(数据来源:Taalas 自测)

硬件Tokens/s
Nvidia H200230
Nvidia B200353
Groq594
SambaNova932
Cerebras1,981
Taalas HC116,960

HC1 的吞吐量是 Cerebras 的 8.5 倍,是 Nvidia H200 的 73 倍。当然,这些数据来自 Taalas 自己的测量,测试条件(输入序列长度 1k/k)是 Taalas 选定的。但即使打个折扣,数量级差距依然可观。

这种性能差距的根本原因在于架构选择。传统 GPU 推理时,每生成一个 token 都需要从 HBM 把全部权重搬运到计算单元,这个搬运过程消耗的能量和时间远超计算本身。Taalas 把权重固化在芯片内部,数据搬运的物理距离从厘米级(HBM 到 GPU 核心)缩短到微米级(掩模 ROM 到计算单元),带宽瓶颈基本消失。

HC2 与万 亿参数模型

HC1 只是概念验证,真正面向部署的是第二代芯片 HC2。HC2 的目标是单芯片支持 200 亿(20B)参数。这个数字看起来不大,但 Taalas 的策略是用流水线并行(pipeline parallelism)把多个芯片串联起来服务大模型。

按照 20B 参数/芯片计算,一个万亿参数的模型需要 50 个 Taalas 加速器。这和 Nvidia 的方案形成对比:Nvidia 最近推出的 LPX 系统需要几十个 GPU 外加大约 2,000 个 Groq LPU 来服务同等规模的模型。

在空间和能效方面,50 颗专用芯片 vs. 2,000 颗 LPU 的差距悬殊。数据中心不需要为 HBM 供电和散热预留大量空间,也不需要应对 HBM 供应链的长期短缺。

AMD 的部署策略:解耦推理架构

AMD 收购 Taalas 后的部署计划值得关注。根据 The Register 的报道,AMD 打算把 Taalas 技术与 Instinct GPU 形成互补,构建一种解耦推理架构(disaggregated inference architecture):

  • Prompt processing(提示词处理) 在 Instinct GPU 上运行。这一阶段需要处理输入上下文,计算密集度高,GPU 的通用计算能力有优势。
  • Token generation(输出生成) 卸载到 Taalas 加速器。这一阶段逐 token 生成输出,内存带宽是瓶颈,Taalas 的固化权重架构刚好对症。

这种分工对应了推理过程中两个阶段的计算特征差异。Prompt processing 是一次性的批量计算,Token generation 是持续的自回归生成。把两者拆分到不同硬件上,可以让每种硬件做自己擅长的事。

AMD 的 AI 业务高级副总裁 Vamsi Boppana 在声明中说:"AMD 正在构建一个全栈 AI 平台,为客户提供为每种 AI 工作负载部署正确计算解决方案的灵活性。"这句话的含义是:AMD 不打算用 Taalas 芯片替代 Instinct GPU,而是两者并存,让客户根据负载选择。

AMD 的全栈布局已经包括 Helios 机架级系统、Instinct GPU、EPYC CPU、ROCm 软件,7 月又宣布与 Cerebras 合作。Taalas 是这个拼图中的推理专用层。

灵活性 vs. 性能的权衡

Taalas 技术的最大代价在于:芯片一旦制造完成,模型就锁死了。如果你想换一个模型,只能换芯片。在当前大模型几乎每月迭代的节奏下,这个限制不小。

不过实际情况没有听起来那么极端。Taalas 表示,更换模型不需要从零开始重新流片,只需要改变芯片中的两层金属层(metal layers)。这比完整的芯片 re-spin 便宜和快得多,但仍然需要数周时间,且成本远高于软件升级。

这意味着 Taalas 芯片最适合的场景是:模型已经稳定部署、推理量大、对吞吐和延迟有极致要求的工作负载。Taalas 在接受 The Next Platform 采访时指出,将模型权重刻入硅片的成本大约是训练一个前沿模型的百分之一。

换一种说法:如果一个模型开发者已经花了数亿美元训练出一个模型,再多花百分之一把它固化到芯片上以获得数十倍的推理速度提升,在经济学上是合理的。这种模式尤其适合 OpenAI、Anthropic、Meta 这类同时是 AMD Instinct 客户的大模型公司。

推理市场的分化

AMD 收购 Taalas 的背景是 AI 推理市场正在分化。Nvidia 在 2025 年底以 200 亿美元与 Groq 达成授权协议,把 Groq 的 LPU 技术整合到自己的系统中。AMD 收购 Taalas 是对标这步棋——但技术路线不同。Groq 的 LPU 仍然是通用数据流架构,可以运行不同模型;Taalas 的芯片则是模型专用的。

分化不止于此。Cerebras 与 AMD 合作,提供晶圆级推理加速;SambaNova 也在推自己的推理服务。GPU 不再是推理的唯一选项。

这种分化对大模型公司有利。当一个推理服务可以用多种硬件方案来搭建时,算力的定价权就从单一供应商(Nvidia)分散到了多个竞争者手中。推理成本下降直接惠及 end user——无论是调用 API 的开发者,还是使用 ChatGPT 的普通用户。

test-time scaling(测试时缩放)是另一个受影响的领域。这种让模型"多想一会儿"来提升回答质量的技术,代价是消耗更多 token。如果 Taalas 能把每个 token 的成本降低一个数量级,模型开发者就有空间让推理链(reasoning chain)更长、更深,而不会把用户等的时间或推理成本推到不可承受的水平。

创始人背景

Taalas 由 Ljubisa Bajic 联合创立并担任 CEO。Bajic 在芯片设计领域有深厚背景,此前曾在 AMD 参与 GPU 架构设计,也在 NVIDIA 工作过。Taalas 2023 年成立于多伦多,团队规模不大但工程能力集中。

AMD 对这笔收购的定位不仅是技术,也是人才。AMD 在声明中特别强调了对加拿大半导体和 AI 生态的长期投入,以及保留和扩大加拿大人才的承诺。这与 AMD 近年在多伦多和蒙特利尔扩张研发中心的策略一致。

行业影响

Taalas 的 MSIC 路线引发了一个根本性问题:AI 推理是否会像比特币挖矿一样走向专用芯片化?比特币早期用 CPU 和 GPU 挖矿,后来 ASIC(专用集成电路)全面取代通用硬件,效率差距达到数千倍。

AI 推理和比特币挖矿有一个关键区别:比特币挖矿的算法(SHA-256)二十多年没变,ASIC 可以放心投入;而大模型的架构和参数在不断演进,固化到硬件意味着赌定一个特定模型。但 Llama、DeepSeek 等开源模型的成熟度正在提高,模型更新频率可能放缓,这使得"锁死一个模型"的风险在降低。

AMD 的对冲策略是同时保留通用 GPU 和专用加速器。客户可以在 Instinct GPU 上开发和迭代模型,当模型稳定后,再考虑迁移到 Taalas 加速器以获得极致推理性能。这种 tick-tock 式的部署路径,把灵活性和性能的选择权留给了客户。

收购预计在 2026 年第四季度完成。在那之后,HC2 芯片何时能量产、AMD 如何在 Helios 机架中集成 Taalas 加速器、哪些大模型公司会率先采用,这些问题将逐步揭晓。

来源:AMD 官方新闻稿The RegisterServeTheHomeCNBC