AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

AMD 收购 Taalas:当模型权重被「蚀刻」进硅片,推理芯片进入专用化时代

今天 · 共 3,269 字

Wccftech

AMD 于 8 月 6 日宣布达成协议收购多伦多 AI 芯片初创公司 Taalas。交易金额未披露,预计今年第四季度完成。这是 AMD 在过去两年内的第六笔 AI 相关收购,但 Taalas 与以往任何一次都不相同——这家公司不造 GPU,也不做通用 AI 加速器。它把 AI 模型的权重直接「蚀刻」进硅片。

在传统 GPU 上运行推理,需要把模型权重从 HBM 搬运到计算单元,数据来回穿梭于内存层级,大部分功耗和延迟都消耗在数据传输而非计算本身——这就是所谓的内存墙。Taalas 的方案是把权重直接写死在晶体管里:每个晶体管存储 4 比特权重,并预计算该权重的全部 16 种可能乘积。当数据流过芯片时,晶体管不再做数学运算,而是在 16 条预计算结果中选择正确的通道——它变成了一个物理路由器。

Taalas CEO Ljubisa Bajic 在官网上写道:「从收到一个此前未见的模型算起,我们可以在两个月内将其做成定制硅。」这次出售也将这位 AMD 前员工带回了他效力多年的老东家。Bajic 在创办 Taalas 前曾共同创立 Tenstorrent,目前由芯片传奇人物 Jim Keller 执掌。

性能数字:一个数量级的跃升

Taalas 的第一代测试芯片 HC1 基于台积电 6nm 工艺,上面蚀刻了 Meta Llama 3.1 8B 模型。实测结果:每用户约 16,960 tok/s,是 Nvidia GPU 推理速度的约 48 倍,比 Cerebras 晶圆级引擎快 8 到 10 倍。Forbes 分析师 Karl Freund 的实际测试中,一份关于二战的详细月度时间线请求在 0.138 秒内完成,期间产生 14,357 个 token——快到「来不及看它滚动」。

成本差距同样显著。根据 Taalas 2 月公布的数据,在 HC1 上运行 Llama 3.1 8B 的推理成本为每百万 token 0.75 美分,而 GPU 方案的成本从 3.79 美分(吞吐量优化)到 49 美分(延迟优化)不等。DeepSeek R1 级推理模型的模拟成本为每百万 token 7.6 美分,对比 GPU 的 20-49 美分。Taalas 声称蚀刻一个模型的权重到硅片中,其成本约为训练该前沿模型的百分之一。

能源效率同样突出。HC1 整机架功耗仅 12-15 千瓦,而 GPU 推理机架通常在 120-600 千瓦之间,还可以使用空气冷却,不需要昂贵的数据中心液冷改造。

Taalas 的第二代芯片 HC2 将于今年夏季发布。HC2 采用标准 4 比特浮点格式来解决精度损失问题,单片支持 20B 参数,多片可通过 pipeline 并行支持更大模型——50 个加速器就能服务一个万亿参数模型。相比之下,Nvidia 的 Groq LPU 机架系统需要数千个 LPU 才能达到同等规模。

模型锁定的代价

Taalas 方案的弱点与优点一样明显:一旦芯片制造完成,你能运行的模型就被锁定了。任何超出 LoRA 适配器范围的更新都需要重新流片。在模型迭代以月为单位的今天,这听起来像是死路。

但 Taalas 的架构设计并非全部推倒重来。Bajic 的技术路线是:基础逻辑层保持不变,只需要重做最上层的两道金属互联(metal layer),TSMC 可以提前储存未完成晶圆等待最终封装。Taalas 声称这一过程仅需两个月,而整个芯片的生命周期中可容纳三次升级,这些费用已计入 Taalas 公布的成本对比中。

CNBC 报道引用了 AMD CEO Lisa Su 7 月产品发布会上的一句表态:「我不认为有一种万能的芯片解决方案。」她同时重申 GPU 仍将占据 AI 芯片市场的最大份额,因为它们可以灵活适应新模型。这句话精准地描述了 AMD 通过 Taalas 想补上的那个缺口:GPU 覆盖所有场景,而 Taalas 专攻那些推理量已经大到值得「锁死」模型的特定场景。

哪些场景符合条件?前沿实验室(OpenAI、Anthropic、Meta 都是 AMD Instinct 的大客户)的旗舰模型、代码助手的后端推理、大规模 Agent 系统的 token 生成——这些已经有了稳定且巨大的推理流量,且模型选择已经收敛。对于这类客户,产能利用率远高于模型更新的灵活性。

AMD 的 disaggregated 棋局

AMD 对 Taalas 的定位,从其已有的产品布局中可以清晰读出。7 月下旬,AMD 宣布与 Cerebras 合作,将后者的晶圆级引擎(WSE)集成到 Helios 机架级系统中,目标是 prefill 加速。现在加上 Taalas 负责 decode,一套 disaggregated 架构浮现出来:Instinct GPU 处理通用的、计算密集的 prefill 阶段,Cerebras WSE 提供带宽优势,而 Taalas 在 decode 阶段以最低的每 token 成本输出。

AMD 的 Helios 机架系统刚刚开始向 Meta 和 Microsoft 发货。AMD AI 部门高级副总裁 Vamsi Boppana 在官方声明中称:「AMD 正在构建一个全栈 AI 平台,为客户提供灵活部署适合每种 AI 工作负载的正确计算方案。」Taalas 和 Cerebras 的加入,使 Helios 从单一的 GPU 机架变成了一个异构计算平台。

AMD 过去两年一直在为这个平台收购拼图:2024 年以 $6.65 亿收购 Silo AI(模型开发),以 $49 亿收购 ZT Systems(系统设计),此后又收购了 MK1(推理软件)、MEXT 和 FastFlowLM。收购 Taalas 是这条全栈整合路径上最新的一块——也是最激进的一块。

专用化竞赛:Nvidia 也没闲着

专用推理芯片的整合正在加速。2025 年 12 月,Nvidia 以约 $200 亿收购了 Groq 的核心资产,这是 Nvidia 历史上最大的一笔交易。Groq 的 LPU(语言处理单元)同样是针对推理优化的专用架构,但其数据流设计仍然保留了相当的可编程性。

与 Groq LPU 相比,Taalas 的硬化程度更进一步。Groq 将模型权重预加载到 SRAM 中,绕过缓存层级;Taalas 则将权重物理写入晶体管结构。前者可以通过重新加载权重来切换模型,后者则需要重新流片。但也正是因为不允许任何数据移动,Taalas 的每瓦性能和单位成本才达到了与 Groq 不同的数量级。

另一个竞品是初创公司 Etched,其 Sohu 芯片专门为 Transformer 架构设计,不能运行 CNN、LSTM 等非 Transformer 模型。Taalas 在专用化光谱上比 Etched 走得更远——它不仅限定架构,还限定了具体模型。

一场豪赌的两个变量

Taalas 的商业模式能否成立,取决于两个关键变量。

第一是模型迭代速度是否在持续放缓。GPT-5.6 和 Claude Opus 5 之后,前沿模型的更新周期已经从季度延长到接近一年。如果这一趋势持续,模型锁定的窗口将足够宽。但如果出现颠覆性的新架构(例如非 Transformer),硬化的芯片将面临快速淘汰。不过 Taalas 创始人曾指出,即使是架构级变化,下层基础运算模式也趋于收敛,只需修改金属层而非全部重新设计。

第二是数据中心是否愿意接受多 SKU 运维复杂度。Forbes 的 Freund 指出,没有数据中心愿意管理数十种不同的加速器 SKU,操作复杂性「难以想象」。但反过来看,如果推理流量高度集中在少量旗舰模型上——例如 Meta 用 Llama 家族、Anthropic 用 Claude 家族——SKU 数量可以控制在个位数。

AMD 的筹码在于,它同时拥有通用 GPU 和专用加速器。客户不需要在两条路线之间做非此即彼的选择。Helios 平台的设计本身就是两者共存:新模型先在 Instinct GPU 上验证和部署,待推理量稳定后,再切换到 Taalas 加速器以降低单位成本——一种「tick-tock」的产品部署节奏。

无论 Taalas 的商业化需要多长时间,这笔收购已经发出了一个清晰的信号:AI 推理的下一个战场不在软件优化上,而在硅片本身。当通用 GPU 的每 token 成本曲线开始趋于平缓,把模型「烧」进硅片可能是突破边际成本的下一个手段。

The Register 和 Wccftech 的报道均引述了 The Next Platform 2 月对 Taalas 的深度技术分析作为关键来源。Taalas 的 HC2 芯片和 AMD 的产品集成路线图预计在收购完成后的 2027 年初发布。

来源

  1. AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market · AMD Investor Relations
  2. AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon · The Register
  3. AMD buys chip startup that hardwires AI models into its silicon · CNBC
  4. AMD deepens AI inference bet with Taalas deal as chip race heats up · Reuters
  5. Taalas Launches Hardcore Chip With 'Insane' AI Inference Performance · Forbes

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Cloudflare Workers AI 推理优化架构示意图

    Cloudflare 的边缘推理优化三层栈:FP8 KV Cache、INT4 权重与完整性保护如何让 Kimi 和 GLM 跑得更密

    算力 · 2026-08-03

  • Nscale 收购 Anyscale 官方公告配图

    Nscale 收购 Anyscale:一家 AI 新云厂商的全栈赌注

    算力 · 2026-07-30

  • SpaceX 发布的 Terafab 芯片工厂概念图

    Terafab 芯片工厂选址落地:Musk 的算力宣言与未闭合的执行缺口

    算力 · 2026-08-06

  • Google Cloud 展区入口的大型 Logo 投影和 OLED 标识,拍摄于巴塞罗那 MWC 展会

    Mirendil 签下 $1 亿+ Google Cloud 算力协议,RSI 赛道 9 天内锁定 $5 亿云基础设施

    算力 · 2026-08-06

  • Anthropic 品牌标识在智能手机屏幕上显示

    最后一个 AI Lab 也下场了:Anthropic 正式组建自研芯片团队

    算力 · 2026-08-05

  • Cloudflare OS 主视觉——AI 时代的组织操作系统

    Cloudflare OS 开源:一次对 SaaS 架构的根本性挑战

    算力 · 2026-08-05

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS