AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Meta 自研 CXL 芯片救活退役 DDR4:内存正成为 AI 基础设施的新瓶颈

2026-07-02 / 3 周前 · 共 2,945 字

Tom's Hardware

6 月 29 日,在计算机体系结构顶会 ISCA 2026 上,Meta 披露了一颗自研芯片——它不做 AI 训练也不做推理加速,唯一的使命是把退役服务器上的旧 DDR4 内存,插进只支持 DDR5 的新服务器里继续用。

这颗芯片叫 Vistara。它带来的直接收益是一组经济数字:AI 推理服务器数量降低 25%,部分缓存工作负载延迟下降 29%,大数据分析任务的 executor 密度提升 33%。但 Vistara 真正值得关注的原因,是它暴露了 AI 基础设施一个正在加速的结构性转变——内存,而不是 GPU,正在成为下一道最难跨越的墙。

43.7% 的服务器被内存卡住脖子

Meta 在论文中披露了一个此前未公开的内部数据:在其数百万台通用服务器中,43.7% 的机器是"内存容量绑定"的——内存先于 CPU、存储或网络带宽耗尽,导致其余资源被白白闲置。在上一代硬件上,内存受限服务的 CPU 利用率一度跌至 25%-35%。

矛盾在于时间维度上的错配。Meta 服务器的预期服役周期为 5-7 年,但 DDR4 内存条的实际可用寿命可达 10-14 年。当一台服务器因 CPU 换代被退役时,其搭载的 DDR4 DIMM 远未到报废年限——它们只是被动地跟着服务器一起"被退休"了。而新款服务器早已全面切换至 DDR5,旧内存条物理上无法插入。

这不是 Meta 一家的问题。2026 年,AI 数据中心预计消耗全球约 70% 的 DRAM 产量,DDR5 合约价格单季涨幅高达 90%-95%。HBM 的高利润正在把 DRAM 厂商的产能从普通内存抽走,制造了一个横跨消费电子、企业 IT 和云计算的全行业短缺。

Meta 的解法是把退役 DDR4 从废品变成资产。

Vistara:一颗只做一件事的芯片

Vistara 是 Meta 第一代自研 CXL 内存扩展 ASIC。CXL(Compute Express Link)是建立在 PCIe 物理层之上的缓存一致性互联协议,核心能力是将内存从 CPU 的物理约束中解耦——让服务器通过 PCIe 总线访问不在本机内存插槽上的 DRAM。

单颗 Vistara 通过 PCIe Gen5 x16 接口(实际部署为 x8)连接主机,同时驱动两个独立 72-bit DDR4 通道。每颗芯片最高支持 256GB 容量(4×64GB DIMM),Meta 当前部署使用从退役服务器拆下的 32GB 模块,单芯片配置 128GB。芯片内置三颗 RISC-V 处理器分别负责安全启动、设备初始化和固件管理,典型功耗仅约 9W,空闲往返延迟控制在约 50ns。

两颗 Vistara 组成一个"MemServer"节点:一台搭载 AMD EPYC Turin 处理器(158 核/316 线程)的单路服务器,配备 768GB 本地 DDR5-6400 内存(12 通道,峰值带宽 614GB/s),再通过 Vistara 接入 256GB CXL 直连 DDR4-2400,总内存容量达到 1TB。CXL 内存以独立 NUMA 节点的形式暴露给 Linux,峰值带宽约 76GB/s,访问延迟约 250ns——大约是本地 DDR5 的 8 倍带宽差距和 2 倍延迟。

软件侧:用冷热分层消解性能差距

物理带宽和延迟的差距不会消失。Vistara 的关键工程决策在软件侧:不是让应用去适应慢内存,而是让操作系统把"冷页面"悄无声息地搬过去。

Meta 的软件栈基于 Linux 内核的 TPP(Transparent Page Placement,透明页面放置),结合自研的 TMO(Transparent Memory Offloading)主动降级策略。内核通过 NUMA 平衡机制追踪页面访问频率,将频繁访问的热页保留在本地 DDR5,将长时间未访问的冷页迁移到 CXL 侧。整个过程对应用透明。

论文中一项关键发现是:Meta 的生产工作负载具有极高的"冷内存比例"。在广告服务中,75% 的内存页面在 4 秒以上未被访问;在 Web 服务中,99 分位内存空闲时间长达 38.5 小时。这意味着即便 CXL 内存带宽只有本地 DDR5 的约八分之一,绝大多数工作负载的实际 CXL 带宽利用率不到 10%——它们几乎不需要访问冷页。

论文还驳斥了学术界此前关于 CXL 的两个担忧。一是尾延迟:有研究声称 CXL 设备在高负载下会出现不稳定的长尾延迟,但 Meta 的数据显示,经过工程优化的 ASIC(而非早期研究中使用的 FPGA)在高并发下尾延迟分布与本地 DRAM 几乎重叠。二是 TPP 性能开销:有论文担心页面冷热追踪的 CPU 开销过大,但 Meta 的生产数据显示 TPP 开销低于 0.5%,远未到需要 DMA 引擎加速的地步。

25% 服务器缩减,28 个百分点的碳足迹

论文提供了五个生产工作负载的 A/B 测试结果,均在实际流量下运行至少一周:

  • ML 参数服务器(推荐系统 embedding 表):服务器数量减少 25%,模型服务吞吐量提升 4%-12%。论文预测,随着模型规模扩展至 20TB,节省效果将持续保持。
  • 分布式缓存 CacheA:内存容量从 680GB 扩展到 890GB,单服务器 QPS 提升 33%,对象保留时间从约 1 分钟延长至 5-10 分钟——这对减少 flash 回源至关重要。
  • 分布式缓存 CacheB:缓存容量从 590GB 扩展到 820GB,平均查询延迟降低 29%,2.3% 的缓存命中从 flash 转移到内存,减缓了 SSD 磨损。
  • Spark 数据仓库:单服务器 executor 数增加 33%,OOM 事件和关联的作业重启开销降低 33%。
  • 开发基础设施:CI 容器密度和 devmachine VM 密度各提升 33%,开发机集群整体节省 15% 服务器。

更被低估的一项收益来自可持续性。Meta 的碳排放分析显示,DRAM DIMM 占单台服务器全生命周期碳排放的 69%——是 SSD 的 4 倍多。通过复用退役内存、延长 DIMM 使用寿命,Vistara 在削减采购成本的同时直接减少了新 DRAM 制造带来的碳足迹。

CXL 六年来第一个规模化证明

CXL 标准自 2019 年提出以来,学术界和商业产品(三星、Micron 均有 CXL 内存模块)探索不断,但始终缺少一份大规模生产部署的证据。Vistara 论文填补了这个空白——它不仅是芯片设计文档,更覆盖了从 ASIC 到 Linux 内核驱动程序、从固件管理到工作负载自动配置的全链路,并且已经在数百万台服务器上运行。

论文作者在摘要中明确写道:"六年后,CXL 的广泛适用性仍不确定,因为缺乏大规模、真实工作负载的经验",而 Vistara 是"首个端到端 CXL 解决方案的大规模部署报告"。

对于 Meta 之外的数据中心运营商,Vistara 暂时不可获得——这是一颗纯粹的内部芯片。但同一场 ISCA 会议上,韩国无晶圆厂半导体公司 Panmnesia 也展示了其 CXL 控制器和 Fabric Switch,支持端口路由(PBR),可将 CXL 内存扩展至最多 64 节点,已进入芯片采样阶段。

更重要的信号在于:CXL 在 2026 年从一个"也许有用"的研究方向变成了 hyperscaler 的实际生产工具。身处 DRAM 短缺中的数据中心,正在被迫接受一个现实——如果你不能像 Meta 一样自研芯片绕过缺货,就只能付涨价后的现货价格。

Linux 内核的 CXL 驱动支持、AMD EPYC Turin 平台的 CXL 原生兼容、以及 Meta 贡献回上游的内核改进,意味着 CXL 内存扩展正在从定制工程变成可复现的行业实践。Vistara 证明了一件事:当内存变成瓶颈,把"废品"变回资产的工程能力,本身就是一种护城河。

来源

  1. Vistara: Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment (ISCA 2026) · Meta Platforms
  2. Meta fights soaring hardware costs by reusing old DDR4 server memory in new DDR5-only servers · Tom's Hardware
  3. Zuck saves Meta bucks by reusing memory from old servers with a custom CXL ASIC · The Register
  4. Near zero-cost memory expansion through recycling · TechRadar
  5. Panmnesia boosts CXL scale with fabric switching. Meta repurposes old DRAM with CXL · Blocks and Files

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Meta 官方视频封面中的路易斯安那州 Richland Parish 乡村道路与林地。

    Meta 将路易斯安那 Hyperion 扩至 5GW,总投资突破 500 亿美元

    算力 · 2026-07-24

  • Google 位于俄亥俄州 New Albany 的数据中心园区夜景,AI 基础设施投入的直接体现

    Alphabet Q2 超预期却暴跌 6%:$2050 亿 AI 军备竞赛触发华尔街信任投票

    算力 · 2026-07-26

  • Etched 联合创始人兼 CEO Gavin Uberti

    从被所有 VC 拒绝到 10 亿美元订单:Etched 带着 Transformer 专用芯片出隐身模式

    算力 · 2026-07-25

  • Meta MTIA 芯片硅片特写,展示自研 AI 加速器的物理设计

    Meta 9月量产新版 MTIA 芯片:Broadcom 设计、台积电代工,目标一年算力翻倍至 14GW

    算力 · 2026-07-12

  • Meta 的 72 颗 MTIA 400 芯片组成的机架级系统

    Meta 自研 AI 芯片 Iris 9 月量产:Broadcom 设计、台积电 3nm,目标一年内算力翻倍至 14 吉瓦

    算力 · 2026-07-12

  • 服务器电路板上的多枚 Google Ironwood 加速芯片近景

    Google 秘密研发 Frozen v2:将 Gemini「烧」进硅片,模型即芯片的时代来了

    算力 · 2026-07-22

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS