7 月 20 日,The Information 和 Bloomberg 同时爆料:Alphabet 旗下的 Google 正在研发一款代号「Frozen v2」的新一代服务器芯片,其核心创新不是更快的晶体管或更大的内存带宽,而是将 Gemini 模型的架构元素直接固化在硅片中。信息来自两名直接知情人士,目标部署时间最早为 2028 年。消息公布后,Alphabet 股价当日收涨 1.51%,报 $351.99。
「Frozen」这个名字来自机器学习术语——「冻结」(freeze)参数意味着将其锁定、不再更新。Google 的野心是将这种「冻结」从软件层下沉到物理层:把 Gemini 的部分网络结构直接蚀刻进晶体管电路。这不再是通用芯片跑通用模型,而是芯片的物理设计反映模型的架构特性——半导体历史上罕见的垂直锁定深度。
从 TPU 到 Frozen:一条更激进的路
要理解 Frozen v2 的激进之处,需要回顾 Google 的自研芯片路线。
Google 从 2015 年开始在内部使用 TPU(张量处理单元),至今已演进至第八代——2026 年 4 月 Cloud Next 大会上发布的 TPU 8t(训练)和 TPU 8i(推理),首次将训练和推理拆分为两条独立产品线。TPU 的核心理念是「AI 专用但模型通用」:它是为神经网络计算优化的 ASIC,但任何模型——Gemini、Gemma、第三方开源模型——都可以在 TPU 上运行。
Frozen v2 打破了这个范式。据 The Information 报道,该芯片将 Gemini 模型的部分架构元素直接嵌入硅片设计,工程师预计其推理效率可达最新一代 TPU 的 6 到 10 倍——以「每瓦特功耗产生的 token 数量」衡量。Tom's Hardware 进一步指出,Google 不打算以 TPU 的规模量产 Frozen v2,而是将这一代视为试验品,为「模型架构趋于稳定后的更专用硅」探路。
The Decoder 对命名的解释提供了关键线索:「冻结参数」意味着这些被固化的模型组件不会随软件更新而改变——芯片生产出来后,Gemini 的那部分就「长」在硅里了。这是灵活性换效率的极端交易。
多位分析师指出,Frozen v2 几乎不可能成为对外销售的云产品——它是 Google 的内部效率工具,专门服务于 Gemini 家族模型的推理场景。这与 TPU 的商业化路径形成鲜明对比:TPU 通过 Google Cloud 向外部客户开放,而 Frozen v2 是把芯片锁定在单一模型上。
Gemini 困境与硬件豪赌
Frozen v2 的曝光时间点耐人寻味。
就在一周前,本刊报道了 Gemini 3.5 Pro 因编码能力不足第三次推迟发布,Alphabet 市值蒸发约 2000 亿美元。Google CFO 此前透露,Anthropic 的 Claude 已能用 AI 撰写接近 100% 的代码,而 Google 内部约 50%。Sergey Brin 亲自参与组建的编码「突击队」正在重组,战略重心从编码工具转向「中训练」技术。
在这种背景下,Frozen v2 的研发表明 Google 并非单纯在软件层面追赶——它正在做一个不同时间尺度的押注:如果 Gemini 在模型能力上暂时落后,那就确保当 Gemini 追上时,运行它的成本只有竞品的十分之一。
The Information 援引消息人士称,Frozen v2 项目独立于 TPU 团队运作,直接向 Google DeepMind 和 Google Cloud 的高层汇报。这暗示着该项目不仅是芯片工程,更是「模型-芯片协同设计」的战略级实验——芯片设计师和模型架构师在同一张桌子上决定哪些计算模式值得被「烧」进硅片。
CNBC 报道指出,Alphabet 股价在消息公布后一度上涨 3.7%,最终收涨 1.51%。市场似乎在用真金白银投票:在一个模型层价格战白热化的年份,控制推理成本的能力比模型本身的短期 benchmark 排名更具长期价值。
模型即芯片:一场行业级的范式竞赛
Google 并非唯一在尝试将模型和芯片深度绑定的公司。2026 年夏天,前沿 AI 公司正在系统性地将软件栈和硬件栈对齐,只是各自的路径和激进程度不同。
6 月 24 日,OpenAI 与 Broadcom 联合发布了 Jalapeño——一款专为 LLM 推理设计的定制芯片,但 Jalapeño 仍是「AI 专用但模型通用」的设计,可以运行 GPT 系列之外的模型。7 月 2 日,TechCrunch 报道 Anthropic 正与三星讨论定制芯片合作。Meta 的 MTIA 和 Iris 芯片系列、Microsoft 的 Maia 芯片、AWS 的 Trainium 和 Inferentia——hyperscaler 的自研芯片竞赛已经全面铺开。Etched 则以 50 亿美元估值和 10 亿美元合同订单证明,市场愿意为 Transformer 专用推理架构下重注。
但 Frozen v2 的激进程度超出了上述所有项目。它不仅是「AI 专用」,更是「单一模型专用」。这提出了一个根本性的战略问题:模型架构是否已经趋于稳定,值得为之铸造硅片?
The New Stack 的分析一语中的:Frozen v2 的前提假设是 Gemini 的架构在 2028 年之前不会发生根本性变化——否则固化的那部分硅就会变成沉没成本。Google 的设计回应似乎是「灵活固化」:只冻那些最稳定、最基础的计算模式,而非整个模型。
推理经济学:为什么「烧进硅片」是终极答案
2026 年,前沿模型的推理定价正在经历断崖式下跌。Grok 4.5 定价 $2/$6(输入/输出每百万 token),GPT-5.6 Terra 为 $2.50/$15,而 Anthropic 的 Fable 5 定价高达 $10/$50——三度延期的免费窗口才刚在 7 月 19 日午夜正式关闭。「Tokenmaxxing」文化的终结——Uber 四个月内耗尽全年 AI 预算、Walmart 对内部编码工具设限——更是让模型厂商面临越来越大的降价压力。
在这种环境下,推理成本不再是锦上添花的运营效率问题,而是模型公司的生死线。谁能在单位电力消耗下输出更多 token,谁就能在价格战中活得更久、抢到更多份额。将模型「烧」进硅片的长期成本优势——6 到 10 倍的每瓦 token 产出——如果兑现,将是决定性的。
这也解释了为什么市场对一份「最早 2028 年」的芯片爆料反应积极。因为投资者正在用 DCF 模型衡量 AI 公司的远期推理经济性:如果 Google 能在 2028 年以十分之一的电力成本运行 Gemini,那么今天 Gemini 在编码 benchmark 上落后几个百分点就不再那么重要。
已知的未知
Frozen v2 目前仅存在于报道中,Google 未正式确认该项目。多个关键问题尚无答案:
制程节点:多位分析师推测 Frozen v2 可能采用 3nm 或更先进制程,但 Tom's Hardware 指出,考虑到 2028 年目标,完全可能在 2nm 节点上流片。这将影响实际的效率增益幅度。
经济可行性:芯片设计的一次性工程成本(NRE)在先进制程上可达数亿美元。如果 Frozen v2 只服务 Gemini 且不对外销售,它需要极大的推理规模才能摊销——Google 必须坚信 Gemini 将成为数十亿用户日常使用的模型。
架构风险:如果 Gemini 的底层架构在 2025-2028 年间发生重大变化——例如从 Dense 转向 MoE 或引入全新的注意力机制——已固化的硅可能变成废铁。Google 需要在「冻哪些层」和「留哪些灵活」之间做出精确判断。
人才争夺:芯片架构师是 AI 行业最稀缺的人才之一。Google 能否在 OpenAI(Broadcom 合作)、Meta(自研团队)、Apple(硬件传统优势)的围攻下维持 Frozen 团队,是一个被低估的风险。
结语
Frozen v2 的真正意义不在于它比 TPU 快多少倍,而在于它代表了一种新的信念:AI 的价值捕获正在从软件层向硅层迁移。当模型的能力趋于收敛,当 token 价格趋近于电力成本,控制物理层的人将控制一切。Google 正在为那个未来下注——用一块只属于 Gemini 的芯片。