AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

腾讯开源混元 Hy4:1M 上下文工程化落地,模型开始优化自身基础设施

今天 · 共 3,283 字

模型
Tencent

8 月 28 日,腾讯发布并开源混元 Hy4 preview:770B 总参数、49B 激活参数的 MoE 模型,上下文窗口 1M,Apache 2.0 许可,权重同步放到 Hugging Face、ModelScope、GitCode 与 CNB。若只看规格,这是一次常规的"做大";真正值得读的是它如何把 1M 上下文从规格数字变成可服务的工程现实,以及腾讯第一次让旗舰模型参与优化自身的训练与推理基础设施。

规格:大,但并非只是大

模型卡给出的结构比"770B"这一数字信息量更大。主干 78 层,第一层是普通稠密 FFN,其余 77 层为 MoE,每层 256 个路由专家加 1 个共享专家,每个 token 激活其中 8 个路由专家与共享专家;主干之外另挂 1 层原生 MTP(Multi-Token Prediction,10B 总参数、0.7B 激活)用于投机解码。上下文 1M,隐藏维度 6144,词表 120,832。

相比上一代 Hy3——官方与第三方口径均为 295B 总参数、21B 激活、256K 上下文——Hy4 的总参数放大 2.6 倍、上下文放大约 4 倍,路由专家数也从 192 个增至 256 个,把新增容量投向更宽的专家池,而不是把网络堆得更深。

定价方面,OpenRouter 为每百万 token 输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元;腾讯云 TokenHub 为 6 元 / 18 元 / 0.3 元。WorkBuddy 与 CodeBuddy 提供两周限免,Hy3 在这两个平台的免费期延长至 9 月 30 日。

1M 上下文怎么落地:从"装得进"到"找得到"

长上下文真正的难点不是把 1M token 塞进窗口,而是推理时能否在可接受的成本内"找到"相关信息。若沿用稠密注意力,计算量随序列长度呈平方增长,从 256K 扩到 1M 意味着注意力运算量理论激增约 16 倍。

Hy4 的答案是腾讯称之为 Gated DSA 的稀疏注意力。DSA(DeepSeek Sparse Attention)的核心是两段式:先用一个轻量级"闪电索引器"(lightning indexer)对历史 token 做相关性打分,再只选取 top-k 个位置做精细注意力,其余位置不参与核心计算。Hy4 的索引器 top-k 为 2048——在 1M 满载上下文中,单次查询只聚焦约 0.2% 的历史。这套机制直接来自 DeepSeek-V3.2,腾讯在模型卡里写明"inspired by DeepSeek and GLM"。

但稀疏注意力带来一个隐性开销:索引器若在每一层都全量扫描一遍 1M 序列,寻址本身的重复计算依然庞大。Hy4 用 IndexCache 解决这一问题——相邻层选出的 top-k token 高度重合(论文给出的重叠率为 70% 到 100%),因此让大部分层直接复用邻近层的索引结果,省掉重复的索引扫描。IndexCache 由清华与智谱(Z.ai)提出,论文在 30B DSA 模型上测得最高削减 75% 的索引计算、1.82 倍 prefill 加速与 1.48 倍 decode 加速。需要强调的是:这些倍率来自学术实验模型,不是 Hy4 的端到端实测数据,腾讯也未公布 Hy4 上 IndexCache 的独立收益。

残差侧,Hy4 用 iHC(identity Hyper-Connections)把单一残差流扩展为 4 条并行流。腾讯未在模型卡中详述其训练细节;虎嗅的一篇评述指出 iHC 概念上脱胎于 DeepSeek 提出的 mHC(Hyper-Connections),但砍掉了 Sinkhorn 约束、固定为恒等映射,更轻量。门控(Gated)的精确数学同样没有公开,一位 Zhihu 分析者将其描述为对注意力输出做逐元素动态加权、并配合可学习的 attention sink,但这些是第三方解读,腾讯官方未确认。

最后是推理侧的原生 MTP 层。自回归模型一次只预测一个 token,MTP 额外预测更远的 token,部署时由主模型并行验证,从而加快解码。腾讯给出的 vLLM 与 SGLang 部署配置均默认启用 MTP 投机解码(vLLM 一次启用 3 个投机 token),说明 MTP 已被纳入官方推理加速链路,而非仅用于训练。

这套组合的代价是部署门槛:FP8 权重约 770GB,官方推荐 TP=8。Hy4 是开放权重模型,但不是个人或小团队能随手本地跑起来的模型,它的自部署对象是云厂商、模型服务商和有 8 卡集群的企业。

"模型优化自身":两个落点,与一个未定义的基线

这次发布最不寻常的声明,是腾讯称 Hy4 preview 首次参与了自身的研发流程。官方给出两个具体落点。

其一是推理基础设施的自我优化:Hy4 自主分析推理系统瓶颈,围绕算子融合与通信优化进行多轮改进,端到端吞吐较基线提升 31.8%,且在不同上下文长度与并发度下均取得一致收益。其二是作为"研究者"协调实验:研究页描述,Hy4 能像研究者一样管理多个 Codex 会话开展实验并根据结果调整方向,在小模型后训练任务中协调 Codex 同时优化多个评测目标,在 8 项评测上均优于 Codex 独立探索。腾讯把这些归为"早期阶段的递归自我改进闭环"。

这两点都需要打折来看。"31.8%"的对比基线没有被定义——是与未优化的自家版本比,还是与某个历史版本比,官方没有说明;"参与优化"与"主导优化"之间也有很大的解释空间。截至目前,这一自我改进闭环只有腾讯单方口径,没有第三方复现。它值得关注的不是分数本身,而是方向:如果模型确实能持续改进自己部署的算子与通信路径,开源模型竞争的衡量标准会从"跑分"部分转向"模型反哺基础设施的能力"。这仍是待验证的命题,而非既成事实。

评测:主场盲测,差距接近噪声

腾讯这次没有只报通用榜单,而是组织了 163 名内部专家、对 203 个工程任务做盲测:Hy4 preview 平均 2.99 分(满分 4),略高于 GLM 5.3 的 2.92 与 Kimi K3 的 2.94。

但分项更值得读。对 GLM 5.3,Hy4 胜 46.8%、平 12.8%、负 40.4%;对 Kimi K3,胜 51.2%、平 7.9%、负 40.9%。也就是说,在近四成的直接对比中 Hy4 是输的一方,均分差只有 0.05 到 0.07。腾讯自己的措辞是"slightly ahead"(略优),这比不少转述中的"碾压"准确得多。这组数据还有两层结构性局限:任务全部来自腾讯内部环境,天然贴近其产品场景,存在主场优势;且 203 个样本、接近噪声的分差,不足以支撑"全面领先"的结论。在出现独立第三方评测之前,正确的判断是"进入第一梯队",而不是"开源第一"。

模型卡附录显示的能力分布也印证了这一点。虎嗅的评述观察到,Hy4 的增益集中在可强化学习(RL)的 agentic、工具调用与工程任务上,而 HorizonMath、HLE 这类抗后训练的纯推理域提升幅度明显更小。模型卡同时坦承两项已知问题:复杂任务上推理时间过长、倾向于过度自我验证——后者意味着输出 token 可能膨胀,标价便宜不等于单任务成本便宜。

集成与定义:骨架来自哪里

把架构拆开看,Hy4 的注意力(DSA)、推测解码(MTP)来自 DeepSeek,跨层索引复用(IndexCache)来自智谱,残差结构(iHC)派生自 Hyper-Connections 路线。腾讯自建的部分——与内部软工、游戏、金融、安全专家共建的训练数据、后训练、与 WorkBuddy/CodeBuddy 的协同设计——都在"骨架"之外。虎嗅把这概括为"骨架外购、血肉自养",并据此判断腾讯扮演的是集成者而非模型定义者。

这一判断有其依据,但也要看另一面:把 DSA、IndexCache、iHC 与原生 MTP 咬合成一个自洽系统,并让 1M 上下文以可接受的成本上线服务,本身就是工程难度。腾讯的护城河不在单个架构组件,而在用自有产品(WorkBuddy、CodeBuddy、元宝、ima)的真实工作流反向定义训练数据与评测的闭环——这依赖腾讯的产品矩阵,纯模型公司难以复制。

对读者而言,最值得观察的变量是明确的:递归自我改进的 31.8% 能否有论文、日志或第三方复现支撑;正式版能否补上视觉输入这一当前硬缺口(Hy4 preview 为纯文本模型,暂无视觉输入);以及过度自我验证在正式版中改善到什么程度,因为那直接决定真实的单任务成本。

来源

  1. Tencent Releases and Open-Sources Tencent Hy4 preview · Tencent
  2. Hy4 preview 发布(腾讯混元研究页) · 腾讯混元
  3. tencent/Hy4-preview(模型卡) · Hugging Face
  4. Tencent-Hunyuan/Hy4-preview(GitHub) · GitHub
  5. Tencent open-sources Hy4 preview with 770B parameters and a 1M-token context · TechNode
  6. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models · arXiv
  7. IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse · arXiv
  8. Hy4,很好,很腾讯 · 虎嗅

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 示意图:Codex 通过 Chrome DevTools 驱动应用验证自己的工作——选择目标、快照界面状态、触发操作、观察运行时事件、应用修复并循环重跑,展示 Harness 管理的执行循环。

    OpenAI 开源 Codex Harness:智能体的护城河正从权重转向脚手架

    算法 · 2026-08-24

  • Qwen3.8-Flash-Next 官方发布横幅,展示模型名称与终极成本效率主题

    Qwen 开源 Qwen3.8-Flash-Next:125B 主干、每 token 激活 6B,提前预览 Qwen4 架构

    算法 · 2026-08-26

  • Claude 记忆设置中的 Topics 列表,展示 Claude 按主题保存的可编辑记忆条目

    Anthropic 合并 Claude 与 Cowork 记忆:默认开启,敏感类别默认不存

    算法 · 2026-08-28

  • Anthropic Model Hardware Standard(MHS)演示画面

    Anthropic 发布 MHS:给 AI agent 一套操作物理设备的互操作标准

    算法 · 2026-08-27

  • DeepSeek 新一轮融资配图:现有股东砺思资本、拾象与宁德时代将注入新资金

    DeepSeek 逼近 740 亿美元估值与科创板 IPO:两轮融资背后的算力账

    算法 · 2026-08-27

  • 上海世界人工智能大会上,人们走过宣传 Kimi K3 模型的月之暗面展位

    月之暗面与美国三大云谈 Kimi K3 分成,开源权重变现撞上地缘政治

    算法 · 2026-08-27

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS