8 月 1 日,美团 LongCat 团队在 HuggingFace 开源了 LongCat-Flash-Lite-Sparse——一个 69B 总参数、约 3B 激活参数的 MoE 模型。它的前身 LongCat-Flash-Lite 发布于今年 1 月,使用与 DeepSeek V3 同源的 Multi-Head Latent Attention(MLA)。新版本做了一个在工程上相当激进的决定:把 dense MLA 整个换掉,代之以自研的 LongCat Sparse Attention(LSA)。与此同时,模型的原生上下文从 256K 扩展到 1M token,Agent 编码和工具使用 benchmark 大幅提升,通用能力基本持平。MIT 许可开源。
这一替换的技术含义超出了「又一个模型发布」的范畴。过去两年,MLA 凭借将 KV cache 压缩至低秩隐空间的能力,几乎成为高效长上下文模型的事实标准——DeepSeek、Kimi、GLM 均采用 MLA 或其变体。而 LSA 走的是另一条路:不在 cache 表示上做压缩,而是改变注意力本身的模式——只关注被索引器判定为相关的 token 子集。DeepSeek V3.2 的做法是将 DSA 叠在 MLA 之上,两层优化同时运作;LongCat 的选择更彻底——既然稀疏注意力已经大幅减少了需要计算的 token 数,MLA 的 KV 压缩就变得冗余,直接用 LSA 替代 dense MLA 即可。LongCat-Flash-Lite-Sparse 的 benchmark 结果表明,对于 Agent 场景中常见的长上下文任务,这条更简洁的路线至少不比 MLA 差。
DSA 的瓶颈与 LSA 的三个修复
要理解 LSA,得先从它要改进的对象说起。
2025 年底,DeepSeek 在 V3.2 中引入了 DeepSeek Sparse Attention(DSA),核心思路是在 MLA 之上叠加一个轻量级的「闪电索引器」(Lightning Indexer)。索引器以极低的计算成本(每 token 仅 132 字节,而 dense MLA 需要 656 字节)扫描所有缓存 token,选出其中与当前 query 最相关的 top-k(通常 k=2048),然后仅对这 2048 个 token 执行完整的注意力计算。结果是将注意力复杂度从 O(L²) 降到 O(L·k),在 131K 上下文时数据加载量减少约 5 倍。
但 DSA 的索引器本身留下了一个效率问题。根据 LongCat 团队在 LongCat-2.0 技术博客中的分析,Lightning Indexer 存在两个瓶颈:输出不连续(output discontinuity)导致内存访问碎片化,以及评分计算的二次成本在极长上下文下仍不可忽略。
LSA 在 DSA 的基础上引入三个正交改进来解决这些问题:
流式感知索引(streaming-aware indexing) 针对自回归生成场景,利用相邻 token 的 query 相似性,避免为每个 decode step 从头计算索引。
跨层索引共享(cross-layer indexing) 让相邻 transformer 层复用索引结果。这与 GLM-5.2 的 IndexShare 思路类似——DSA 的 token 选择在相邻层之间变化不大,重复计算是浪费。
层级索引(hierarchical indexing) 构建多层索引结构,先用粗粒度筛选候选集,再在候选集内执行精细评分。这直接缓解了二次评分成本的扩展问题。
三者可以独立启用或关闭。从 benchmark 表来看,「不带层级索引」(w/o HI)的版本在大多数任务上略优于带 HI 的版本,说明层级索引仍有优化空间,但整体差距不大。
与 DSA 保留 MLA 作为底层 attention 实现不同,LongCat-Flash-Lite-Sparse 选择了一条更纯粹的路径:既然 LSA 已经将注意力稀疏化,就不再需要 MLA 的 KV 压缩。最终模型的注意力栈是 LSA 直接作用在标准 multi-head attention 结构上。
Benchmark:Agent 能力跃升,通用能力持平
对比 LongCat-Flash-Lite(dense MLA)和 Lite-Sparse(LSA),最显著的变化集中在 Agent 相关任务上:
Agent 编码方面,SWE-Bench Verified 从 54.40 跃升至 68.20(+13.8 个百分点),SWE-Bench Multilingual 从 38.10 升至 59.33(+21.2 个百分点)。在 SWE-Bench Pro 上 Lite-Sparse 达到 40.63——美团没有公布 Lite-Dense 在这一 benchmark 上的成绩,但作为参考,LongCat-2.0(1.6T 参数版本)在 SWE-Bench Pro 上约 59.5。
Agent 工具使用的提升更为突出:τ²-Telecom 从 72.80 升至 95.18(+22.4pp),VitaBench 从 7.00 升至 21.67(+14.7pp)。在 Agent Search 方面,BrowseComp 达到 48.62,BrowseComp-zh 为 61.94——这两项 Lite-Dense 未报告,是 LSA 新增的能力评估维度。
通用能力基本保持不变:MMLU 从 85.52 微降至 85.31(-0.2pp),MMLU-Pro 从 78.29 升至 79.24(+1pp),GPQA-Diamond 从 66.78 升至 69.49(+2.7pp)。数学推理方面,MATH500 维持 96.80,AIME 2026 达到 65.73。
这些数字的一致模式是:稀疏注意力对需要从长上下文中提取和综合信息的能力(Agent 编码、工具使用、搜索)有显著增益,对依赖模型内部知识或短上下文推理的能力几乎没有影响。这恰好符合预期——稀疏注意力改变了信息检索的效率,而不是模型的知识储备。
长上下文 benchmark:有进步,但仍是难点
在长上下文专项评估中,Lite-Sparse 的表现中等偏上。MRCR(8-needle 检索)44.66、GraphWalks Extend(多步推理)66.27、LongBench-v2 52.50——这些数字说明模型确实能处理 1M token 的输入,但在需要精确定位和聚合长距离信息的任务上,距离实用仍有差距。AMemBench-ACU(长程记忆)仅 33.25,表明在真正的「记忆」场景中,稀疏注意力可能漏掉了某些关键 token。
值得注意的是,层级索引(HI)开关在长上下文 benchmark 上的影响几乎为零——这进一步表明 HI 的优化方向可能不是精度,而是推理速度或内存占用。
与 DeepSeek DSA 路线的分野
LongCat-Flash-Lite-Sparse 做了一次重要的架构选择:用稀疏注意力完全替代 dense 注意力,而不是像 DeepSeek V3.2 和 GLM-5 那样在 MLA 上叠加 DSA。
这个选择的实际后果是什么?DeepSeek 路线保留了 MLA 的 KV 压缩能力,DSA 在此基础上进一步减少需要实际计算的 token 数——两层优化叠加。但代价是架构复杂度:MLA 的低秩压缩 + DSA 的索引器 + 稀疏注意力,三个模块耦合在一起。LongCat 路线是单层优化——只用 LSA 处理稀疏性——架构更简洁,且 3B 激活参数的量级意味着即使注意力层的绝对效率略低于 MLA+DSA 组合,整体推理成本仍然可控。
从 Meituan 公布的部署配置来看,Lite-Sparse 可以在单节点(1×H20-141G)上用 SGLang 启动,--nsa-prefill-backend fa3 参数表明预填充阶段使用了 FlashAttention 3 后端,稀疏注意力主要在 decode 阶段发挥作用。
竞争位置与局限
在 3B 激活参数这一量级,Lite-Sparse 的主要同类是 Qwen3.5 35B-A3B(Apache 2.0)和 DeepSeek V4 Flash 284B/13B-A(MIT)。Lite-Sparse 的注意力架构创新使其在长上下文 Agent 场景中有差异化优势,但通用 benchmark(MMLU 85.31)距离 DeepSeek V4 Flash 仍有差距。
需要明确的局限:所有 benchmark 数据来自美团自评,未经独立第三方验证。技术报告 PDF 在 HuggingFace 上发布但完整内容未能从 Web 端提取——LSA 三个索引机制的具体实现细节、训练数据规模、消融实验等关键信息尚未被外部充分审查。模型在真实生产环境中的表现、多语言能力的一致性和安全性评估,美团在模型卡中坦承「尚未针对所有下游应用进行全面评估」。
真正值得关注的是趋势:MLA 作为默认注意力方案的共识正在松动。不到一年前,几乎每一篇高效 LLM 的技术报告都在谈如何更好地做 KV 压缩。今天,DSA、LSA、MiniMax Sparse Attention 等稀疏方案正在提供另一条路径——不是压缩表示,而是选择性地丢弃不相关的计算。LongCat-Flash-Lite-Sparse 是这条路径上第一个公开验证「完全替代 dense 注意力可行」的模型。接下来要看的是,这条路径能不能继续扩展到更大规模。