AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

DeepSeek V4 Flash 发布一周:从 150 美元开发板到双 GH200,社区在一周内覆盖了完整硬件谱系

今天 · 共 3,856 字

模型
DeepSeek

7 月 31 日,DeepSeek 发布了 V4 Flash 的正式版本 0731——284B 总参数、13B 激活参数的 MoE 模型,MIT 许可,1M 上下文窗口。架构与前序预览版完全相同,变化全部来自重新执行的完整后训练管线:在 Terminal Bench 2.1 上从 61.8 跃升至 82.7,在 DeepSWE 上从 7.3 跳至 54.4。一个 13B 激活参数的模型在几乎所有 agentic 指标上超越了 49B 激活参数的 V4 Pro 预览版。

更引人注目的是接下来七天里发生的事。Reddit 的 r/LocalLLaMA 社区和开源贡献者没有等待官方优化——他们在从 150 美元的 AMD BC-250 加密矿卡到价值 5 万美元以上的双 GH200 工作站上跑通了 V4 Flash 的本地推理。这不是零散的 benchmark 数字,而是一个开源 MoE 模型首次在发布时就被同时适配到完整的硬件谱系上。

七天的性能矩阵:从 150 美元到 5 万美元

在硬件梯度的底端,QuarkStar——一个 Vulkan/Metal 推理引擎——将 Qwen3.6-35B-A3B 带到了 16GB 设备上,包括约 150 美元的 AMD BC-250。该卡基于 PS5 APU,24 个可用 CU,通过 Vulkan 计算管线运行量化模型。这验证了一个关键前提:MoE 模型的专家稀疏性意味着即使只有 16GB 统一内存,也可以通过 CPU/GPU 混合 offload 跑通推理。

在 24-32GB 消费级 GPU 端,antirez(Redis 作者)用约两周时间写出了 ds4——一个单文件 C 推理引擎,专门为 DeepSeek V4 Flash 在 Apple Metal 上优化。ds4 使用的 2-bit 量化不是标准 Q2_K:它仅对 routed MoE experts 做激进量化(输入/门控用 IQ2_XXS,输出用 Q2_K),而路由、投影和共享专家保持 Q8_0。在 128GB M3 Max MacBook 上,这套配置在 32K 上下文中达到约 58.5 tok/s prefill 和 26.7 tok/s 生成。

社区贡献者还在单张 RTX 5090(32GB VRAM)+ DDR5 系统内存的配置上,通过 vLLM + CPU/RAM offload 跑通了完整的 1M 上下文窗口,prefill 约 800 tok/s、decode 约 15+ tok/s。

在高端工作站端,David Noel Ng 在其双 GH200 系统上对 V4 Flash 0731 进行了系统性基准测试。vLLM + DSpark k=6 在代码审查场景达到约 276 tok/s decode,1M 上下文完全常驻 HBM。SGLang 在修复 shared-expert loader bug 后达到 317 tok/s decode,自适应 prefill chunk 策略将 1M 上下文的 TTFT 从固定 chunk 方案的 895 秒压缩到约 358 秒。

在服务器 GPU 端,Fergus Finn 和 Doubleword 团队在单张 AMD MI300X(192GB HBM3)上完成了完整适配,解决了 MI300X 的 fnuz FP8 方言问题、AITER 内核覆盖缺失和 HIP graphs 兼容性。优化后单卡达到约 2,699 tok/s decode——考虑到其租金约为同代 NVIDIA 方案的一半,这对推理云服务商有明确的经济意义。

在 Mac 端,M3 Ultra(256GB 统一内存,819 GB/s 带宽)上的 MXFP4-MLX 量化版本实现约 40-54 tok/s prefill 和约 4.5 tok/s decode,交互式生成速度可达 34-43 tok/s。

DSpark:让 MoE 推理加速的不是新模型,是更好的调度

如果社区适配是这波浪潮的广度,DSpark 则是支撑其深度的关键技术。DSpark 不是新模型——DeepSeek 的 HuggingFace 模型卡第一句话就说得很清楚:它是同一个 checkpoint,附加了一个推测解码模块。

DSpark 的设计解决了传统推测解码的两个核心问题。第一个是「后缀衰减」:传统 speculative decoding 使用小模型顺序生成 draft token,越靠后的 token 准确率越低,导致大量被验证步骤拒绝。DSpark 采用半自回归 draft——一个并行 backbone 在单次前向中为整个 block 输出 logits,再通过轻量级顺序 Markov head 基于已接受的 token 逐位修正,在保持高接受率的同时降低 draft 开销。

第二个问题是高并发退化。大多数推测解码实现在低并发时表现亮眼,但 batch size 上升时验证步骤的成本迅速超过收益。DSpark 的 confidence-scheduled verification 在每个 request 上分配不同的验证窗口:高置信度请求验证更长的 draft block,低置信度则提前截断。LMSYS 团队的 SGLang 集成在 H200 上的测试显示,在低接受率场景(如诗歌生成)中,动态预算相比全 block 验证持续领先。

SGLang 的 DSpark 集成还做了一项关键工程优化:ragged verify under CUDA graphs。传统方法需要将所有 request 的验证长度 padding 到统一尺寸;SGLang 保持 batch 的 ragged 特性,将变长 request 打包到紧凑 buffer 中,图捕获基于总 token 数而非固定形状——当预算削减时,重放的是真正更小的图。

在 Ng 的 GH200 测试中,DSpark k=6 实现约 2.97 倍的 decode 加速。但 Ng 也发现 DSpark block size 为 5,任何 num_speculative_tokens < 5 的配置会被直接拒绝——用户无法在低资源情况下通过减少 draft 深度来降低内存开销。

2-bit 量化的边界

2-bit 量化版本在 llm-sql-benchmark 上取得 25/25 满分——此前仅 Claude Opus 4.7 和 GPT-5.5 做到过。但这个结果需要放在正确上下文中。

antirez 的方案有一个关键设计选择:非对称量化。仅对 routed MoE experts 做 2-bit,路由网络、注意力投影、共享专家和门控机制全部保持 Q8_0。这在 MoE 架构中尤其合理——虽然 routed experts 占参数量的绝大多数,但每个 expert 只处理一小部分 token,对其进行激进量化对平均质量的影响远小于对共享组件。antirez 在 X 上总结道:「输入/门控 IQ2_XXS,输出 Q2_K。其他所有保持 Q8,以保护共享专家、投影和路由。」

但这套方案有一个实际约束:ds4 的 GGUF 文件不是标准格式,需要专用推理引擎,不兼容通用 llama.cpp 或 Ollama。

Escha Labs 的 Escha-W2 方案将 Qwen3.6 35B 压缩到 12.3GB,使用 2-3 bit 混合量化 experts、INT8 密集层。在 RTX 4090 上单流约 225 tok/s,32 并发约 1,321 tok/s。但在 LiveCodeBench v6 上得分 62.6,对比 FP8 基线的 67.0——量化在长上下文编码任务上的退化仍然显著。

更广泛的约束:Unsloth 的分析显示,即使 3-bit 量化(UD-IQ3_XXS)也需要约 103GB 内存,至少 110GB 总内存才能运行。这对大多数消费级硬件仍是门槛。

什么仍然不实用

几个具体的技术瓶颈:

TileLang 运行时编译:Ng 在 vLLM 测试中发现 p99 TTFT 飙升至 11.5 秒,原因是 mHC kernel 在服务期间即时编译。换成 PyTorch/Triton fallback 可消除延迟尖峰,但 decode 吞吐下降约 65%。

长上下文 prefill 仍然昂贵:1M 上下文的 prefill 约需 358 秒——这是无法绕过的计算量。

专用引擎碎片化:ds4、Krasis、Escha-W2 都依赖定制运行时。ds4 甚至不支持标准 GGUF。当模型更新时,维护成本集中在少数贡献者身上。

2-bit 质量边界不明确:SQL benchmark 满分是存在性证明,但 IQ2_XXS 量化在更长上下文、更复杂的 agentic 任务或推理链场景下的退化尚未被系统性评估。SQL 问题空间相对受限,满分未必能推广到开放域 agent 任务。

社区测试不可比:不同测试者使用不同的 prompt、量化级别和上下文长度。横向对比这些数字的意义有限——它们更适合作为「某配置是否能运行」的存在性证明。

开源模型的「锚点效应」

2023 年 Llama 2 发布后,社区围绕它建立了量化、微调和部署的完整生态——不是因为 Llama 2 是所有模型中最好的,而是因为它是当时开源可用的最佳起点。

DS V4 Flash 0731 的社区响应速度表明它正在获得类似地位。三个关键驱动因素:MIT 许可消除了商业部署的法律不确定性;284B/13B 的参数比使模型在理论上可被消费级硬件承载——13B 激活参数意味着单 token 推理的计算量仅相当于中等规模密集模型,284B 总参数则提供大模型的知识容量;DSpark 的内置支持意味着社区不需要自己实现推测解码。

与同期竞争者对比:Qwen3.7 Flash 目前仅通过 API 提供,MiniMax H3 的开放发布有延迟期,GLM-5.2 在 GH200 上需要 IQ2 量化且 decode 仅为个位数 tok/s。DS V4 Flash 在发布时间、许可清晰度和社区工具链成熟度上的组合优势是独特的。

但「锚点效应」不等于「已解决问题」。2-bit 量化的交互式推理速度对日常使用仍然偏慢,1M 上下文在消费级硬件上更多是能力验证,各专用引擎的长期维护存在不确定性。这波社区浪潮证明的不是前沿 AI 已经民主化,而是民主化的路径现在第一次变得清晰可见——接下来的里程碑将是标准化工具链的收敛和 3-bit 以下量化质量的可重现评估。

来源

  1. DeepSeek-V4-Flash-0731 官方模型卡 · Hugging Face
  2. 2x GH200 for LLM inference, Part 4: DeepSeek V4 Flash · David Noel Ng
  3. DSpark in SGLang · LMSYS Org
  4. Bringing up DeepSeek-V4-Flash on AMD MI300X · Fergus Finn
  5. DS4 inference engine · antirez
  6. DeepSeek-V4-Flash-0731 and Inkling Small · The Kaitchup

评论

登录后即可参与评论。

加载评论中…

相关文章

  • DeepSeek V4 Flash 0731 官方 benchmark 对比图表,显示 Agent 能力全面超越 V4 Pro Preview

    DeepSeek V4 Flash 正式版 Agent 能力超越 Pro Preview,同价开源不变

    算法 · 2026-07-31

  • LongCat 模型 Logo

    LongCat-Flash-Lite-Sparse:用稀疏注意力换掉 MLA,3B 激活实现 1M 上下文

    算法 · 2026-08-02

  • Apple Siri AI 在 iPhone、MacBook、iPad、Apple Vision Pro 和 Apple Watch 上的界面展示

    Siri AI 终于修好了,但 AI 赛场已经换了

    算法 · 2026-08-03

  • ComfyUI 优化前后 MiniMax H3 内存占用对比图:全精度 123.6GB 降至优化后 42.5GB,降低 66%

    MiniMax H3 开源:首个登顶视频评测的开放权重模型,但「开放」的边界在哪里

    算法 · 2026-08-03

  • Qwen3.8-Max 在编码智能体、通用智能体和通用能力等维度与 Opus4.8、Fable5、GPT5.6 Sol 的雷达图对比

    Qwen3.8-Max:阿里首次开源 Max 级模型,但长周期自主任务的证据链仍待补全

    算法 · 2026-08-03

  • OpenAI 公司 logo

    Agent 逃逸不是孤立事故:OpenAI 与 Anthropic 连环失控改写 AI 安全认知

    算法 · 2026-08-03

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS