AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Gemini 3.7 Flash 三周即迭代:首发价减半,编码与文档工作负载领先

今天 · 共 3,193 字

模型Agent
Google DeepMind

Google 在 8 月 13 日发布 Gemini 3.7 Flash,距 3.6 Flash 上线仅三周,并把首发价定在每百万输入 token 0.75 美元、输出 token 3.75 美元,即 3.6 Flash 发布时定价的一半。Google 称其为"编码与 Agent 领域迄今最智能的主力模型",但它自己公布的 benchmark 表呈现的是选择性领先:生产代码质量、网页开发、文档理解与企业工作流自动化超过更贵的 Claude Sonnet 5 和 GPT-5.6 Terra,长程软件工程与终端 Agent 任务则仍落在 GPT-5.6 Terra 之后。

三周迭代:一次指向编码与 Agent 的定向升级

3.7 Flash 的定位非常具体。官方博客把改进点集中在三类工作负载:软件工程、知识工作和网页开发。模型卡只写明它"基于 3.6 Flash"、对其"核心推理基础做了算法改进",并支持可自定义的 thinking 配置以在质量、成本与延迟之间取舍,未披露参数规模或训练细节。上下文窗口为 1M token,输出上限 64K token,知识截止日期为 2026 年 3 月。

比 benchmark 更值得注意的,是 Google 对"开发者体验"的描述:3.7 Flash "想得更认真"(thinks more diligently),在遇到障碍时更愿意调整、在必要时澄清意图,并在多步规划与工具调用上投入更多努力。Google 的预期是,更自律的执行能换来更少的人工接管和更少的重试。对在 Agent 循环里反复调用模型的开发者来说,这一步的边际价值往往高于单项分数:单次请求会展开成串的推理 token 与工具调用,一次错误的工具选择就能拖垮整条工作流。

逐项对照:领先与落后并存

Google 官方模型卡给出了 3.7 Flash、3.6 Flash 及三家竞品的对照表。下表摘取与编码和 Agent 最相关的几项,全部为 Google 自测数据:

Benchmark 3.7 Flash 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra
FrontierCode 1.1 Main(生产代码质量) 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1(长程软件工程) 65.3% 48.6% 53.8% 69.6%
Code Arena(网页开发,Elo) 1588 1538 1541 1523
Terminal-bench 2.1(终端 Agent 编码) 85.8% 78.0% 80.4% 87.4%
Terminal-bench 3.0(通用 Agent 能力) 14.9% 5.4% 14.6% 20.8%
AutomationBench(企业工作流自动化) 30.4% 17.0% 10.7% 23.6%
GDP.pdf(复杂 PDF 理解) 34.0% 22.0% 28.0% 24.7%
OSWorld-2.0(Agent 计算机使用) 47.9% 33.8% — 50.2%

这张表里有两条相反的信号。一条是相对前代的大幅跳升:FrontierCode 从 34.4% 到 43.6%,AutomationBench 从 17.0% 提升到 30.4%,GDP.pdf 从 22.0% 到 34.0%。另一条是相对竞品的落差:DeepSWE 65.3% 仍低于 GPT-5.6 Terra 的 69.6%,Terminal-bench 2.1 与 3.0 分别落后约 1.6 与 5.9 个百分点,OSWorld-2.0 也落后 Terra。Google 自己的对照表没有宣称 3.7 Flash 全面替代更高价竞品,而是把结论收敛为:在编码和 Agent 工作负载上显著更有竞争力,同时处在更低的价格档位。

在综合智力层面,Google 模型卡给出的 Artificial Analysis 综合智能指数为 56,高于 3.6 Flash 的 52,与 Claude Sonnet 5(55)相当,低于 GPT-5.6 Terra 与 Muse Spark 1.2(均为 57)。VentureBeat 补充,Artificial Analysis 对 Claude Opus 5 的该指数为 63——3.7 Flash 是向前追赶,但没有回到榜首。

价格口径:减半是限时优惠,不是永久降价

0.75/3.75 美元的定价附带了时间条件:这是截至 2026 年 12 月 31 日的首发价,2027 年 1 月 1 日起恢复到每百万输入 token 1.50 美元、输出 7.50 美元,上下文缓存也从首发的 0.075 美元升到 0.15 美元。换句话说,3.7 Flash 的首发价是 3.6 Flash 现行标准价(1.50/7.50 美元)的一半,而这两个 Flash 模型目前共享同一价格点。

把这个价格放进竞品坐标才看得出意图:Google 模型卡列出的 Claude Sonnet 5 为 2/10 美元,GPT-5.6 Terra 为 2/12 美元,Muse Spark 1.2 为 1.25/4.25 美元。Ars Technica 则提到 OpenAI 已下调 GPT-5.6 系列价格,其中对标 Flash 档的 Luna 版为 0.20/1.20 美元,仍比 3.7 Flash 首发价更低。真正的成本账不在单价,而在"每完成一个任务的成本":如果 3.7 Flash 的首次通过率提升和重试减少在生产环境中成立,它对高吞吐编码与文档处理 Agent 的降本会超过单纯 token 单价的差距;反之,限时优惠到期后,这一优势会被重新定价。

与 Gemini Spark 绑定,以及 Pro 缺席的背景

这轮迭代还直接落到消费级 Agent 产品上。Google 在 5 月 I/O 发布的 24/7 个人 Agent Gemini Spark,从发布当天起改用 3.7 Flash,面向 Google AI Pro 与 Ultra 订阅用户(覆盖 160 多个国家和地区,不含 EEA、尼日利亚、瑞士与英国)。官方称升级改善了 Spark 在 Google Workspace 工具调用上的准确率,覆盖整合文件、起草邮件、更新状态文档等多技能工作流。

把 3.7 Flash 放到更长的公司时间线上看,它的角色更清楚。Google 的旗舰 3.5 Pro 至今未发布:Reuters 7 月报道其因编码等内部目标未达标而推迟,Google 在 8 月 13 日的发布中仍未给出时间表。同期 Google AI 领导层完成了一轮重组——Demis Hassabis 转任 Alphabet 首席科学家,Koray Kavukcuoglu 以高级副总裁身份接管 Gemini 全链路,Jeff Dean、Oriol Vinyals、Quoc Le、Sanjay Ghemawat 等人离开创办研究初创 Discovery Loop。在这一背景下,Flash 系列是 Google 目前能够快速推向市场的模型线:三周一次迭代、减半首发价,指向的是用"够用且便宜"的模型守住编码与 Agent 生产份额,而非追回旗舰级的绝对领先。

边界与待验证项

上述 benchmark 全部来自 Google 自测,尚无独立第三方复现;Arena 的早期人类偏好结果暂列 3.7 Flash 总榜第九、网页开发第八,样本仍在积累。"三周迭代"说明的是发布节奏,不等于技术增量——模型卡只确认 3.7 Flash"基于 3.6 Flash",未公开所谓算法创新的具体内容,外人也无法从外部独立验证。

安全侧,模型卡给出的是相对保守的结论:按 2026 年 4 月版 Frontier Safety Framework 评估,3.7 Flash 未达到任何 tracked 或 critical 能力级别;网络安全域"达到警示阈值但未达到能力级别",CBRN 域同样未达阈值。模型随发布更新了针对 CBRN 与网络攻击的滥用防护。这些判断同样来自 Google 自身的评估流程,且 Frontier Safety Framework 报告尚未发布。

对选型者来说,3.7 Flash 留下的可检验问题是:限时价格到期后,其"每任务成本"是否仍能维持对 Claude Sonnet 5 和 GPT-5.6 Terra 的优势;以及首次通过率和重试减少在客户自有代码库、提示词和工具 schema 上是否同样成立。这两个问题只能由开发者在自己的工作负载上测出来,而不是从 Google 的发布表格里读出来。

来源

  1. Introducing Gemini 3.7 Flash · Google DeepMind
  2. Gemini 3.7 Flash Model Card · Google DeepMind
  3. Google's Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut · VentureBeat
  4. Google announces Gemini 3.7 Flash just three weeks after previous release · Ars Technica

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 论文图 1:AutoResearch 轨迹的生成与执行成本随规模非对称增长——生成通过批处理共享算力,执行则每个方案独占一个沙箱与真实机时,使执行成为传统 RL 的瓶颈;WMRL 用世界模型移除该瓶颈

    用世界模型替代环境执行,Agent RL 提速 3–4 倍且性能不降反升

    算法 · 2026-08-15

  • 智能手机屏幕上 Google Gemini 应用图标的特写照片

    Gemini 月活破 10 亿,但与 ChatGPT 的 10 亿是两个口径

    算法 · 2026-08-12

  • Grok Bot launch announcement hero image showing the product branding

    Grok Bot 给 AI Agent 配了一台永不离线的云电脑

    算法 · 2026-08-12

  • NVIDIA Nemotron 3.5 Lightning agentic AI 架构示意图

    Nemotron 3.5 Lightning 发布:路由库 Switchyard 才是 NVIDIA 的真正赌注

    算法 · 2026-08-12

  • Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

    从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

    算法 · 2026-08-10

  • Motif Technologies 标志

    Motif-3 正式发布:韩国 30 人团队用政府算力造出 MIT 许可的 314B MoE,Agent 基准领跑四强

    算法 · 2026-08-10

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS