Google 在 8 月 13 日发布 Gemini 3.7 Flash,距 3.6 Flash 上线仅三周,并把首发价定在每百万输入 token 0.75 美元、输出 token 3.75 美元,即 3.6 Flash 发布时定价的一半。Google 称其为"编码与 Agent 领域迄今最智能的主力模型",但它自己公布的 benchmark 表呈现的是选择性领先:生产代码质量、网页开发、文档理解与企业工作流自动化超过更贵的 Claude Sonnet 5 和 GPT-5.6 Terra,长程软件工程与终端 Agent 任务则仍落在 GPT-5.6 Terra 之后。
三周迭代:一次指向编码与 Agent 的定向升级
3.7 Flash 的定位非常具体。官方博客把改进点集中在三类工作负载:软件工程、知识工作和网页开发。模型卡只写明它"基于 3.6 Flash"、对其"核心推理基础做了算法改进",并支持可自定义的 thinking 配置以在质量、成本与延迟之间取舍,未披露参数规模或训练细节。上下文窗口为 1M token,输出上限 64K token,知识截止日期为 2026 年 3 月。
比 benchmark 更值得注意的,是 Google 对"开发者体验"的描述:3.7 Flash "想得更认真"(thinks more diligently),在遇到障碍时更愿意调整、在必要时澄清意图,并在多步规划与工具调用上投入更多努力。Google 的预期是,更自律的执行能换来更少的人工接管和更少的重试。对在 Agent 循环里反复调用模型的开发者来说,这一步的边际价值往往高于单项分数:单次请求会展开成串的推理 token 与工具调用,一次错误的工具选择就能拖垮整条工作流。
逐项对照:领先与落后并存
Google 官方模型卡给出了 3.7 Flash、3.6 Flash 及三家竞品的对照表。下表摘取与编码和 Agent 最相关的几项,全部为 Google 自测数据:
| Benchmark | 3.7 Flash | 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 Main(生产代码质量) | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1(长程软件工程) | 65.3% | 48.6% | 53.8% | 69.6% |
| Code Arena(网页开发,Elo) | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1(终端 Agent 编码) | 85.8% | 78.0% | 80.4% | 87.4% |
| Terminal-bench 3.0(通用 Agent 能力) | 14.9% | 5.4% | 14.6% | 20.8% |
| AutomationBench(企业工作流自动化) | 30.4% | 17.0% | 10.7% | 23.6% |
| GDP.pdf(复杂 PDF 理解) | 34.0% | 22.0% | 28.0% | 24.7% |
| OSWorld-2.0(Agent 计算机使用) | 47.9% | 33.8% | — | 50.2% |
这张表里有两条相反的信号。一条是相对前代的大幅跳升:FrontierCode 从 34.4% 到 43.6%,AutomationBench 从 17.0% 提升到 30.4%,GDP.pdf 从 22.0% 到 34.0%。另一条是相对竞品的落差:DeepSWE 65.3% 仍低于 GPT-5.6 Terra 的 69.6%,Terminal-bench 2.1 与 3.0 分别落后约 1.6 与 5.9 个百分点,OSWorld-2.0 也落后 Terra。Google 自己的对照表没有宣称 3.7 Flash 全面替代更高价竞品,而是把结论收敛为:在编码和 Agent 工作负载上显著更有竞争力,同时处在更低的价格档位。
在综合智力层面,Google 模型卡给出的 Artificial Analysis 综合智能指数为 56,高于 3.6 Flash 的 52,与 Claude Sonnet 5(55)相当,低于 GPT-5.6 Terra 与 Muse Spark 1.2(均为 57)。VentureBeat 补充,Artificial Analysis 对 Claude Opus 5 的该指数为 63——3.7 Flash 是向前追赶,但没有回到榜首。
价格口径:减半是限时优惠,不是永久降价
0.75/3.75 美元的定价附带了时间条件:这是截至 2026 年 12 月 31 日的首发价,2027 年 1 月 1 日起恢复到每百万输入 token 1.50 美元、输出 7.50 美元,上下文缓存也从首发的 0.075 美元升到 0.15 美元。换句话说,3.7 Flash 的首发价是 3.6 Flash 现行标准价(1.50/7.50 美元)的一半,而这两个 Flash 模型目前共享同一价格点。
把这个价格放进竞品坐标才看得出意图:Google 模型卡列出的 Claude Sonnet 5 为 2/10 美元,GPT-5.6 Terra 为 2/12 美元,Muse Spark 1.2 为 1.25/4.25 美元。Ars Technica 则提到 OpenAI 已下调 GPT-5.6 系列价格,其中对标 Flash 档的 Luna 版为 0.20/1.20 美元,仍比 3.7 Flash 首发价更低。真正的成本账不在单价,而在"每完成一个任务的成本":如果 3.7 Flash 的首次通过率提升和重试减少在生产环境中成立,它对高吞吐编码与文档处理 Agent 的降本会超过单纯 token 单价的差距;反之,限时优惠到期后,这一优势会被重新定价。
与 Gemini Spark 绑定,以及 Pro 缺席的背景
这轮迭代还直接落到消费级 Agent 产品上。Google 在 5 月 I/O 发布的 24/7 个人 Agent Gemini Spark,从发布当天起改用 3.7 Flash,面向 Google AI Pro 与 Ultra 订阅用户(覆盖 160 多个国家和地区,不含 EEA、尼日利亚、瑞士与英国)。官方称升级改善了 Spark 在 Google Workspace 工具调用上的准确率,覆盖整合文件、起草邮件、更新状态文档等多技能工作流。
把 3.7 Flash 放到更长的公司时间线上看,它的角色更清楚。Google 的旗舰 3.5 Pro 至今未发布:Reuters 7 月报道其因编码等内部目标未达标而推迟,Google 在 8 月 13 日的发布中仍未给出时间表。同期 Google AI 领导层完成了一轮重组——Demis Hassabis 转任 Alphabet 首席科学家,Koray Kavukcuoglu 以高级副总裁身份接管 Gemini 全链路,Jeff Dean、Oriol Vinyals、Quoc Le、Sanjay Ghemawat 等人离开创办研究初创 Discovery Loop。在这一背景下,Flash 系列是 Google 目前能够快速推向市场的模型线:三周一次迭代、减半首发价,指向的是用"够用且便宜"的模型守住编码与 Agent 生产份额,而非追回旗舰级的绝对领先。
边界与待验证项
上述 benchmark 全部来自 Google 自测,尚无独立第三方复现;Arena 的早期人类偏好结果暂列 3.7 Flash 总榜第九、网页开发第八,样本仍在积累。"三周迭代"说明的是发布节奏,不等于技术增量——模型卡只确认 3.7 Flash"基于 3.6 Flash",未公开所谓算法创新的具体内容,外人也无法从外部独立验证。
安全侧,模型卡给出的是相对保守的结论:按 2026 年 4 月版 Frontier Safety Framework 评估,3.7 Flash 未达到任何 tracked 或 critical 能力级别;网络安全域"达到警示阈值但未达到能力级别",CBRN 域同样未达阈值。模型随发布更新了针对 CBRN 与网络攻击的滥用防护。这些判断同样来自 Google 自身的评估流程,且 Frontier Safety Framework 报告尚未发布。
对选型者来说,3.7 Flash 留下的可检验问题是:限时价格到期后,其"每任务成本"是否仍能维持对 Claude Sonnet 5 和 GPT-5.6 Terra 的优势;以及首次通过率和重试减少在客户自有代码库、提示词和工具 schema 上是否同样成立。这两个问题只能由开发者在自己的工作负载上测出来,而不是从 Google 的发布表格里读出来。