7月9日成为AI行业历史上模型和产品发布最密集的一天。SpaceXAI在同一天公开发布Grok 4.5;Meta结束观望,推出首个封闭付费模型Muse Spark 1.1;OpenAI将GPT-5.6公开发布并合并Codex到ChatGPT超级应用,同时推出ChatGPT Work挑战Claude Cowork;Anthropic以Claude Cowork移动端和Web端同步上线作为直接回应。
7月10日,独立基准测试结果开始浮现,拼出了更完整的竞争图景。
1 周前 · 2026-07-10
7月9日成为AI行业历史上模型和产品发布最密集的一天。SpaceXAI在同一天公开发布Grok 4.5;Meta结束观望,推出首个封闭付费模型Muse Spark 1.1;OpenAI将GPT-5.6公开发布并合并Codex到ChatGPT超级应用,同时推出ChatGPT Work挑战Claude Cowork;Anthropic以Claude Cowork移动端和Web端同步上线作为直接回应。
7月10日,独立基准测试结果开始浮现,拼出了更完整的竞争图景。
Artificial Analysis 在24小时独立测试后给出定论:Grok 4.5在Intelligence Index排名第四(54分),落后于Claude Fable 5、GPT-5.5和Claude Opus 4.8。但它在Coding Agent Index中取得了所有模型中最好的Agent工具调用成绩,成为需要连续工具调用和动作执行的工作流的最佳选择。
最令人担忧的数据:Grok 4.5的幻觉率从Grok 4.3的25%飙升至54%。模型的知识准确率确实从35%提升到52%,但犯错时的自信程度也翻了一倍——这是一个已知的大规模推理模型模式。
Snorkel AI在约2000个GDPval+专业工作任务上的独立评估提供了另一个视角:Grok 4.5以29%的平均通过率领先GPT-5.5(22%)和Opus 4.8(21%),在法律(40% vs 27-28%)、教育(58% vs 35-42%)、医疗(35% vs 23-25%)等需要深度专业判断的领域优势尤为明显。
来源:Build Fast with AI、Snorkel AI、TechCrunch
Meta于7月9日发布Muse Spark 1.1,这是一款面向Agent任务的多模态推理模型,在工具使用、计算机操控、编码和多模态理解方面有显著提升。值得注意的是:这是Meta首个闭源、托管、按token计费($1.25/$4.25每百万token)的模型,通过Meta Model API向美国开发者开放。
此前Meta主要通过开放权重发布模型,这一转变标志着Meta Superintelligence Labs在Alexandr Wang领导下的商业化策略调整。100万token上下文窗口、免费Thinking模式在Meta AI应用中可用,但开发者API是付费的——Meta正式从"开源旗手"变成"模型军火商"。
开源模型运行平台Ollama于7月9日宣布完成6500万美元Series B融资,由Theory Ventures领投,Benchmark、8VC、Y Combinator等参与,累计融资额达8800万美元。公司披露月活开发者890万、进入85%的Fortune 500企业、每周新增近百万安装量——而团队仅14人。
Ollama代表的价值主张正在被验证:在Claude Fable 5收费$50/百万token、GPT-5.6 Sol收费$30的定价环境中,一行命令本地运行开源模型的"开发者入口"角色变得越来越关键。公司创始人表示,转折点出现在2026年1月OpenClaw开始流行的时候——大型开源模型突然能执行Agent编码任务,Ollama的使用量开始加速增长。
AI训练数据公司Mercor正在洽谈以约200亿美元估值进行新一轮融资,较2025年10月100亿美元估值翻倍。与此同时,Mercor宣布收购Deeptune——一家为企业软件环境提供AI Agent训练仿真环境的创业公司(a16z此前领投其4300万美元A轮)。
Deeptune的技术让AI Agent在Salesforce、电子表格等真实企业软件环境中练习——不是回答问题,而是完成工作流程。这标志着AI数据产业正在从"雇人写评测"向"搭建可反复练习的真实工作环境"升级。Fortune披露了一个有趣的细节:Mercor创始人Brendan Foody此前悄悄以个人身份投资了Deeptune,几个月后又通过Mercor将其收购。Mercor此前还收购了Sepal AI(2026年2月),正在系统性地整合AI训练工具链。
Google于7月9日宣布,在Search、YouTube、Discover的My Ad Center中加入"How this ad was made"面板,展示广告是否由AI创建或编辑。使用Google自家生成式广告工具创建的广告会自动添加披露;使用外部工具的广告主可通过手动标注控件披露。部分地区会根据本地法规在广告表面直接显示标签。
这一举措发生在欧盟AI法案第50条透明度义务8月2日生效前三周,届时违规罚款可达1500万欧元或全球年营收的3%。从政治广告扩展到商业广告的AI内容透明度机制,正成为AI治理中少有的跨大西洋共识。
来源:The AI Insider、Digital Applied
OpenAI在7月9日GPT-5.6发布的同时,推出ChatGPT Work——一个Agent生产力工具,整合Codex技术和15+第三方集成(Google Drive、Slack、Salesforce、GitHub等),可通过@提及调用。独立Codex桌面应用和Atlas浏览器被合并进统一的ChatGPT桌面应用。OpenAI应用CEO Fidji Simo将其描述为"从聊天界面到完整计算环境"的转变。
Anthropic选择在7月9日同一天将Claude Cowork扩展到移动端(iOS和Android)和Web端,用户可以在手机上委托知识工作任务、远程监控长时间运行的Agent会话、跨设备继续工作。此前Agent会话需要桌面端保持活跃。The Decoder将其描述为先发制人之举——Anthropic知道ChatGPT Work即将发布。
来源:The Verge
伊利诺伊州州长JB Pritzker于7月6日签署了《人工智能安全措施法案》(SB 315),成为全美首部要求对大型前沿AI模型进行第三方安全审计的州级法律。该法案被透明度联盟称为"全美最具保护性的AI法规",要求AI开发者在使用大型模型前进行安全评估,并建立问责机制。在联邦层面AI立法停滞的背景下,伊利诺伊州成为新的监管前沿。
来源:Transparency Coalition、Capitol News Illinois
xAI以监管合规审查为由,未在7月8-9日在欧盟发布Grok 4.5,目标推迟至7月中旬。背景是欧盟AI法案高风险执行截止日期8月2日临近。Grok 4.5的网络安全能力评级为高风险,可能需要完成GDPR合规工程和AI法案合规文件后才能合法在欧盟提供。这使欧洲开发者暂时无法使用该模型。
开源模型运行平台,月活开发者890万、进入85% Fortune 500。Theory Ventures领投,Benchmark、8VC、YC参投,累计融资8800万美元。团队仅14人。
来源:TechCrunch
AI训练数据平台,同时宣布收购Deeptune。ARR超过20亿美元(公司自披露),正洽谈以200亿美元估值融资,较9个月前翻倍。
来源:TechCrunch
快手旗下AI视频生成平台Kling AI完成约28亿美元融资,阿里巴巴和腾讯参投,投前估值约150亿美元。快手设定目标在12个月内推动Kling AI在港交所上市。这是中国AI视频赛道迄今最大单笔融资。
以下项目在7月10日GitHub Trending中表现突出:
wonderwhy-er/DesktopCommanderMCP — 为Claude提供终端控制、文件系统搜索和差异文件编辑能力的MCP服务器。支持长时间运行命令执行和进程管理,是当日GitHub Trending第一名。
addyosmani/agent-skills — Google Chrome工程总监Addy Osmani整理的AI Agent技能集合,涵盖编码、调试和自动化工作流的可复用技能模式。
davila7/claude-code-templates — Claude Code的模板和配置集合,帮助开发者快速搭建高效的AI辅助开发工作流。
来源:OrangeBot.AI
7 月 9 日榜首。Auriko 将不同推理服务商视为交易场所,根据 token 价格、缓存、延迟、可靠性和质量约束为每次请求选择路径。
7 月 9 日榜单第 2 名。Timbal AI 将 Agent、工作流和应用编排放在统一平台中,减少团队拼接多个基础设施组件的成本。
7 月 9 日榜单第 3 名。Perfai Security 面向快速生成的应用提供在线漏洞检测与修复建议,把安全检查前移到开发过程。
7月10日的公开AI模型定价栈揭示了前所未有的价格离散和选择复杂度:
从Fable 5的$50到DeepSeek的$0.87,相差57倍。值得注意的是Grok 4.5声称4.2倍token效率优势:在SWE-bench Pro上平均使用15,954个输出token,而Opus 4.8使用67,020个——即使按$6定价,单任务输出成本仅约$0.096,而Opus 4.8约$1.675,差距达17倍。
登录后即可参与评论。
加载评论中…