AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Grok 4.5 首日54%幻觉率、Meta下场造付费模型、Ollama近900万开发者:AI发布最密集的48小时

1 周前 · 2026-07-10

Meta AI

今日头条

7月9日成为AI行业历史上模型和产品发布最密集的一天。SpaceXAI在同一天公开发布Grok 4.5;Meta结束观望,推出首个封闭付费模型Muse Spark 1.1;OpenAI将GPT-5.6公开发布并合并Codex到ChatGPT超级应用,同时推出ChatGPT Work挑战Claude Cowork;Anthropic以Claude Cowork移动端和Web端同步上线作为直接回应。

7月10日,独立基准测试结果开始浮现,拼出了更完整的竞争图景。

News

Grok 4.5首日独立评测:最佳Agent工具调用,但幻觉率54%

Artificial Analysis 在24小时独立测试后给出定论:Grok 4.5在Intelligence Index排名第四(54分),落后于Claude Fable 5、GPT-5.5和Claude Opus 4.8。但它在Coding Agent Index中取得了所有模型中最好的Agent工具调用成绩,成为需要连续工具调用和动作执行的工作流的最佳选择。

最令人担忧的数据:Grok 4.5的幻觉率从Grok 4.3的25%飙升至54%。模型的知识准确率确实从35%提升到52%,但犯错时的自信程度也翻了一倍——这是一个已知的大规模推理模型模式。

Snorkel AI在约2000个GDPval+专业工作任务上的独立评估提供了另一个视角:Grok 4.5以29%的平均通过率领先GPT-5.5(22%)和Opus 4.8(21%),在法律(40% vs 27-28%)、教育(58% vs 35-42%)、医疗(35% vs 23-25%)等需要深度专业判断的领域优势尤为明显。

来源:Build Fast with AI、Snorkel AI、TechCrunch

Meta推出Muse Spark 1.1:首个封闭付费模型,正式加入Agent编码战场

Meta于7月9日发布Muse Spark 1.1,这是一款面向Agent任务的多模态推理模型,在工具使用、计算机操控、编码和多模态理解方面有显著提升。值得注意的是:这是Meta首个闭源、托管、按token计费($1.25/$4.25每百万token)的模型,通过Meta Model API向美国开发者开放。

此前Meta主要通过开放权重发布模型,这一转变标志着Meta Superintelligence Labs在Alexandr Wang领导下的商业化策略调整。100万token上下文窗口、免费Thinking模式在Meta AI应用中可用,但开发者API是付费的——Meta正式从"开源旗手"变成"模型军火商"。

来源:TechCrunch、Meta AI Blog

Ollama获6500万美元B轮融资,月活开发者近900万

开源模型运行平台Ollama于7月9日宣布完成6500万美元Series B融资,由Theory Ventures领投,Benchmark、8VC、Y Combinator等参与,累计融资额达8800万美元。公司披露月活开发者890万、进入85%的Fortune 500企业、每周新增近百万安装量——而团队仅14人。

Ollama代表的价值主张正在被验证:在Claude Fable 5收费$50/百万token、GPT-5.6 Sol收费$30的定价环境中,一行命令本地运行开源模型的"开发者入口"角色变得越来越关键。公司创始人表示,转折点出现在2026年1月OpenClaw开始流行的时候——大型开源模型突然能执行Agent编码任务,Ollama的使用量开始加速增长。

来源:TechCrunch、The Next Web

Mercor寻求200亿美元估值,同时宣布收购Deeptune

AI训练数据公司Mercor正在洽谈以约200亿美元估值进行新一轮融资,较2025年10月100亿美元估值翻倍。与此同时,Mercor宣布收购Deeptune——一家为企业软件环境提供AI Agent训练仿真环境的创业公司(a16z此前领投其4300万美元A轮)。

Deeptune的技术让AI Agent在Salesforce、电子表格等真实企业软件环境中练习——不是回答问题,而是完成工作流程。这标志着AI数据产业正在从"雇人写评测"向"搭建可反复练习的真实工作环境"升级。Fortune披露了一个有趣的细节:Mercor创始人Brendan Foody此前悄悄以个人身份投资了Deeptune,几个月后又通过Mercor将其收购。Mercor此前还收购了Sepal AI(2026年2月),正在系统性地整合AI训练工具链。

来源:TechCrunch、Fortune

Google要求广告主披露AI生成内容

Google于7月9日宣布,在Search、YouTube、Discover的My Ad Center中加入"How this ad was made"面板,展示广告是否由AI创建或编辑。使用Google自家生成式广告工具创建的广告会自动添加披露;使用外部工具的广告主可通过手动标注控件披露。部分地区会根据本地法规在广告表面直接显示标签。

这一举措发生在欧盟AI法案第50条透明度义务8月2日生效前三周,届时违规罚款可达1500万欧元或全球年营收的3%。从政治广告扩展到商业广告的AI内容透明度机制,正成为AI治理中少有的跨大西洋共识。

来源:The AI Insider、Digital Applied

OpenAI合并Codex与ChatGPT为超级应用,推出ChatGPT Work

OpenAI在7月9日GPT-5.6发布的同时,推出ChatGPT Work——一个Agent生产力工具,整合Codex技术和15+第三方集成(Google Drive、Slack、Salesforce、GitHub等),可通过@提及调用。独立Codex桌面应用和Atlas浏览器被合并进统一的ChatGPT桌面应用。OpenAI应用CEO Fidji Simo将其描述为"从聊天界面到完整计算环境"的转变。

来源:The New Stack

Anthropic同日在移动端和Web端推出Claude Cowork

Anthropic选择在7月9日同一天将Claude Cowork扩展到移动端(iOS和Android)和Web端,用户可以在手机上委托知识工作任务、远程监控长时间运行的Agent会话、跨设备继续工作。此前Agent会话需要桌面端保持活跃。The Decoder将其描述为先发制人之举——Anthropic知道ChatGPT Work即将发布。

来源:The Verge

伊利诺伊州签署全美首部要求第三方审计前沿AI模型的法律

伊利诺伊州州长JB Pritzker于7月6日签署了《人工智能安全措施法案》(SB 315),成为全美首部要求对大型前沿AI模型进行第三方安全审计的州级法律。该法案被透明度联盟称为"全美最具保护性的AI法规",要求AI开发者在使用大型模型前进行安全评估,并建立问责机制。在联邦层面AI立法停滞的背景下,伊利诺伊州成为新的监管前沿。

来源:Transparency Coalition、Capitol News Illinois

Grok 4.5未进入欧盟市场

xAI以监管合规审查为由,未在7月8-9日在欧盟发布Grok 4.5,目标推迟至7月中旬。背景是欧盟AI法案高风险执行截止日期8月2日临近。Grok 4.5的网络安全能力评级为高风险,可能需要完成GDPR合规工程和AI法案合规文件后才能合法在欧盟提供。这使欧洲开发者暂时无法使用该模型。

来源:SecurityOnline

Fundings

Ollama — 6500万美元B轮

开源模型运行平台,月活开发者890万、进入85% Fortune 500。Theory Ventures领投,Benchmark、8VC、YC参投,累计融资8800万美元。团队仅14人。

来源:TechCrunch

Mercor — 估值200亿美元融资谈判

AI训练数据平台,同时宣布收购Deeptune。ARR超过20亿美元(公司自披露),正洽谈以200亿美元估值融资,较9个月前翻倍。

来源:TechCrunch

Kling AI(快手旗下)— 28亿美元融资

快手旗下AI视频生成平台Kling AI完成约28亿美元融资,阿里巴巴和腾讯参投,投前估值约150亿美元。快手设定目标在12个月内推动Kling AI在港交所上市。这是中国AI视频赛道迄今最大单笔融资。

来源:Reuters、Bloomberg

GitHub Trending

以下项目在7月10日GitHub Trending中表现突出:

DesktopCommanderMCP

wonderwhy-er/DesktopCommanderMCP — 为Claude提供终端控制、文件系统搜索和差异文件编辑能力的MCP服务器。支持长时间运行命令执行和进程管理,是当日GitHub Trending第一名。

Agent Skills

addyosmani/agent-skills — Google Chrome工程总监Addy Osmani整理的AI Agent技能集合,涵盖编码、调试和自动化工作流的可复用技能模式。

Claude Code Templates

davila7/claude-code-templates — Claude Code的模板和配置集合,帮助开发者快速搭建高效的AI辅助开发工作流。

来源:OrangeBot.AI

Product Hunt

Auriko — 为 LLM 调用做成本套利与智能路由

7 月 9 日榜首。Auriko 将不同推理服务商视为交易场所,根据 token 价格、缓存、延迟、可靠性和质量约束为每次请求选择路径。

Timbal AI — 在一套技术栈中构建 Agent 与工作流

7 月 9 日榜单第 2 名。Timbal AI 将 Agent、工作流和应用编排放在统一平台中,减少团队拼接多个基础设施组件的成本。

Perfai Security — 用一次提示发现并修复 Vibe Coding 应用漏洞

7 月 9 日榜单第 3 名。Perfai Security 面向快速生成的应用提供在线漏洞检测与修复建议,把安全检查前移到开发过程。

来源:Product Hunt 7 月 9 日榜单、Auriko 产品介绍

Statistics

7月10日的公开AI模型定价栈揭示了前所未有的价格离散和选择复杂度:

  • 最高端:Claude Fable 5 $50/百万输出token(需credits)
  • 高端:GPT-5.6 Sol $30、Claude Opus 4.8 $25
  • 中端:GPT-5.6 Terra $15、Claude Sonnet 5 $10(8月31日后$15)
  • 性价比:Grok 4.5 $6、GPT-5.6 Luna $6
  • 开源/开放:GLM-5.2 $4.40(MIT许可)、DeepSeek V4-Pro $0.87(永久降价75%)

从Fable 5的$50到DeepSeek的$0.87,相差57倍。值得注意的是Grok 4.5声称4.2倍token效率优势:在SWE-bench Pro上平均使用15,954个输出token,而Opus 4.8使用67,020个——即使按$6定价,单任务输出成本仅约$0.096,而Opus 4.8约$1.675,差距达17倍。

来源:Build Fast with AI

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • OpenAI 办公楼外观GPT-5.6 三兄弟今日全面解禁:OpenAI 拿到政府绿灯,前沿模型进入全民时代Daily · 7月9日
  • Sysdig JADEPUFFER 自主勒索攻击研究配图JADEPUFFER 确认首例全自主 AI 勒索攻击:600+ 载荷、零人工干预,xAI 正式更名 SpaceXAIDaily · 7月8日
  • Washington Post 报道 Anthropic 与中国 AI 公司之间的秘密 AI 战争配图联合国首次 AI 治理全球对话在日内瓦开幕,Bengio 警告「科学无法保证 AI 不会造成灾难性伤害」Daily · 7月7日
  • MIT Technology Review 的 Claude Science 文章配图Claude Science 走到台前,AI 公司开始争夺科研与算力入口Daily · 7月6日
  • OpenAI Codex 官方发布页截图,展示 What should we code next 的任务面板OpenAI 发布 Codex-Claude Code 互通插件,两大编程智能体首次打通Daily · 7月5日
  • Microsoft Redmond Campus Building 92,前景可见 Microsoft 标识微软斥资 25 亿美元成立 Frontier Company,6000 名 AI 工程师嵌入客户组织Daily · 7月4日
  • 阿里巴巴与 Claude 相关报道配图阿里禁止员工使用 Claude Code,指控后门风险;快手可灵 AI 完成 28 亿美元融资Daily · 7月3日
  • Claude 应用与 Anthropic 模型发布相关画面Claude Sonnet 5 把 Agent 能力推向默认模型,价格竞争进入主战场Daily · 7月2日
  • 阿里巴巴开源的 page-agent——用自然语言操控网页界面的 JavaScript GUI Agent企业 AI 支出从「tokenmaxxing」转向效率:OpenAI 与 Anthropic 面临增长拐点Daily · 7月1日
  • OpenAI CEO Sam Altman 出席公开活动,GPT-5.6 发布节奏受到政府审查影响美国政府对前沿 AI 模型发布实施逐客户审批:GPT-5.6 分批放行,Mythos 5 有限恢复,Fable 5 仍被禁Daily · 6月30日
  • California 州长 Gavin Newsom 在国会听证会前接受媒体采访California 半价引入 Claude,AI 从企业工具进入公共服务采购Daily · 6月29日
  • 网络安全与 AI 攻防场景插图GLM-5.2 对标 Mythos,安全模型竞争从出口管制转向能力扩散Daily · 6月28日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS