AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

厂商 AI 使用报告漏掉近一半真实对话,独立测量挑战「工作用途」叙事

今天 · 共 2,492 字

Stephanie Arnett/MIT Technology Review | Adobe Stock

AI 行业最常被引用的一张「人们如何使用 AI」的地图,可能系统性漏掉了一半的真实使用。8 月 18 日,MIT Technology Review 报道了一项由 MIT 媒体实验室、斯坦福可信 AI 研究实验室等机构研究者联合推动的研究项目 AI Observatory:研究者把 Anthropic 经济指数(Economic Index)用来筛选「职业相关对话」的过滤器,重放到他们汇总的 7 个真实对话数据集上,发现 47.9% 的对话会被当作「非职业」内容剔除——而被剔除的这部分,恰恰富集了健康与亲密关系、骚扰与仇恨、性内容等私人化与安全相关的使用。

厂商的「职业视角」是一个过滤器,不是一面镜子

Anthropic Economic Index 是最广为人知、被引用最多的 AI 使用数据来源。它的工作方式,是先筛出与职业/生产力相关的 Claude.ai 对话,再用 Clio 工具把对话映射到职业任务簇。OpenAI 的 ChatGPT 使用报告同理,论文转述其结论是把近八成使用归入「实践指导、寻求信息、写作」三类,而关系与情感类使用占比不足 2%。

问题不在于这套分类「错」,而在于它的预处理步骤不是中性的。AI Observatory 团队重实现了 Anthropic 已公开的 system prompt 与分类法,把同一个职业过滤器套用到可处理的六个来源上(第七个来源 NIO 因数据协议受限无法重放),得到一个可量化的结果:这些真实对话里,47.9% 被归为「非职业」,比例从 AI Archive 的 34.2% 到 LMSYS 的 61.9% 不等。换言之,在计算任何「使用分布」之前,近一半的数据先被扔掉了。

被扔掉的那一半是什么

研究用 FDR 显著性检验,找出被过滤器剔除的对话里哪些特征被显著富集。下列数字为「被剔除 vs 保留」的对话级出现率:

  • 健康与亲密关系:44.2% vs 31.2%
  • 骚扰与仇恨:27.5% vs 5.6%
  • 性内容:15.7% vs 2.4%
  • 成人或非法主题:7.9% vs 2.1%

这不是随机残留。职业过滤器给劳动力市场面向的使用一个清晰的截面,同时把一组具有私人、社会、文化与安全后果的交互系统性地放到视野之外。论文的结论很直接:真实使用的测量应被当作「代表性范围」问题,而不只是「规模」问题。

使用因模型、版本和时间而高度分化

「AI 主要用于工作」不仅是过滤器的产物,还掩盖了使用的高度异质性。研究在 7 个来源里观察到稳定的分化:

  • 按模型看,Grok 与 Gemini 的信息检索占比明显更高(Grok 67.1%、NIO-Gemini 55.0%,而 WildChat 仅 26.2%);Grok 尤其集中在新闻与政治(38.5%)、商业与社会(64.5%)话题,同时也是错误信息最集中的来源(15.3%,其余来源 4.2%–10.2%)。MIT Technology Review 的概括是:人们更常找 Anthropic 写代码、找 Gemini 做社交与角色扮演、找 ChatGPT 做作业、找 Grok 聊新闻。
  • 按模型版本看,同一开发商的模型支撑完全不同的使用模式:GPT-3.5 时代是短促、模板式的问答,GPT-4o 变成更长、更迭代的陪伴式交流,o1 一类推理模型则转向长的一次性技术求解。在 Chatbot Arena 里,Gemini 与 Grok 的回答比均值长 81.0% 和 78.0%,Claude 则短 59.8%。
  • 按时间看,WildChat 从 2023 年 4 月到 2025 年 7 月,平均提示词 token 数上涨 1049.5%、回答 token 数上涨 100.6%、每段对话的轮次数上涨 17.1%;寒暄式表达上升 21.5 个百分点,而模型的自我披露(承认自己是聊天机器人)下降 12.0 个百分点——对话变长、变亲密,也更少提示「我是 AI」。

这份数据本身也有边界

必须说清楚:AI Observatory 并不声称自己是「全体 AI 用户」的代表样本。它的 7 个来源(WildChat、ShareGPT、AI Archive、Grok、LMSYS-Chat-1M、Chatbot Arena、National Internet Observatory)都是用户自愿贡献或共享的对话,总共约 2.3 万段、8.6 万个对话轮次、约 5000 名用户,时间跨 2023–2025 年。与厂商手里的数据相比是九牛一毛——Anthropic 最新一期经济指数基于 100 万段 Claude 对话,OpenAI 的 ChatGPT 报告分析了 150 万段。

而且,正因为来源是自愿提供的,研究团队在论文里自己提醒:敏感使用很可能被低估,人们更不愿意分享这类对话。标注也非全人工:研究用 GPT-4.1 做自动标注(对人工验证集 F1 中位数 0.856),并采用抽样设计而非全量标注。Anthropic 对 MIT Technology Review 回应称,其已发布研究反映的是自身团队的具体问题与兴趣,同时支持外部独立研究;OpenAI 未回应置评请求。

为什么这关系重大

「人们到底用 AI 做什么」是几乎所有下游判断的前提:怎么设计产品、测哪些能力、优先治理哪些风险、制定什么政策。如果最常被引用的答案是一个职业过滤器过滤后的产物,那么基于它的判断——从 benchmark 该测什么、到安全团队该盯什么、再到监管者该信什么——都可能踩在一个失真的基线上。

论文把这一点讲得很具体:基准设计者应当说明自己的评测想近似真实使用中的哪一部分,而不是默认一个数据集或一类任务就代表整个部署;安全研究者应当预期风险暴露会随来源、模型与时间变化,而不是把任何单一语料的流行率当作普适值。Anthropic 其实早已单独发布过「人们如何用 Claude 寻求支持与陪伴」乃至生成 CSAM 的报告——但如 UT-Austin 助理教授 David Widder 所说,把这些主题拆进单独的报告,与把它们放进同一套全景分析里,是两回事。

AI Observatory 的贡献不在于给出一张「AI 使用的最终地图」,而在于把这种测量变成可累积、可比较、可更新的公共基础设施——平台(ai-observatory.org)与 145 维标注框架都已公开。它回答不了「AI 总体上是好是坏」,但它说明了一个更基础的问题:在厂商叙事之外,此前并没有一个独立、可复现的测量层去回答这个问题。

来源

  1. We still don't know how people are really using AI · MIT Technology Review
  2. The AI Observatory: A Public Measure of Real-World AI Use · Data Provenance Initiative

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Seedance 2.0 生成的 AI 视频截图:汤姆·克鲁斯与布拉德·皮特在屋顶打斗

    MPA 与字节跳动达成首个 AI 版权协议,护栏细节未公开

    数据 · 2026-08-17

  • iPhone 上的 Siri 提示气泡,示意 Apple 正在为 AI 版 Siri 接入新闻内容

    Apple 拟按内容「使用次数」付费:Siri AI 内容授权的计量难题

    数据 · 2026-08-13

  • 一架 Spirit Airlines 空客 A319 客机进近曼彻斯特-波士顿地区机场

    Google 1000 万美元拍下 Spirit 破产数据:1 亿封邮件与 5 亿条聊天将用于训练

    数据 · 2026-08-19

  • Turing 官方文章封面中的蓝色数据波纹

    通过自检,却自信地出错:Terminal-Bench 3.0 揭开 Agent 评测盲区

    数据 · 2026-08-15

  • arXiv:2608.10715 论文图 2:估算的 LLM 使用率月度变化趋势

    词频外推估算:89% 的生物医学论文带有 LLM 写作痕迹

    数据 · 2026-08-12

  • 冷冻电镜重构:一个由基因组语言模型设计出的功能性噬菌体颗粒

    Evo 2 首次生成 16 个可用噬菌体:'从零设计'的真实增量与边界

    算法 · 2026-08-19

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS