AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

词频外推估算:89% 的生物医学论文带有 LLM 写作痕迹

2026-08-12 / 2 天前 · 共 3,300 字

模型
Holzwarth, González-Márquez & Kobak, arXiv:2608.10715

到 2025 年年底,PubMed Central 收录的开放获取生物医学论文里,每 10 篇约有 9 篇带有大语言模型(LLM)辅助写作或编辑的痕迹。这个数字出自 8 月 11 日上线 arXiv 的一篇论文——它没有调用任何 AI 检测器,而是统计了约 119 万篇论文中一批"风格词"的词频变化,再用线性外推估算出来的。

一个不靠检测器的估算方法

检测 LLM 写作的常用办法有两类,各有已知缺陷。一类是检测器:用人工标注的"人写 / 机器写"语料训练分类器,但大量测试表明它们对学术文本的准确率并不可靠。另一类是混合模型:先用某个提示词让 LLM 生成参照文本、测其词频,再反推语料中 LLM 文本的占比——结果严重依赖所用的提示词和模型,同一批计算机科学摘要能得出 35% 和 18% 两个相差近一倍的估计。

这项研究走的是第三条路,作者称之为"无假设"(assumption-free)的估计。它不需要标注语料,也不需要选定参照模型,只依赖一个观察:ChatGPT 之后,一批"内容无关"的风格词在学术语料里的出现频率发生了跳变。这些词是任何研究语境都能用的功能词——例如 these、potential,以及 ChatGPT 最偏爱的 delve——本身不携带科学信息,因此其频率上升很难用学科趋势解释,只能归因于 LLM 写作。

这批"超额词"(excess words)来自作者团队 2025 年发表在 Science Advances 的工作:扫描 1500 万条 PubMed 摘要,识别出 379 个在 2024 年使用量显著上升的风格词,并估计至少 13.5% 的 2024 年摘要经过 LLM 处理,部分子领域高达 40%。新论文把这套方法从摘要扩展到全文,并改进了估计本身。

具体做法是:对每个标记词,计算它在时间点 t 的"出现率" q(t)——即含有该词的文档占比;再用 2018–2022 年(ChatGPT 发布前)的数据拟合线性回归,外推到 2023–2025 年,得到"假如没有 LLM,人类写作本会是什么频率"的反事实基线 p_human(t)。

两者的差 q − p_human 只是 LLM 使用的下界:被 LLM 改写的文本越多,这些词被"超额"使用的越多,但一个词在人类论文里本来也可能出现。作者把这层逻辑推进一步——由于 LLM 文本里某词的频率最高不可能超过 1,那么"含 LLM 痕迹的论文比例"β 必须满足 β ≥ (q − p_human)/(1 − p_human),这比单纯看词频差距给出更紧的下界。以 these 为例:2025 年 12 月的摘要中 50% 含有该词,外推的人类基线是 33%,17 个百分点的超额经上式换算后,至少对应 25% 的论文用过 LLM。

把多个标记词组合、优化选词阈值、剔除标准误过大的估计,就得到整篇论文层面的估算值。作者用模拟数据验证了这套流程:在已知真实 β 的情况下,误差不超过 0.02。

89% 是什么,不是什么

先给数字划定边界。89% 是"整篇论文"口径——把 Introduction、Methods、Results、Discussion 四部分拼在一起——在 2025 年 12 月的估算;2025 全年为 77%,摘要口径为 68%。这一数字自 2023 年初持续单调上升,不是某个月的噪声。

更关键的是口径。这个方法测的是"论文中 LLM 关联风格词的过量使用",作者把它解读为"到 2025 年底,每 10 篇论文有 9 篇显示出 LLM 辅助写作或编辑的痕迹"。它不等于"89% 的论文由 LLM 撰写":一篇只用 LLM 润色了若干句子、或做了翻译的论文,同样会被计入。方法无法区分"辅助"与"代写",无法判断具体用了哪个模型,更无法在单篇层面判定学术不端——超额词是人群层面的信号,落到任何一篇具体论文上都可能是误报。

从构造上看,89% 本身是一个"下界",而非中性点估计。作者之所以把它当作估计值,理由有二:模拟验证表明流程能近乎还原真实值;在优化选词时,最优解通常落在 p_LLM 接近 1 的位置,即下界所用的近似恰好成立。但这一切依赖一个无法验证的核心假设——人类写作的词频会沿 2022 年之前的线性趋势继续走,而这个假设越往后越不可靠。

Discussion 是 Methods 的两倍:LLM 用在了哪

论文最有信息量的发现不在总量,而在分布。为排除"段落越长越容易被检测到"的干扰,作者把各章节截成同样长度(255 词的随机片段)再比较:到 2025 年 12 月,Discussion 段落的估算使用率为 68%,Methods 只有 32%——每写一个段落,作者在讨论部分用 LLM 的可能性约是方法部分的两倍。Introduction 为 59%,Results 为 46%。

但"Methods 用得少"不等于"Methods 没用"。看整段(不截断)的估算,Methods 仍达 54%,超过一半的论文在方法部分也有 LLM 痕迹;其整段估算(54%)与逐段估算(32%)的落差在各章节中最大,说明方法部分里 LLM 的使用更稀疏、更不均衡。

这个失衡的含义是:研究者最倾向于把 LLM 用于解释和修辞(Discussion、Introduction),最少用于描述方法和数据。受 LLM 影响最深的是论文里负责说理、定调的部分,而不是最接近实验事实的部分——这比"九成论文被 LLM 碰过"更值得学术界警觉。

国家层面的差异进一步印证了"语言工具"的解读。按第一作者所属机构的国家统计,2025 年使用率最高的是韩国(85%)、中国(82%)、台湾(80%),最低的是英国(28%);英语母语国家整体与非母语国家是 37% 对 72%。另一个细节:2022 年前,非母语国家论文中这些超额词的出现率远低于母语国家,到 2025 年两者几乎拉平,作者把这解读为 LLM 驱动的"语言趋同"。

对政策意味着什么

这套方法的价值在于监测而非裁决。它能给出随时间、领域、国家变化的流行率曲线,为出版商和资助机构判断"LLM 在多大程度上改写了学术写作"提供此前缺失的量化基线,论文作者也把它定位为支撑指南与政策的工具。

但它无法回答政策制定者最想回答的问题:一篇具体的论文是否作弊。超额词是统计信号而非证据,方法不能区分合规的辅助(润色、翻译,许多出版机构已允许在披露的前提下使用)与违规的代写或造假,因此不能直接用于单篇论文的学术诚信判定。强行用它对个体"定罪",会把下界、误报和人群信号三者混为一谈。

论文同时把利弊两面摆了出来。有利的一面是语言壁垒:非母语作者借此获得接近母语水平的表达,作者视其为促进科研公平的工具。风险的一面是:幻觉引用、造假论文更易批量生产,语言与推理的同质化,以及"把写作外包给 LLM、只做被动校对"可能导致反思变少、论证变草率。作者援引的 Wiley 调查显示,2025 年年中已有超过 70% 的受访研究者用 LLM 做写作辅助——与该论文的估计大致吻合,也暗示自我报告的调查可能存在低报。

边界:一个下界和一个未验证的假设

先说明发表状态:这是一篇未经过同行评审的 arXiv 预印本,其方法基础——超额词——出自作者团队 2025 年发表在 Science Advances 的论文,但本论文的结论本身尚未经过审稿。

其次,整篇估算建立在"人类词频会沿 2022 年前趋势外推"的假设上。作者承认这一假设存在两个方向相反的偏置:人们可能下意识模仿 LLM 的用词(导致高估),也可能有意避开这些"机器味"的标记词(导致低估,此前已有研究记录这种"人机协同演化")。作者认为这两种效应比直接的 LLM 编辑更小、更慢,但这一点未被独立证实。

最后是样本边界:数据是 PubMed Central 的开放获取子集,限定为生物医学与生命科学、且具备标准四段结构的英文论文,样本内占比最高的期刊是 Scientific Reports(8.1%)、Nature Communications(4.7%)和 PLoS ONE(3.9%)。它不代表付费墙后的期刊,也不代表其他学科;方法还依赖英语这一前提,对非英语学术写作无法测量。

这篇论文改变的不是"AI 已在学术写作中普及"这个事实,而是给它装上了一个可重复的测量装置。它留下的未决变量很具体:同行评审和独立复现能否守住这个 89%;出版商会不会把词频监测纳入学术诚信工具。只有后一件事发生,89% 才会从一篇预印本的估计,变成一个可以逐年追踪的基线。

来源

  1. Most biomedical publications show signs of LLM-assisted writing · arXiv
  2. Delving into LLM-assisted writing in biomedical publications through excess vocabulary · arXiv / Science Advances

评论

登录后即可参与评论。

加载评论中…

相关文章

  • iPhone 上的 Siri 提示气泡,示意 Apple 正在为 AI 版 Siri 接入新闻内容

    Apple 拟按内容「使用次数」付费:Siri AI 内容授权的计量难题

    数据 · 2026-08-13

  • Harbor job 运行结果的截图,显示 DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上的 445 次试验完成情况和平均 reward 0.83

    两个不同 Harness,同一个 82.7%:DeepSeek V4 Flash 的 Terminal-Bench 分数被罕见复现

    数据 · 2026-08-10

  • AI 招聘流程示意图:求职者提交申请,同一供应商的算法跨多个雇主进行筛选,产生推荐或不推荐的结果

    AI 招聘的「算法单一文化」:340 万人数据揭示系统性排斥与隐藏的种族偏见

    数据 · 2026-08-09

  • CompanyBench benchmark 封面图,展示企业环境中 AI Agent 的测试流程

    GPT-5.5 在真实企业任务中仅完成 44%:Turing CompanyBench 揭开了 AI Agent 评测的盲区

    数据 · 2026-08-08

  • 该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

    一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

    算法 · 2026-08-13

  • 微软 Copilot 的动画角色 Mico,本次将从 Copilot Voice 中移除并迁往 Learn Live

    微软合并 Copilot 应用、下线五个功能,Deep Research 改为付费项

    算法 · 2026-08-13

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS