到 2025 年年底,PubMed Central 收录的开放获取生物医学论文里,每 10 篇约有 9 篇带有大语言模型(LLM)辅助写作或编辑的痕迹。这个数字出自 8 月 11 日上线 arXiv 的一篇论文——它没有调用任何 AI 检测器,而是统计了约 119 万篇论文中一批"风格词"的词频变化,再用线性外推估算出来的。
一个不靠检测器的估算方法
检测 LLM 写作的常用办法有两类,各有已知缺陷。一类是检测器:用人工标注的"人写 / 机器写"语料训练分类器,但大量测试表明它们对学术文本的准确率并不可靠。另一类是混合模型:先用某个提示词让 LLM 生成参照文本、测其词频,再反推语料中 LLM 文本的占比——结果严重依赖所用的提示词和模型,同一批计算机科学摘要能得出 35% 和 18% 两个相差近一倍的估计。
这项研究走的是第三条路,作者称之为"无假设"(assumption-free)的估计。它不需要标注语料,也不需要选定参照模型,只依赖一个观察:ChatGPT 之后,一批"内容无关"的风格词在学术语料里的出现频率发生了跳变。这些词是任何研究语境都能用的功能词——例如 these、potential,以及 ChatGPT 最偏爱的 delve——本身不携带科学信息,因此其频率上升很难用学科趋势解释,只能归因于 LLM 写作。
这批"超额词"(excess words)来自作者团队 2025 年发表在 Science Advances 的工作:扫描 1500 万条 PubMed 摘要,识别出 379 个在 2024 年使用量显著上升的风格词,并估计至少 13.5% 的 2024 年摘要经过 LLM 处理,部分子领域高达 40%。新论文把这套方法从摘要扩展到全文,并改进了估计本身。
具体做法是:对每个标记词,计算它在时间点 t 的"出现率" q(t)——即含有该词的文档占比;再用 2018–2022 年(ChatGPT 发布前)的数据拟合线性回归,外推到 2023–2025 年,得到"假如没有 LLM,人类写作本会是什么频率"的反事实基线 p_human(t)。
两者的差 q − p_human 只是 LLM 使用的下界:被 LLM 改写的文本越多,这些词被"超额"使用的越多,但一个词在人类论文里本来也可能出现。作者把这层逻辑推进一步——由于 LLM 文本里某词的频率最高不可能超过 1,那么"含 LLM 痕迹的论文比例"β 必须满足 β ≥ (q − p_human)/(1 − p_human),这比单纯看词频差距给出更紧的下界。以 these 为例:2025 年 12 月的摘要中 50% 含有该词,外推的人类基线是 33%,17 个百分点的超额经上式换算后,至少对应 25% 的论文用过 LLM。
把多个标记词组合、优化选词阈值、剔除标准误过大的估计,就得到整篇论文层面的估算值。作者用模拟数据验证了这套流程:在已知真实 β 的情况下,误差不超过 0.02。
89% 是什么,不是什么
先给数字划定边界。89% 是"整篇论文"口径——把 Introduction、Methods、Results、Discussion 四部分拼在一起——在 2025 年 12 月的估算;2025 全年为 77%,摘要口径为 68%。这一数字自 2023 年初持续单调上升,不是某个月的噪声。
更关键的是口径。这个方法测的是"论文中 LLM 关联风格词的过量使用",作者把它解读为"到 2025 年底,每 10 篇论文有 9 篇显示出 LLM 辅助写作或编辑的痕迹"。它不等于"89% 的论文由 LLM 撰写":一篇只用 LLM 润色了若干句子、或做了翻译的论文,同样会被计入。方法无法区分"辅助"与"代写",无法判断具体用了哪个模型,更无法在单篇层面判定学术不端——超额词是人群层面的信号,落到任何一篇具体论文上都可能是误报。
从构造上看,89% 本身是一个"下界",而非中性点估计。作者之所以把它当作估计值,理由有二:模拟验证表明流程能近乎还原真实值;在优化选词时,最优解通常落在 p_LLM 接近 1 的位置,即下界所用的近似恰好成立。但这一切依赖一个无法验证的核心假设——人类写作的词频会沿 2022 年之前的线性趋势继续走,而这个假设越往后越不可靠。
Discussion 是 Methods 的两倍:LLM 用在了哪
论文最有信息量的发现不在总量,而在分布。为排除"段落越长越容易被检测到"的干扰,作者把各章节截成同样长度(255 词的随机片段)再比较:到 2025 年 12 月,Discussion 段落的估算使用率为 68%,Methods 只有 32%——每写一个段落,作者在讨论部分用 LLM 的可能性约是方法部分的两倍。Introduction 为 59%,Results 为 46%。
但"Methods 用得少"不等于"Methods 没用"。看整段(不截断)的估算,Methods 仍达 54%,超过一半的论文在方法部分也有 LLM 痕迹;其整段估算(54%)与逐段估算(32%)的落差在各章节中最大,说明方法部分里 LLM 的使用更稀疏、更不均衡。
这个失衡的含义是:研究者最倾向于把 LLM 用于解释和修辞(Discussion、Introduction),最少用于描述方法和数据。受 LLM 影响最深的是论文里负责说理、定调的部分,而不是最接近实验事实的部分——这比"九成论文被 LLM 碰过"更值得学术界警觉。
国家层面的差异进一步印证了"语言工具"的解读。按第一作者所属机构的国家统计,2025 年使用率最高的是韩国(85%)、中国(82%)、台湾(80%),最低的是英国(28%);英语母语国家整体与非母语国家是 37% 对 72%。另一个细节:2022 年前,非母语国家论文中这些超额词的出现率远低于母语国家,到 2025 年两者几乎拉平,作者把这解读为 LLM 驱动的"语言趋同"。
对政策意味着什么
这套方法的价值在于监测而非裁决。它能给出随时间、领域、国家变化的流行率曲线,为出版商和资助机构判断"LLM 在多大程度上改写了学术写作"提供此前缺失的量化基线,论文作者也把它定位为支撑指南与政策的工具。
但它无法回答政策制定者最想回答的问题:一篇具体的论文是否作弊。超额词是统计信号而非证据,方法不能区分合规的辅助(润色、翻译,许多出版机构已允许在披露的前提下使用)与违规的代写或造假,因此不能直接用于单篇论文的学术诚信判定。强行用它对个体"定罪",会把下界、误报和人群信号三者混为一谈。
论文同时把利弊两面摆了出来。有利的一面是语言壁垒:非母语作者借此获得接近母语水平的表达,作者视其为促进科研公平的工具。风险的一面是:幻觉引用、造假论文更易批量生产,语言与推理的同质化,以及"把写作外包给 LLM、只做被动校对"可能导致反思变少、论证变草率。作者援引的 Wiley 调查显示,2025 年年中已有超过 70% 的受访研究者用 LLM 做写作辅助——与该论文的估计大致吻合,也暗示自我报告的调查可能存在低报。
边界:一个下界和一个未验证的假设
先说明发表状态:这是一篇未经过同行评审的 arXiv 预印本,其方法基础——超额词——出自作者团队 2025 年发表在 Science Advances 的论文,但本论文的结论本身尚未经过审稿。
其次,整篇估算建立在"人类词频会沿 2022 年前趋势外推"的假设上。作者承认这一假设存在两个方向相反的偏置:人们可能下意识模仿 LLM 的用词(导致高估),也可能有意避开这些"机器味"的标记词(导致低估,此前已有研究记录这种"人机协同演化")。作者认为这两种效应比直接的 LLM 编辑更小、更慢,但这一点未被独立证实。
最后是样本边界:数据是 PubMed Central 的开放获取子集,限定为生物医学与生命科学、且具备标准四段结构的英文论文,样本内占比最高的期刊是 Scientific Reports(8.1%)、Nature Communications(4.7%)和 PLoS ONE(3.9%)。它不代表付费墙后的期刊,也不代表其他学科;方法还依赖英语这一前提,对非英语学术写作无法测量。
这篇论文改变的不是"AI 已在学术写作中普及"这个事实,而是给它装上了一个可重复的测量装置。它留下的未决变量很具体:同行评审和独立复现能否守住这个 89%;出版商会不会把词频监测纳入学术诚信工具。只有后一件事发生,89% 才会从一篇预印本的估计,变成一个可以逐年追踪的基线。