2015 年 2 月,斯坦福大学元科学研究者 John Ioannidis 在《美国医学会杂志》(JAMA) 上发表了一篇题为「隐身研究」的评论。他写道,一家估值 90 亿美元的硅谷血液检测公司 Theranos 正在颠覆诊断行业——但这家公司从来没有在任何同行评审期刊上发表过关于其技术的研究。一年后,Theranos 被证实基于欺诈数据。
十一年后,Ioannidis 将同样的方法论转向了 AI 行业。7 月 16 日,他的团队在 bioRxiv 上发布预印本,对 1998 年至 2025 年间存在过的全部 317 家 AI 独角兽进行了文献计量分析。结论比 Theranos 时代更为系统:超过半数(52.4%)的 AI 独角兽从未以第一作者或通讯作者身份发表过任何论文或预印本。2025 年,这些公司合计仅贡献了全球 AI 文献的千分之一。
Science 杂志于 7 月 27 日以深度报道形式披露了这项研究,并在 7 月 29 日更新。在当前 AI 行业每年烧掉数千亿美元、声称将重塑科学本身的背景下,这个数字制造了一个令人不安的验证真空。
数据:发表量极度集中,OpenAI 一家独大
Ioannidis 团队从 CB Insights 和 Crunchbase 等数据库中识别出所有曾达到独角兽估值的 AI 公司,然后检索这些公司以第一或通讯作者身份参与的期刊论文、会议论文、综述和预印本——这些角色通常代表实质性贡献。最终数据集包含 2077 篇合格出版物,其中 1389 篇为同行评审论文,688 篇为预印本。
分布的集中度远超直觉:
- 前 10% 的公司占据了 96.8% 的引用,前 5% 的公司占据了超过 90%;
- OpenAI 一家就贡献了数据集中近 40% 的引用,其次是中国计算机视觉公司旷视科技(Megvii)和平台 Hugging Face;
- 134 篇公司归属的高引用论文(≥200 次引用)中,仅 3 家公司就占了 92 篇;
- OpenAI 约有 4500 名员工,但只有 8 名研究人员曾以主要作者身份发表过 5 篇或以上的合格论文。
公司估值与发表生产力或高引用产出之间没有显著关联。融资额与发表量仅存在弱相关。换言之,市场上最值钱的 AI 公司,并不一定是产生最多可核查知识的公司。
为什么 AI 公司不发表:博客化与激励结构
多位受访研究者指出,这不是一个简单的「公司不愿公开」的问题,而是 AI 行业的结构性激励导致了这一结果。
阿肯色大学的 AI 研究者 Nur Ahmed 指出,与制药行业不同——在制药业,发表的发现可以通过专利获得保护——AI 公司公开发表技术进展后往往得不到什么实际利益。Google 2017 年那篇奠定了当代大语言模型架构的 Transformer 论文已成为经典的反面教材:虽然 Google 对相关技术申请了专利,阿尔伯塔大学 AI 伦理学家 Mohamed Abdalla 评论道:「我觉得没人在为此付钱给 Google。」
Hugging Face 的 AI 政策研究员 Avijit Ghosh 将这一现象称为研究的「博客化」(blogification):公司通过博客文章和技术报告发布新模型、代码和数据集,而非经过同行评审的期刊。这种方式更匹配 AI 公司的迭代节奏——学术同行评审可能需要数月甚至数年。Ioannidis 团队的分析并未统计博客、技术报告、代码仓库和模型权重发布。
Abdalla 的表述更为直白:「公司的任务不是推进科学,公司的任务是赚钱。」
博客化能替代同行评审吗?
Ghosh 认为,辩论的核心不应是期刊和博客的二选一,而在于公司是否释放了足够多的代码、数据集或模型权重,以便其他人独立验证和复现其工作。
但权重开放和论文发表之间存在一个关键差异:同行评审不仅验证结果,还迫使研究者交代方法论的局限、失败路径和边界条件——这些信息在精心编辑的博客文章中往往被省略。Ioannidis 在采访中的原话指向了这个核心问题:「对于一个据称正在重塑科学、科学潜力如此先进的领域,没有任何科学文献记录,这看起来是一个非常奇怪的悖论。你怎么判断他们说的是真的、经过验证的、可复现的?」
加州大学伯克利分校的计算机科学家 Emma Pierson 则从另一个角度表达了担忧:无论开放还是封闭,快速推进越来越强大的通用 AI 模型本身就存在风险——可能加速网络攻击等社会危害。在她看来,行业需要的不是更多博客文章,而是更有力的安全评估和外部审查机制。
中美差异:开源策略驱动更高的论文产出
预印本发现,中国 AI 公司的发表量持续高于美国同行。这一差异与中国公司拥抱开源的策略高度相关。Science 报道指出,美国前沿实验室越来越多地对最强模型的技术细节保密或「闭源」,而中国领先公司则选择了开源路径。
最典型的例子是 Moonshot AI(月之暗面)。该公司最近发布了 Kimi K3——拥有 2.8 万亿参数的开放权重模型,性能接近 Anthropic 的前沿模型 Fable,并于 7 月 30 日通过 Hugging Face 公开发布模型权重。Moonshot 由阿里巴巴和腾讯重金支持,已迅速跻身中国生成式 AI 生态系统的第一梯队。
不过,预印本强调中美发表差异需要更多研究来确认因果关系。发表更多不必然意味着研究更透明;论文的质量、完整性和可复现性同样关键。
验证真空的后果
这项研究的结论——AI 独角兽在正式科学传播中的参与度「可以忽略不计」——不应被简化为「AI 公司不写论文」这个标题。更深层的问题是:当最先进 AI 系统的能力和局限性只能通过公司自我报告来了解时,外部研究者、监管者和公众就无法独立评估这些系统。
Ioannidis 从 Theranos 事件中提炼出的核心见解在这里同样适用:「隐身研究制造了完全的模糊性」——在聪明的创意、激进的企业公告和媒体炒作之间,证据实际上不可区分。
当前 AI 政策讨论中的多项关键争议——从训练数据版权到模型安全评估到能耗透明度——都需要以可核查的证据为基础。如果行业最有价值的公司系统性地缺席学术文献体系,这些讨论将继续在信息不完整的条件下进行。
研究本身也有局限:预印本尚未经过同行评审,统计范围不包括博客、技术报告和开源发布,而这些正是当前 AI 行业最活跃的知识传播渠道。但研究的价值恰恰在于它量化了一个此前只有直觉和轶闻的问题——并将一个在生物医学领域已被证明危险的现象,放入了 AI 行业的聚光灯下。