AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

arXiv 独立:从物理学家的小工具到 AI 时代的学术基础设施,25 年后为何必须「单飞」

2026-07-01 / 3 周前 · 共 2,842 字

Unsplash

2026 年 7 月 1 日,arXiv 从康奈尔大学独立,成为一家名为 arXiv, Inc. 的非营利组织。这不只是一次法律实体的转移——它是学术出版史上最重要的基础设施,在 AI 论文洪流推动下完成的一次被迫升级。

arXiv 过去一年里密集推出的一系列 AI 治理政策——从禁止 CS 领域未评审综述论文、到收紧 endorsement 门槛、到对未检查 AI 输出的作者实施一年禁令——与独立决定的时间线高度重叠。独立不是这些政策的背景板,而是同一个问题的另一面:当一篇论文是否由人类撰写本身都变得难以判断时,一个为「人与人信任」而建的平台,必须重构自己的治理能力。

从每月 10 篇到每月 3 万篇

arXiv 的故事起点是 1991 年,物理学家 Paul Ginsparg 在 Los Alamos 国家实验室的工作站上写了一个小脚本,让高能物理学家们可以在论文发表前互相分享预印本。当时每月大约收到 10 篇提交,「设定好就不用管了」,Ginsparg 回忆说。

35 年后,arXiv 每月收到约 27,500 篇新提交,高峰期频繁突破 3 万篇。累计提交量在 2026 年 4 月突破 300 万,到 6 月底已超过 308 万。从第 1 篇到第 100 万篇用了 23 年半,从 200 万到 300 万只用了 4 年。

维持这个规模的代价是近 30 名员工分布在多个国家。Cornell Tech 院长 Greg Morrisett 在接受 Cornell Chronicle 采访时直言:「过去几年我们一直在运行赤字,Cornell Tech 在承担,但我们长期承担不起。」

独立的法律架构——特拉华州非营利公司、IRS 501(c)(3) 免税资格——将赋予 arXiv 更灵活的融资和招聘能力。Morrisett 说:「作为一个独立组织,我们可能比附属于某所大学吸引到更多资金,尤其是当大学自身也面临压力的时候。」

Simons Foundation International 是独立的主要出资方,Schmidt Sciences 提供了额外的 1000 万美元用于完成云端迁移和代码现代化。arXiv 总部将留在 Cornell Tech 的 Tata Innovation Center,现任执行董事 Ramin Zabih 担任临时 CEO,正式的 CEO 遴选已接近完成。董事会最多 12 人,据 FAQ 页面表述,「来自全球科学家和非营利管理者的加入邀请已被广泛接受」。

独立时间线与 AI 治理升级同步

arXiv 的独立决定酝酿已久——官方在 2026 年 4 月首次公开宣布,但内部讨论更早。而独立前后的一年,恰好是 arXiv 对 AI 生成内容出手最密集的时期。

2025 年 10 月 31 日,arXiv 宣布 CS 类别不再接受未经同行评审的综述和立场论文。官方博客写道:「在过去几年中,arXiv 被论文淹没了。生成式 AI / 大语言模型让这种洪流进一步加剧——尤其是那些不引入新研究结果的论文,变得又快又容易写。」CS 类别每月收到数百篇综述文章,大部分被描述为「仅仅是注释过的参考文献列表,没有对开放性研究问题的实质讨论」。

2026 年 1 月 21 日,arXiv 更新全站 endorsement 政策,不再接受仅凭机构邮箱作为新作者的自动凭证。新投稿者现在需要同时满足两个条件:机构邮箱 和 在目标类别领域已有的 arXiv 论文记录。arXiv 解释此举是为了「阻止低质量、非科学提交的洪流」。

2026 年 5 月 16 日,arXiv CS 领域主席 Thomas Dietterich 宣布最严厉的措施:如果一篇提交包含「无可辩驳的证据」表明作者未检查 LLM 生成内容,所有署名作者将被禁止提交一年,此后再次提交必须先经同行评审期刊接收。所谓「无可辩驳的证据」包括:幻觉引用(引用了不存在的论文)、LLM 的元注释(如「这是一份 200 字的摘要,您需要我做任何修改吗?」)、以及编造的数据表(如「此表中的数据为示意,请替换为实际实验数据」)。

Dietterich 告诉 404 Media,这是一条「一次出局」规则。虽然需要版主标记、领域主席确认且作者可上诉,但对依赖 arXiv 的 CS 和 ML 领域而言,一年禁令的代价是巨大的——在这些领域,论文在 arXiv 上发布几乎已成为正式发表前不可或缺的一步。Ars Technica 指出,arXiv 领导层已确认这是组织的官方政策。

AI 对 arXiv 的真正威胁

arXiv 的治理模型自建立以来依赖一个隐含前提:署名作者对自己提交的内容负责。Ginsparg 在接受 Cornell Chronicle 采访时说:「arXiv 方法论依赖的是人与人之间的信任纽带。AI 的最新发展既有巨大前景,也构成了对这一方法论的生存威胁。如果中位 LLM 生成的 CS 论文比中位研究生写的更好,三个月后的世界就很难准备了。」

但问题恰恰在于,目前大多数被标记的 AI 论文远非「更好」,而是粗制滥造到连最低限度的人工检查都没通过——没有试图以假乱真,因为根本没有试图伪装。

问题的规模可从 2026 年 ICLR 的数据窥见:据 PCMag 报道,21% 的 ICLR 同行评审完全由 AI 生成,超过一半显示 AI 使用痕迹。这不仅是 arXiv 的麻烦,而是整个学术出版生态面临的压力,而 arXiv 作为预印本的第一站,首当其冲。

404 Media 指出,掠夺性期刊和「付费即发表」模式在 AI 出现前就存在,但 LLM 将其超级加速。arXiv 不进行同行评审,只审核主题相关性和学术价值——原本「快速、低门槛」的优势,在 AI 时代变成了弱点。

要注意的微妙之处:arXiv 并不禁止 AI 辅助写作。TechCrunch 的报道强调,政策针对的是「未检查的」AI 输出,而非 AI 使用本身。Dietterich 的表态也很清晰——作者应对论文内容承担「全部责任,无论内容是如何生成的」。

独立之后

arXiv 独立带来了组织灵活性,但也引出新问题。它的 endorsement 制度正被批评为「私有化的守门人」:独立研究者必须恳求陌生教授为自己担保,而教授们出于谨慎往往不回复。arXiv 独立公告的评论区中,一位读者写道「比 Nature 还难投稿,因为 endorsement 系统」,另一位评论说「当 AI 让严肃的独立研究变得更可能时,arXiv 却让独立研究者的投稿变得更难」。

独立后的 arXiv 还面临一个根本性悖论:它最大的增长来源——AI 研究——同时也是它最大的内容质量威胁。CS 类别是 arXiv 增长最快的领域,以 AI/ML 论文为绝对主力。这些论文吸引了最多的读者、产生了最多引用,也制造了最多的垃圾。

arXiv 的新领导团队——一旦 CEO 和完整董事会就位——将不得不在开放获取的核心理念与日益紧迫的质量控制之间找到平衡。这条路在 1991 年不需要考虑,因为那时没有技术能让一个人用几条提示词生成一篇看起来像论文的东西。

arXiv 独立所折射的,是一个更大的模式:AI 不仅在产生新的学术内容,也在迫使承载这些内容的基础设施改变自身的治理方式。当一个平台从「科学家的共有物」变成「AI 也必须被管理的对象」,独立的组织架构只是第一步。真正的考验是:一个为 1991 年互联网设计的信任模型,能否被重写来应对 2026 年的内容生产速度。

来源

  1. arXiv's next chapter: Updates on our spin out from Cornell University · arXiv Blog
  2. Digital research repository arXiv to start new chapter as nonprofit · Cornell Chronicle
  3. arXiv is becoming an independent nonprofit organization FAQ · arXiv
  4. Attention Authors: updated endorsement policy · arXiv Blog
  5. Research repository ArXiv will ban authors for a year if they let AI do all the work · TechCrunch
  6. Send the arXiv AI-generated slop, get a yearlong vacation from submissions · Ars Technica
  7. arXiv Changes Rules After Getting Spammed With AI-Generated 'Research' Papers · 404 Media
  8. Major Scientific Repository arXiv Cracks Down on AI-Generated Papers · PCMag

评论

登录后即可参与评论。

加载评论中…

相关文章

  • AI 产品边界正在消失:同一天的三起交易,同一个信号

    数据 · 2026-07-25

  • AMD Helios 机架级 AI 系统发布图,左侧展示服务器机架,右侧标注「Launching AMD Helios」与「In Production Today」。

    Helios:72 颗 GPU 组成一台「AI 工厂」

    数据 · 2026-07-25

  • Intel Foundry 的 18A 制程晶圆近景,表面芯片阵列呈现红、橙、绿、蓝色反光。

    核心数据:全面超预期,但利润表暗藏玄机

    数据 · 2026-07-25

  • 欧盟 DMA 针对 Google Android AI 互操作性和搜索数据共享的约束性裁决主题插图

    Android:从 Gemini 专属到第三方平权

    数据 · 2026-07-23

  • Prior Labs 三位联合创始人在公司标识前合影

    SAP 完成 Prior Labs 收购:€10 亿押注「表格式基础模型」,企业 AI 的下一个战场是电子表格而非聊天

    数据 · 2026-07-22

  • 蒂姆·库克在中国国旗图案前登台演讲

    22 个月后终获批——Apple Intelligence 入华,阿里巴巴通义千问成为核心引擎

    数据 · 2026-07-17

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS