估值670万美元的论文平台,35年来首次独立
arXiv即将离开康奈尔大学。

开篇
订阅者朋友,您在检索论文时是否见过arXiv这个名字?这里是最早接触AI、物理学、数学领域最新研究的地方。从ChatGPT的底层技术到量子计算的最前沿,科学的最前线并非首先出现在学术期刊上,而是先在这个预印本1服务器上公开。
这项服务由物理学家Paul Ginsparg于1991年在洛斯阿拉莫斯国家实验室创立,如今免费公开的论文已超过240万篇,月下载量高达1,000万次。然而,运营这一庞大知识基础设施的员工只有27人,年度运营预算仅为670万美元(约合90亿韩元)。
如今传来消息:arXiv将于今年7月1日脱离庇护自己25年的康奈尔大学,转型为独立的非营利法人。这不是一次简单的组织迁移。这一决定的背后,是AI时代造就的两大结构性压力。
年度670万美元的走钢丝——arXiv为何要离开
arXiv的独立并非仓促之举。这正是创始人Paul Ginsparg本人多年来一直建议的方向。核心原因是钱。arXiv在2024年和2025年连续录得运营赤字。仅2025年的赤字就达29万7千美元(约合4亿韩元)。康奈尔大学虽然填补了这一赤字,并另外提供了81万9千美元(约合11亿韩元)的实物支持,但对大学而言,arXiv始终是一个需要与其他预算需求竞争的项目。
问题的根本原因是爆炸式增长。自2022年以来,投稿论文数量激增了50%以上,预计2026年年投稿量将突破30万篇。据记录,仅2025年9月一个月就收到了2万6千篇投稿。
这一增长有两股驱动力。
第一,AI研究本身的爆发。AI、机器学习领域的论文数量呈指数级增长。 arXiv计算机科学编辑委员会主席Thomas Dietterich(俄勒冈州立大学)将此列为直接的增长原因。
第二,AI制造出的论文——所谓的“AI水货(AI slop)”。由LLM生成的低质量论文正在涌入arXiv。 据编辑委员会主席Ralph Beers(阿姆斯特丹大学)介绍,自2025年初起,AI水货投稿呈指数级增长,拒稿率从原先的4%飙升至10%至12%。发表于Nature Human Behaviour的一项研究报告称,截至2024年9月,计算机科学领域约四分之一的摘要中发现了LLM修改的痕迹。
在康奈尔大学这道围墙之内,这两股压力都难以承受。既无法雇佣足够的软件开发人员,也无法自由募集外部捐赠。Ginsparg本人也承认了这一点——大学这种组织并没有长期维持这类全球性研究基础设施的经验。

AI水货(Slop)——威胁科学速度的科学工具
AI水货问题值得再深入探讨一下。因为这不仅仅是arXiv自身的问题,而是整个学术交流体系的结构性危机。康奈尔大学Ian Yin(音译)研究团队于2025年发表在Science上的研究很好地展示了这一状况。研究分析了主要预印本平台上超过200万篇论文,发现被认为使用了LLM的研究者,其论文发表量增长了33%至50%以上。尤其是非英语母语研究者的增幅高达43%至89%。生产力的确提高了,但陷阱在于——同一时期,区分有意义的研究与批量生产内容的成本也随之飙升。
arXiv对这一问题采取了分阶段应对措施。2025年10月,在计算机科学类别中事实上禁止了综述论文和立场文件2的投稿。2026年1月,将首次投稿者的担保人制度扩大到了全学科——此前只要有机构邮箱,任何人都可以投稿,如今则需要获得该领域现有arXiv作者的担保。
然而这里产生了一个两难困境。arXiv的核心价值是“任何人都能快速分享研究成果的开放性”。提高门槛虽能减少AI水货,但也同时抬高了新兴研究者的准入门槛。AI安全研究者Stephen Casper指出,这项政策可能会对早期职业研究者、缺乏计算资源的研究者,以及伦理、治理领域的研究者造成不成比例的影响。
开放性与质量之间的张力——这也是AI时代所有平台都面临的问题。从维基百科到X(推特),所有任何人都能参与的平台都站在同一个问题面前。
预印本大迁移——不只是arXiv的故事
有趣的是,arXiv的独立并非一个孤立事件。2025年3月,生命科学领域的bioRxiv和医学领域的medRxiv脱离了母体冷泉港实验室,成立了名为openRxiv的独立非营利法人。原因与arXiv几乎相同——在大学/研究所的围墙之内,扩大捐赠和技术现代化都很困难。openRxiv在第一年就接收了超过6万4千篇预印本,运营顺利。
眼下正在发生的,是一种“预印本大迁移”。学术交流的核心基础设施正在脱离大学和研究所的怀抱,重组为独立的非营利法人。这一潮流的背后有着共同的认知:
全球知识基础设施不应是某个机构的附属业务,而应是需要专门组织全权承担的独立使命。
Oswarld视角
读这个故事时,我脑海中一直浮现一个数字对比:670万美元 对 32亿英镑。这是arXiv的年度运营预算670万美元(约合90亿韩元),以及学术出版巨头Elsevier的母公司RELX在2024年录得的营业利润32亿英镑(约合5.8万亿韩元)。Elsevier的营业利润率高达38.4%,这一水平堪比微软或谷歌。
从GTM战略的角度看,这是一个奇特的市场。研究者用公共资金开展研究,其他研究者无偿审稿,大学再花钱订阅以获取访问权限——整个价值链上的核心劳动全部是无偿完成的,而中间平台却拿走了接近40%的利润率。
arXiv是对这一结构最古老的替代方案。它免费公开论文,绕开学术出版缓慢的时钟,提升了研究的速度。然而具有讽刺意味的是,这个替代方案本身却始终饱受资金短缺之苦。我认为,arXiv要想成功实现独立,比起“非营利”这一法律形式,设计可持续的收入模式更为重要。目前依赖270多家机构的会费(每年最高1万美元)以及基金会捐赠的结构,对于应对年30万篇时代的运营成本而言,实在太单薄了。当然,也可以说——神圣的研究竟然被拿来当作资本游戏!但这未免有点像童话故事……哈哈。
在此,我也想坦率地说说一个担忧。科学家们对独立非营利法人所抱有的担心——“最终会不会走向商业化”——并非全无根据。回顾学术出版的历史,非营利平台在资金压力下被营利企业收购的模式屡见不鲜。新任CEO年薪30万美元引发争议,也是在这个背景下产生的。归根结底,核心问题是:在维持知识流通作为公共产品的同时,谁来支付这笔费用?arXiv的独立是对这一问题、35年来的一次实验。在答案揭晓之前,值得我们所有人持续关注。
结语
- arXiv将于7月1日脱离康奈尔大学实现独立,但这不是一次组织迁移,而是“谁来维持全球知识基础设施”这一问题浮出水面。
- AI造成的双重压力——研究爆炸与AI水货——暴露了现有运营模式的极限。
- 预印本服务器的连锁独立,是学术交流治理正从大学转向专门非营利法人这一结构性转变的信号。 留给大家一点思考。我们每天阅读的AI研究,其最先公开的平台,运营经费仅为年90亿韩元——相当于一两笔科技创业公司种子轮投资的水平。关于维持知识传播速度所需的成本,我们是否已经充分思考过了?
参考资料与延伸阅读
- Jeffrey Brainard,“ArXiv, the pioneering preprint server, declares independence from Cornell”,Science,2026年。:今天这期新闻信的核心文章。Ginsparg与Morrisett的访谈是关键内容。
- Keigo Kusumegi, Xinyu Yang, Paul Ginsparg等,“Scientific production in the era of large language models”,Science,第390卷,2025年。:以200万篇规模分析LLM对学术生产力影响的研究。
- Jeffrey Brainard,“ArXiv preprint server clamps down on AI slop”,Science,2026年。:介绍arXiv引入担保人制度背景的文章,有助于了解AI水货的规模。
- Ranjit Singh,“On arXiv, an Influx of AI Slop Pits Surface Against Substance”,Data & Society,2025年。:分析AI水货对学术质量管理体系造成的结构性影响的文章。
- Cornell Tech,“arXiv Transition to Independent Nonprofit”,2026年。:arXiv独立的官方说明页面,整理了CEO招聘公告和治理结构。
- openRxiv,“2025 Year in Review”,2025年。:有助于理解bioRxiv/medRxiv独立案例的资料。
- Karl Huang,“Academic publishing is a multibillion-dollar industry. It’s not always good for science”,The Conversation,2026年。:了解学术出版市场结构与Elsevier盈利模式的背景资料。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。
