AI 会拖慢科学进步吗?
科学进步正在明显放缓。
科学进步正在明显放缓。

👦🏻 作者: Sayash Kapoor、Arvind Narayanan
🥷 编译: 十字路口

「十字路口」编者按(Koji)
前不久,OpenAI 宣布给出了纳维–斯托克斯存在性与光滑性问题的证明,并由 GPT‑6 Astra 完成 Lean 形式化验证**,这再一次点燃了「AI 正在加速科学」的想象。**
但是,这篇在 2025 年发表的文章提出了一个更反直觉、也更值得警惕的问题:AI 会不会让论文生产得更快,却让真正的科学进步更慢?
我推荐它,是因为作者没有停留在模型能力,而是把注意力放到了科学制度的瓶颈:注意力、激励、可复现性和人类理解。
当 AI 大幅降低"生产答案"的成本,我们更需要重新判断,什么才算真正的进步? AI 公司们预测,AI 将带来惊人的科学进步:治愈癌症、让人类寿命翻倍、殖民太空,甚至在未来十年实现过去一百年的进展。
在科技界看来,这似乎顺理成章:AI 可以进入科研流程的每个环节,包括总结文献、提出假设、分析数据、执行实验、撰写论文和同行评审。
但新技术对既有制度的影响,常常与最初的直觉相反。 印刷术曾被天主教会视为巩固权威的工具,社交媒体在阿拉伯之春后也一度被当作全球民主化的引擎。
AI 对科学的影响,同样可能出现反直觉的结果:即便每个采用 AI 的科学家都变得更高效,也不代表科学这个复杂系统整体上会受益。
理解这个问题,必须面对一个**"生产—进步悖论"**:
科学论文的发表速度持续指数增长,1900 至 2015 年间增加了约 500 倍;但无论采用哪种可用指标,真正的科学进步速度都没有同步增长,甚至正在放缓。
AI 公司、科研资助者和政策制定者目前主要在加速"生产",但这可能像在收费站导致拥堵时继续给高速公路增加车道——只会让问题更加严重。
科学正在放缓:生产—进步悖论
全球论文数量大约每 12 年翻一番,参与科研的人数增长得更快。
2000 至 2021 年,美国、中国、日本、德国、韩国、英国和法国这七个主要科研资助国的研发投入增长了约四倍。
问题是,更多论文、更多研究者和更多资金,并不必然带来更多突破。
真正的科学进步来自理解框架的改变。 例如,板块构造理论让地质学家第一次能够正确理解大陆与山脉的形成。在此之前,无论旧范式下积累多少观察结果和论文,都无法产生同等程度的进步。
元科学——用科学方法研究科学本身——尝试衡量这种差距。
它关心研究能否复现、学术激励如何影响成果、不同资助模式是否促进突破,以及科学究竟以多快的速度前进。

论文与作者数量持续增加,但论文的颠覆性下降
多条证据都指向同一个趋势:
-
具有"颠覆性"的论文在全部科研产出中的占比不断下降。论文和专利数量指数增长,但真正突破的绝对数量大致保持不变。
-
新理论通常会带来新的概念和术语,但论文标题中独特词组的数量在 21 世纪初之后陷入停滞,甚至下降。
-
不同领域的科学家认为,20 世纪早期获得诺贝尔奖的发现,与更晚近的诺奖成果在重要性上大致相当。投入暴增并没有让最重要的突破变得更加惊人。
-
某一年诺奖所表彰的发现中,诞生于此前 20 年内的比例,从 1970 年的约 90% 降至 2015 年的约 50%。这意味着重大突破可能出现得更慢,也可能需要更久才被识别。
-
从经济增长、摩尔定律、农作物产量和预期寿命等指标观察,研究者人数的指数增长,被单个研究者生产率的持续下降抵消了。

诺奖成果诞生于获奖前 20 年内的比例持续下降

研究生产率持续下降
这些指标都有局限。例如,用引用关系判断论文是否"颠覆",可能受到引用习惯变化的影响,AlphaFold 这样的成果也不会被该指标认定为颠覆性研究。
但把不同证据放在一起看,至少可以确认:相对于论文、研究者和资源的增长,科学进步正在明显放缓。

科学进步放缓的主要证据
为什么科学进步在放缓?AI 能帮忙吗?
一种常见解释是"低垂的果实已经被摘完": 容易解决的问题越来越少,剩下的问题越来越难。
作者认为,这最多只能解释单个领域的部分放缓。科学工具和既有知识也在不断进步,并会持续创造新领域——计算机科学、气候科学、认知神经科学、网络科学、遗传学和分子生物学,都是近百年才出现的新树,上面依然有新的低垂果实。
另一种解释更值得关注:科学的组织方式出了问题,导致科研投入转化为真正进步的效率下降。
甚至可能正是"生产速度过快"本身,让科学变慢了。
科学家的注意力是有限的。论文越多,真正新颖的工作越容易淹没在噪声中。
研究者会更依赖已经被大量引用、被公认为经典的论文,于是新增论文越多,学术注意力反而越集中到既有范式,新思想更难进入主流知识体系。
"非发即亡"的职业激励进一步强化了这个循环。 论文数量和经费容易衡量,真正的进步却很难及时衡量,因此大学和研究机构自然用可量化指标评价研究者。
对个人而言,选择低风险、容易发表的研究是理性的;但对整个科学共同体而言,这会抑制高风险、可能多年只能产出一篇论文的突破性工作。
如果科学放缓的原因之一正是过度生产,那么 AI 会直接放大问题。
它让追逐论文数量、引用和其他表面生产率指标变得更容易,也可能让研究者个体更有创造力、科学共同体却因模型输出趋同而失去多样性。
AI 还可能进一步加剧注意力分配不均,让新思想更难浮出水面。
科学连软件都还没有准备好,更别说 AI
科研中大多数 AI 应用,本质上都是软件开发: 用模型寻找数据中的模式、编写机器学习程序,或让生成式 AI 产出分析代码。
但科研共同体的软件工程实践远远落后于产业界。自动化测试、版本控制和设计规范等基本方法,在科研中仍然缺失或执行混乱。
更严重的是,同行评审通常不审查真正执行计算的代码和数据。 许多论文甚至不公开这些材料。一项针对 1,800 篇承诺共享代码和数据的生物医学论文的研究发现,93% 最终没有兑现;研究者向发表于顶级期刊 Science 的 204 篇论文作者索取代码和数据时,只有 44% 得到回应。
即使代码和数据被公开,错误也非常普遍。一个典型案例是 Excel 自动把基因名称转换为日期,导致约五分之一的遗传学论文出现相关错误。
科学界花了几十年才逐渐学会负责任地使用基础统计工具,AI 带来的复杂性和隐蔽错误只会更难发现。
在生成式 AI 出现之前,传统机器学习就已导致 30 个科学领域中超过 600 篇论文出现方法错误。对 400 多篇用 AI 诊断新冠的论文进行审查后,研究者发现,没有一项工作因方法可靠而产生临床可用的工具。
AI 也可以成为解决方案的一部分:发现论文漏洞、自动复现实验、帮助研究者改善代码、提供测试和代码审查。
但这要求期刊、研究机构和资助方把激励重点从"生产更多"转向培训、综合、复现和错误检测。
AI 可能让错误理论延续得更久
传统科学建模通常先提出一个关于世界如何运行的假设,再用统计模型检验它。
AI 建模则更像黑箱:它不一定形成可解释的世界模型,而是直接利用历史数据,提高预测准确率。
这在产业中往往很有用,但在科学中可能阻碍理解。
作者用地心说作类比:通过不断添加"本轮",地心模型也能非常准确地预测行星运动,甚至一些现代天文馆仍会用类似计算方式。日心说胜出,并不是因为它一开始的预测精度遥遥领先,而是因为它对行星运动给出了更简单、更深刻的解释。

复杂的地心模型与更简洁的日心模型
科学进步依赖理论更新,而不只是预测精度的提高。
AI 可能非常擅长为各个领域制造新的"本轮":在错误理论上叠加越来越精确的预测。
如果更好的预测让研究者更久地停留在有缺陷的理论里,整个领域就可能在既有范式中越做越精确,却迟迟无法跳出思想上的死胡同。
一项实验显示,一个在一千万条行星轨道数据上训练的 Transformer,可以出色地预测轨道,却没有发现产生这些轨道的引力规律。
这正是"有预测、无理解"的风险。

Transformer 能预测轨道,却没有发现背后的引力定律
人类理解仍然不可替代
解决问题和撰写论文,看起来像是科研的最终目的;但作者认为,这些过程更像一种通往真正奖赏的仪式,真正的奖赏是人类对现象的理解。
没有这种理解,就没有科学进步。
菲尔兹奖得主 William Thurston 曾强调,数学家的工作不只是判断数学命题真假,而是寻找让人类理解和思考数学的方法。
他以自己研究叶状结构理论的经历为例:当他快速解决了该领域的重要问题后,其他研究者反而开始离开。
并非问题已经穷尽,而是他的成果难以理解,加上重要定理似乎已经被证明,后来者既难进入,也难再通过证明新结果获得学术回报。最终,曾经存在于共同体中的前沿理解逐渐流失。
研究者之所以在解决问题的过程中形成理解,是因为他们必须亲自穿越推理和试错。AI 如果直接给出答案,却不产生相应的人类理解,就可能切断这个过程。
作者用一个形象的比喻解释:在健身房里使用叉车,当然可以举起更大的重量,但举起重量并不是去健身房的真正目的。

AI 可能绕过形成理解的过程
并非所有科学活动都把人类理解作为最终目标。天气预测和材料合成更看重现实结果。但大多数领域位于两个极端之间。
如果 AI 绕过理解,或只制造"理解的幻觉",科学共同体可能逐渐失去培养新科学家、建立新理论、综合与纠正研究、把知识迁移到其他领域,以及提出真正新问题的能力。
来自六个领域的数据已经显示,采用 AI 的论文更倾向于解决已知问题、在既有范式中工作,而不是提出新问题。
当然,AI 也可以帮助人类建立隐性知识,例如解释数学证明;关键是科研激励必须开始奖励理解,而不只是奖励答案。
对科学未来的启示
过去十年,科学界高速采用 AI,却没有同步改造缓慢变化的制度规范、质量控制和人才培养方式。
这很可能让"生产—进步悖论"进一步恶化:论文发表得越来越快,真正的科学进步却未必加速。
2012 至 2022 年间,在大语言模型尚未普及之前,20 个领域中使用 AI 的论文数量就已经增长了四倍。

20 个领域中使用 AI 的论文数量增长了四倍
改变科研实践
研究者需要更谨慎地采用 AI,补足软件工程能力,理解 AI 建模的常见陷阱,并避免把 AI 当成拐杖或神谕。
但个体研究者大多只是理性回应现有的生产率指标,真正能改变系统的,是期刊、大学的招聘与晋升委员会、资助机构和政策制定者。
投资元科学
元科学揭示了生产—进步悖论,但我们仍不清楚"进步"究竟如何定义,也没有形成解释放缓原因的共识。
科学不可能拥有一个唯一的"真正进步指标",因为一旦指标成为目标,就会被迅速博弈,最终像论文数量和引用次数一样失效。
因此,元科学需要更深入地理解进步的因果机制,并验证改革方案是否有效。
目前,元科学获得的资金只占总体科研经费的零点几个百分点,专门研究科学放缓的资源更少。
假如整个科研体系的投入产出效率真的下降了几个数量级,那么这笔投入显得小得不成比例。
改革激励
科学家早已清楚"非发即亡"的问题,但改革因制度惯性、指标博弈和突破只能事后识别而屡次失败。
AI 也许会带来一个转机:当写论文的成本低到有人一年可以共同署名近百篇论文时,论文数量可能彻底失去评价价值。
学术职业发展应更多奖励难以自动化的成果,例如新理论、新范式,以及真正推动理解的工作;资助机制也需要同步改变。
科学界不需要继续奖励"采用 AI"。AI 已经在以极快速度扩散,采用率不是瓶颈。
重新思考 AI for Science 工具
大型 AI 公司往往偏爱"AI 发现了某某"的醒目标题,因为这能强化 AI 将解决人类重大问题的叙事。
公众需要对这类新闻保持怀疑:结果可能无法复现,AI 也可能只是众多工具之一,却被包装成唯一主角。
真正有价值的 AI for Science 工具,应该攻击科研的真实瓶颈,而不是再造一个文献综述产品。例如,帮助发现科研代码中的错误、加强质量控制,或帮助科学家建立理解。
数学家多次表达,他们更期待促进人类理解的工具,而不是单纯自动证明定理的工具。
评估一个文献综述工具时,至少应问三个问题:它是否节省时间并保持质量?它如何影响研究者对文献的理解?如果整个共同体广泛使用,它会如何改变学术注意力——是否会让知名论文获得更多关注?
这三个问题分别对应生产、理解和进步。
今天的评估通常只回答第一个问题,因此必然会高估工具的收益、低估系统性风险。
最后的思考
作者本人也是科研 AI 工具的积极使用者。日常使用中的兴奋感,很容易让人忽略:AI 对单个科学家的帮助,与 AI 对科学制度整体的影响,是两个完全不同的问题。
我们乐观地相信,从长期来看,科学界的规范和流程最终会追上技术的发展。
但在此之前,这段路注定颠簸。
本文作者:Sayash Kapoor、Arvind Narayanan
原文:https://www.normaltech.ai/p/could-ai-slow-science
推荐阅读


加入会员群
