商业第 58 期 ·

经济学家的速度快了5倍,但质量呢?

真正的竞争在于“发现错误的速度”与“制造错误的速度”之间

经济学家的速度快了5倍,但质量呢?

开篇

订阅者朋友,最近经济学界正上演一幅有趣的景象。达特茅斯学院的Paul Novosad教授说,多亏了AI,他能用来思考真正研究问题的时间增加到了5倍。苏黎世联邦理工学院(ETH Zurich)的Elliott Ash教授则表示,生产力的提升令人兴奋,以至于自己反而更想工作了。

与此同时,经济学社交媒体上也出现了针对AI生成低质量内容——所谓“AI垃圾内容(slop)”——的警告,呼吁“求你们别再这样了”。FT专栏作家蒂姆·哈福德(Tim Harford)正面探讨了这两面。我想在他分析的基础上再进一步,指出这一现象并非经济学独有的问题,而是整个知识生产领域的结构性转型。

AI正在改变的三件事:生产力、范围、验证

蒂姆·哈福德将AI可能改变经济学的路径归纳为三条。我们逐一来看。

1. 生产力——“从杂务中解放出来的经济学家”

数据清理、撰写研究经费申请书、整理表格格式,这些都是消耗经济学家时间的典型杂务。AI能在很大程度上将这些工作自动化。Novosad教授所说的“5倍”,并不是指研究本身快了5倍,而是意味着可用于思考的时间增加到了5倍

有意思的是,这种生产力提升目前尚未转化为可见的成果。据American Economic Review主编Erzo Luttmer介绍,约25%的投稿论文披露使用了AI——大多用于编辑或编程辅助——但投稿质量并没有出现明显变化。

哈福德亲自使用AI代理,分析了NBER1​工作论文的摘要。ChatGPT发布之后,平均句子长度有所缩短,但这只是此前趋势的延续,反而词汇复杂度有所上升。顶尖期刊的投稿数量相较既有趋势也很难看出明显变化。也就是说,速度变快了,但并没有变得更好。

2. 范围——“测量以前无法测量的东西”

比生产力更有趣的变化,是研究范围的扩展。定性数据(qualitative data)的收集成本高、系统性分析困难。但现在经济学家借助AI,可以测量分区规划法规的效果,分析高难度招聘面试所产生的影响,还能大规模检索企业财报,从中找出应对关税的模式。

**预测领域的进展也值得关注。国际清算银行(BIS)今年3月发布了名为BISTRO的宏观经济时间序列预测通用模型。**这个基于Transformer架构2​的模型,与传统计量模型不同,无需针对特定任务专门设计。BIS表示,该模型本可以准确预测2021~2022年通胀的持续性——而当时大多数传统模型都机械地预测“将回归均值”,结果严重失准。

3. 验证——“AI在纠错,人类在造错”

第三种可能性最微妙,也最重要。AI能帮助过滤研究中的错误吗?

西北大学的Ben Golub教授联合创立了一款名为Refine.ink的工具。**这是一个基于AI的论文审阅系统,能够系统性地检测数学错误、实证策略的漏洞以及逻辑一致性问题。据Golub教授介绍,即使是已通过顶尖期刊评审的论文,也至少有三分之一以上被发现存在问题。**芝加哥大学的John Cochrane教授把自己的通胀研究著作放进Refine测试,评价说这是“我40年学术生涯中收到过的最高水平的意见”。

经济学五大期刊中已有多家在试验性引入Refine。据说最自然的使用场景是在有条件录用通知发出之前的最终把关阶段——帮作者提前找出发表后可能令人尴尬的失误。(类似的服务有很多。其中我自己用过的是一位韩国人开发的https://jenni.ai/,推荐大家试试。)

真正的问题:速度的军备竞赛

看到这里,AI似乎对经济学是个相当不错的消息。但哈福德抛出了一个核心问题:

“AI发现错误的速度,能否快过人类放弃发现错误的速度?”

这不是一个简单的修辞性问题。对提交给ICLR 2025(国际机器学习学会)的7万份评审意见进行分析后发现,约21%被推测是从头到尾完全由AI撰写的。这不是说AI辅助了编辑,而是意味着五份评审报告中就有一份完全由LLM独立撰写。经济学期刊中也已流传着“敷衍到令人尴尬的AI评审报告”被提交的说法。

这个问题的结构可以概括如下:

  • 全球每年涌现的学术论文超过500万篇
  • 合格的审稿人储备根本跟不上这个速度
  • 同行评审(peer review)本身回报低、激励弱
  • 在这种情况下,如果AI跳出来说“我来替你做”,原本动机就不强的人类审稿人就更没有理由多花力气了

这正是经济学中所说的典型的道德风险(moral hazard)3​结构。安全装置一旦出现,人们反而会做出更冒险的行为——就像装了安全气囊就敢超速一样。

Oswarld视角

生产力工具真正转化为成果质量提升的情况,比想象中要少得多。Excel问世时,人们期待会有更好的分析出现,但实际增加的只是“更多的电子表格”。就像很难说PowerPoint提升了演讲的质量一样。

我觉得AI也在重复同样的模式。生产力工具会让原本就做得好的人做得更好,但同样也会让原本敷衍了事的人更加敷衍。Ben Golub教授本人也承认了这一点——他坦言,甚至在自己的论文中,也遇到过“AI写的段落混进来,看起来却像真正的研究成果”的经历。

我更关注的是,像Refine这样的工具能否不止于“错误检测器”,而进一步成为学术质量的新基准线(baseline)。如果每篇论文在提交前都要经过AI审阅,人类审稿人就能把精力集中在AI无法捕捉的部分——原创性、理论贡献、语境判断上。这可能不是威胁,而是分工的重新设计。

只不过,问题在于这个过渡期需要先撑过“垃圾内容的洪流”。而现在,我们正身处这场洪流的正中央。字面意义上的AI内容洪水扑面而来,我们……得从中活下来。无论是短视频、博客文章,还是学术论文,都是如此。

结语

**AI减少了经济学家的杂务,拓展了研究的范围,也为纠错做出了贡献。但“更多的研究”是否真的转化为了“更好的研究”,目前证据依然薄弱。**而且存在一种讽刺:能够纠正错误的AI,与能够更快量产错误的AI,本质上是同一种技术。

这并非经济学独有的问题。代码审查、法律文件审阅、辅助医疗诊断——在所有由AI承担验证角色的领域,同样的问题都会反复出现:安全网出现之后,人会变得更谨慎,还是更粗心?

如果你对这个话题还想深入了解,我建议直接去看看BIS的BISTRO模型论文,以及像Refine.ink这样的服务。特别是Refine提供免费试用版,只需把自己的文章或报告放进去测试一下,就能切身感受到AI验证的水平。

参考资料与延伸阅读

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. NBER(National Bureau of Economic Research):美国具有代表性的经济学研究机构。这里发行的“工作论文”是正式出版前的论文,是最快展示经济学界最新研究动态的窗口。

  2. Transformer架构(Transformer Architecture):ChatGPT等大型语言模型所依托的神经网络结构。它以“预测下一个词”的方式运作,而BIS将其应用到了宏观经济时间序列数据上。

  3. 道德风险(Moral Hazard):经济学中用来指称“投保之后反而做出更危险行为”这一现象的术语。AI帮忙纠错,导致人类审稿人变得不那么细致,也是同样的结构。