四大会计师事务所,三家栽在假脚注上
27个脚注中有16个是假的。

开篇
订阅者朋友,上个月安永(EY)删除了自家的一份报告。因为27个脚注中有16个是假的。而这周,毕马威(KPMG)也遭遇了同样的事情。这次更严重。45个脚注中只有5个是真的。再算上德勤,四大1中已经有三家栽在AI编造的假脚注上了。
一家名为GPTZero的AI检测初创公司给这种现象起了个名字,叫**“氛围引用(vibe citing)”**2,指的是不加验证、直接照搬AI编造的假出处的行为。
先说结论:这不是某家企业的个别失误。问题的本质不在于技术,而在于“让人跳过验证环节的组织结构”。
GPTZero研究团队逐行追查了安永加拿大和毕马威的报告——《Points of Attack: Uncovering Cyber Threats and Fraud in Loyalty Systems》《Total Experience: Redefining Excellence in the Age of Agentic AI》,结果相当震惊。
🔍 安永报告中实际发现的问题
首先,安永的报告讨论的是忠诚度计划(积分、里程)的网络安全漏洞问题。报告作者中有2名安永合伙人和1名高级经理,该报告被用作加拿大分公司网络安全咨询业务的销售资料。

按时间顺序,第一起事件是这样的:2025年末,安永加拿大发布了一份关于忠诚度计划网络安全的报告,GPTZero对其逐行追查。
- 27条参考文献中有16条(约60%)是幻觉内容:URL返回404,或者相关文档本身根本不存在
- 麦肯锡报告系捏造:报告引用了一份名为《Loyalty Economics Report(2022)》的麦肯锡报告,但麦肯锡根本没有这份报告。分析认为,这是AI从低质量博客中吸收了已经存在的幻觉信息、再次生产出来的“二手幻觉(secondhand hallucination)”
- 数据自相矛盾:忠诚度市场规模与未使用积分规模被同时标注为2,000亿美元
- AI生成概率72%:报告文本中有72%被判定为AI生成。 安永加拿大立即删除了该报告,并表示“正在审查发布过程”。同时也撇清关系称,“该报告与任何客户项目无关”。换句话说,这份报告是他们自己撰写、自己发布的,可他们却说不清楚是怎么发布出去的,说与客户无关,也说不清数据出处到底在哪儿。😂
毕马威:一份关于AI的报告,被AI的幻觉填满
安永事件曝光还不到一个月,这周毕马威又爆出了更大的事件。
问题出在毕马威国际(KPMG International)于2025年10月发布的一份名为《Total Experience: Redefining Excellence in the Age of Agentic AI》的报告上。这份报告讨论的是代理型AI3在企业中的应用案例,但据GPTZero分析,45个脚注中与出处完全一致的只有5个。剩下的40个,要么标题被篡改,要么无法确定出处,要么完全是捏造的。
问题不止出在脚注上。报告中出现的**事实描述中,约有一半是虚假的,或者出处被张冠李戴。**报告中具体描述了瑞银(UBS)、英国国家医疗服务体系(NHS)、瑞士联邦铁路以及伦敦交通局采用AI的案例,但这些机构都向英国《金融时报》(FT)确认“没有这回事”。报告中还称阿联酋航空的AI聊天机器人“Sara”可以变更航班,这也是假的。Sara根本不是聊天机器人,而是一个机器人导览员,也没有变更航班的功能。
更讽刺的是自相矛盾之处。报告中写道:“55%的CEO将AI列为最优先投资对象”,但同一个月毕马威自己发布的CEO Outlook报告中,这一数字却是71%。连自家的报告都没能正确引用。
毕马威已从网站上撤下该报告,并表示“正在调查发布过程”。(这套说辞怎么这么眼熟?)
📋 这不只是咨询行业的问题
在安永、毕马威之前,德勤已经栽了两次跟头。在2025年澳大利亚政府福利报告(部分费用被退还)和加拿大医疗人力报告(160万加元)中,都发现了假的学术引用,还有真实存在的研究者被错误地列为共同作者,而他们从未参与过相关研究。
法律行业也不例外。2026年4月,华尔街名门律所苏利文与克伦威尔(Sullivan & Cromwell)向纽约联邦破产法院提交了道歉信。事情起因是该所在一份紧急申请文件中错误引用了美国破产法条文,并援引了根本不存在的判例。合伙人Andrew Dietderich承认,“公司内部的AI使用政策没有得到遵守”。
学术界也不例外。GPTZero分析了全球顶级AI学术会议NeurIPS 2025的4,000篇获录用论文,发现至少53篇论文中存在100多处幻觉引用。由巴黎HEC商学院的Damien Charlotin运营的AI幻觉判例数据库显示,截至2026年初已记录超过1,450起案例,其中2025年一年就发生了全部案例的约90%。
🧩 结构性问题:为何这种事一再发生
到这里,很容易得出“AI是问题所在”这样的结论。但我关注的是另一个角度。
第一,“thought leadership报告”的生产结构变了。
无论是安永的忠诚度报告,还是毕马威的代理型AI报告,都不是交付给客户的成果物,而是用于宣传咨询业务的营销资产。四大每年都会发布数百篇这类报告,向市场传递“我们是这个领域的专家”的信号。随着生产压力增大,其验证流程并没有像交付给客户的成果物那样严格。就毕马威的案例而言,一份讨论AI应用案例的报告,居然被AI的幻觉内容填满,这已经不只是讽刺,而是信任结构本身出现了缺陷。
第二,“到底有没有用AI”这一点根本没有被纳入验证范围。
德勤澳大利亚的案例极具代表性。最初的报告中根本没有提及使用了AI这件事,直到问题曝光后,德勤才承认“使用了Azure OpenAI”。苏利文与克伦威尔也是一样,一边声称“公司有全面的AI使用政策和培训要求”,一边又不得不承认“这项政策没有被遵守”。“有政策”和“政策真的在起作用”,完全是两回事。
第三,出现了一种叫“二手幻觉”的新型污染路径。
GPTZero这次特别关注的是二手幻觉(secondhand hallucination)4。安永报告中虚假的麦肯锡出处,很可能就是AI把某个低质量博客上已经存在的幻觉信息当作“真实信息”学习后,再次生产出来的结果。用GPTZero研究团队的话说,把这类报告发布到网上,本身就等同于“向互联网这口知识之井投毒”。尤其是像安永这样权威机构网站上发布的信息,很可能被其他AI模型当作训练数据吸收进去,从而形成幻觉催生幻觉的恶性循环。特别是,由于AI在引用时更偏好权威媒体,这一问题会变得更加严重。
Oswarld视角
我并不认为这起事件的核心问题是“AI幻觉”这种技术性缺陷。
在制定GTM战略的过程中,我见过无数次这样的模式:每当出现新工具,企业一边把它卖给客户,一边自己内部也在用。要让这种双重身份成立,就必须证明“我们有能力管理这个工具带来的风险”,而现在,四大中有三家同时在这项证明上失败了。安永一边炫耀AI业务收入增长30%,一边却连脚注都验证不了;毕马威一边强调AI治理,一边却原封不动地采纳了AI捏造的案例。
在我看来,真正危险的不是幻觉本身。用AI生成一条脚注只需要3秒,而验证一条脚注需要3分钟。27条脚注就是81分钟。“抓出幻觉所需的成本,可能比用AI节省下来的时间更高”——大多数组织到现在都还没有意识到这一点。
结语
这起事件中,有三点值得我们记住。
-
四大中有三家中招,这说明这不是某家公司的文化问题,而是行业结构性问题。剩下的那一家(普华永道,PwC)也未必就是安全的。
-
问题反复发生的原因不在于技术,而在于组织内部的验证流程。仅仅“有一套AI使用政策”是不够的,还需要有确认这套政策是否真正在运作的机制。
-
在这个靠出售“信任”为生的行业里,出处的准确性本身就是产品。一旦一个假脚注被曝光,受到质疑的就不只是报告的结论,而是整个机构的判断力。
下次读咨询报告或研究资料时,不妨亲自点开脚注里的URL看一看。这个小小的动作,就是“这个出处是真的吗?”这一追问的起点。
参考资料与延伸阅读
核心来源
- GPTZero,“Investigation: Hallucinations in Ernst & Young Report on Loyalty Fraud”,2026.5.14。:可以看到安永报告的脚注是如何被逐一追查的。
- GPTZero,“Chasing the Hallucinations: KPMG’s AI-Powered Attempt at Redefining Excellence”,2026.6.12。:这是对毕马威报告45个脚注进行全面追查的调查报告。
- Stephen Foley,“EY retracts study after researchers discover AI hallucinations”, Financial Times”,2026.5.15。:FT的首发报道,包含安永的官方回应。
- TechCrunch,“KPMG pulls report on AI usage due to apparent hallucinations”,2026.6.13。:其中包含瑞银、NHS、伦敦交通局亲自否认“并非事实”的内容。
- Sherwood News,“AI hallucinations appear to be creeping into consulting reports”,2026.5.15。:首次详细阐述“二手幻觉(secondhand hallucination)”概念的文章。
背景知识
- Fortune,“Deloitte allegedly cited AI-generated research in a million-dollar report for a Canadian provincial government”,2025.11.25。:德勤加拿大160万美元报告事件的始末。
- Canadian Lawyer,“Sullivan & Cromwell apologizes to US bankruptcy judge for AI-generated errors in Prince Group case”,2026.4。
- Fortune,“NeurIPS research papers contained 100+ AI-hallucinated citations”,2026.1.21。:展示了AI学术界本身也无法摆脱幻觉问题的一篇文章。
- Damien Charlotin,“AI Hallucination Cases Database”。:追踪全球各国法院AI幻觉判决的数据库,截至2026年初已记录超过1,450起案例。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。
注释
-
四大(Big Four):指全球四大会计咨询企业——德勤(Deloitte)、普华永道(PwC)、安永(EY,Ernst & Young)、毕马威(KPMG)。它们是负责全球大型企业和政府机构会计审计、战略咨询、税务顾问等业务的行业最大企业。 ↩
-
氛围引用(vibe citing):指不加验证、直接照搬AI生成的假出处或引用的行为,是一个新造词。意为“凭氛围(vibe)来引用”,由GPTZero在2025年初创造。 ↩
-
代理型AI(Agentic AI):指超越以往只会被动等待用户指令的生成式AI,能够自主设定目标、制定计划,并调用所需数据和工具,自主执行复杂多步骤任务的人工智能系统。 ↩
-
二手幻觉(secondhand hallucination):指AI将其他地方已经出现的幻觉(捏造)信息当作真实信息学习,然后再次生产出来的现象。其结构类似于假信息在互联网上流转过程中被“洗白出处”。 ↩
