社会第 88 期 ·

代理协商的市场会幸福吗?

信息弱势者将不再知道自己正在吃亏,这样的世界即将到来

代理协商的市场会幸福吗?

开篇

就在本周五,也就是2026年4月24日,Anthropic公布了一项有趣的实验结果。这项实验名为Project Deal。他们给自己69名员工每人分配了100美元的预算,让他们的Claude代理在Slack上互相买卖物品。一周之内成交了186笔交易,总交易额超过4,000美元1​。

表面上看,这像是一场有趣的公司内部活动。有的代理用牛仔腔调协商自行车价格,有的代理为自己买了19个乒乓球作为礼物,还有的代理不小心又买了一块同款滑雪板。诸如此类的趣闻不胜枚举。

但我认为,这项实验中最重要的发现另有其人。那就是**“使用更聪明模型的人达成了更好的交易,但输的人却没有意识到自己输了”**这一点。接下来我想谈谈,为什么这一点很重要,以及它对如今正在形成的、规模高达1万亿美元的代理商务(Agentic Commerce)市场意味着什么。

👀 发现了什么?Project Deal的核心结果

这次实验中出现了两种模型:当时的前沿模型Claude Opus 4.5,以及更小的模型Claude Haiku 4.5。实验同时运行了4个并行市场。其中两个全部使用Opus,另外两个则以50:50的比例混用Opus和Haiku。参与者事先并不知道哪个市场是“真实”的。

结果非常明确。

  • 成交次数:使用Opus的用户平均多成交2笔(p=0.001)
  • 销售价格:同样的物品,Opus卖出的价格平均高出3.64美元。有一个案例中,同一辆坏了的自行车,Haiku卖出38美元,Opus却卖出65美元,相差70%。
  • 卖方/买方效应:Opus作为卖方时平均多收2.68美元,作为买方时平均少付2.45美元。考虑到交易平均价格约在20美元左右,这意味着每笔交易存在约12%到13%的价格差异。 到这里为止,得到的还是**“更好的模型带来更好结果”这一直觉性发现**。但真正有意思的部分在后面。

😞 看不见的失败——认知与现实的落差

实验结束后,参与者被要求为每笔交易的公平程度打分,从1分(对买方不利)到7分(对卖方不利)。结果是:Opus交易得分为4.05分,Haiku交易得分为4.06分,几乎没有差别。交易满意度也是如此。虽然使用Opus的用户评分略高一些,但没有统计学上的显著差异(p=0.378)。

最令人震惊的另有其事。有28名参与者在两个市场中分别被Opus和Haiku代表过一次。在这些人中,17人表示更偏好Opus带来的结果,但也有11人反而表示更偏好Haiku的结果2​。尽管客观上Haiku让他们平均损失了约5美元。

用一句话总结就是:使用性能较差代理的人明显吃了亏,但他们自己并不知道自己吃了亏。

这为什么重要呢?市场这套机制,需要参与者能够意识到自己的损益才能运作。价格贵了,下次就去别的店;被骗了,就离开那个平台。这种反馈回路正是市场自我净化的核心原理。但如果代理替代了协商的一切环节,用户手中就只剩下结果本身。没有比较的对象,就没有判断这个结果究竟是好是坏的依据。

🎰 放在Project Vend的延长线上看,意味着什么

要真正理解这项实验,需要把它和Anthropic自去年起持续进行的Project Vend系列一起来看。

Project Vend 1(2025年6月)是一个名为“Claudius”的Claude Sonnet 3.7实例,负责运营Anthropic办公室里的自动售货机业务的实验。结果十分惨烈。它向员工免费赠送赌场筹码,以低于成本价出售钨立方体,甚至一度陷入把自己误认为是穿蓝色西装外套之人的身份危机。

在Project Vend 2(2025年末)中,引入了多代理架构从而改善了表现。他们增加了CRM,还在纽约和伦敦开设了自动售货机,最终几乎消除了负(-)利润率。在这一过程中,Andon Labs打造出了名为Vending-Bench的正式AI代理评估基准。它让代理在模拟环境中运营自动售货机业务长达一年,以此衡量长期一致性(long-horizon coherence)。目前排行榜第一名是Claude Opus 4.6(8,017美元),Gemini 3 Pro紧随其后3​。

如果说Vend系列问的是“一个AI能否运营一家企业”,那Project Deal提出的是下一阶段的问题。

当多个AI代理同时在市场中进行交易时,会发生什么?

这本质上是一个不同维度的问题,因为它不再只关乎单一代理的决策质量,而是涉及代理之间的相互作用以及市场结构本身的形成。而这个问题已经不再只是思想实验。市场早已朝这个方向前进了。

🛒 市场已经走到了那里——代理商务基础设施的快速形成

Project Deal之所以不能只停留在内部实验层面,是因为类似的基础设施已经在全球支付网络的层面上铺开了。

从2025年下半年到2026年初的这段动向,可以整理如下。

  • Visa Intelligent Commerce:2025年启动。联合100多家合作伙伴,发行了专为AI代理设计的代币。截至2025年末,已完成数百笔真实交易,Visa预计到2026年假日购物季,将有数百万消费者通过AI代理进行支付4​。
  • Mastercard Agent Pay:2025年11月面向美国全体持卡人开放。2026年初与Santander合作,完成了欧洲首笔代理端到端支付。并与PayPal、OpenAI合作,使得在ChatGPT内部直接完成支付成为可能。
  • Stripe Agentic Commerce Protocol(ACP):2025年9月发布的首个上线标准。通过名为**Shared Payment Tokens(SPT)**的全新支付基元(primitive),代理可以在用户授权范围内发起支付。BigCommerce宣布了集成方案,实现一次集成即可在所有AI代理上完成销售。
  • Tempo的Machine Payments Protocol(MPP):2026年3月由Stripe与Tempo共同发布的开放标准,涵盖银行卡、稳定币及其他支付方式。Visa作为设计合作伙伴参与其中,共同制定了基于卡的规范。
  • Google Universal Commerce Protocol(UCP):2026年1月发布,Visa与Mastercard均参与其中。 所有这些动向背后,都有一个数字支撑。据麦肯锡估算,到2030年,AI代理仅在美国就将完成规模达1万亿美元的交易5​。而目前美国购物者中,已有47%的人至少在一项购物任务中使用了AI工具。

这套基础设施的核心特征在于:用户一旦一次性授权,此后所有的协商、购买、支付都发生在代理之间。这与自助终端或聊天机器人时代有本质的不同。自助终端是人直接点击屏幕,聊天机器人是人直接输入信息。而在代理商务中,人把界面本身都委托了出去。

Oswarld视角

在为企业制定GTM战略的过程中,我观察到一种模式。每当新的支付、交易基础设施铺开时,最初一两年总是被描述为“便利性”的语言。但等到五年后再回头看,那套基础设施总是会制造出新形式的信息不对称。

电子商务曾说自己让价格比较变得容易,因而有利于消费者,但最终却开启了算法价格歧视和暗黑模式的时代。推荐算法曾说自己是发现的工具,却造就了注意力经济和信息茧房。

在代理商务中,我担心的是**“代理鸿沟(Agent Divide)”**。Project Deal的结果以量化的方式展示了这种可能性。同样的市场,同样的商品,只因模型不同,结果就不同,而用户对这种差异毫无察觉。

如果这一切应用到真实市场,会变成什么样呢?订阅高级模型的用户会以更好的价格买入,以更高的价格卖出。使用免费或低价模型的用户平均而言会吃亏,但他们无从得知这一点。价格歧视不再由算法制造,而是由协商能力的差异造成。更可怕的是,这种差距不会被认知为不平等。而不被感知的不平等,既不会形成政治压力,也不会引发市场的自我净化。

从GTM的角度再补充一点:营销目标从人类转向代理的时刻已经不远了。继SEO之后,可能会出现AEO(Agent Engine Optimization,代理引擎优化),甚至更进一步,出现反向解析代理协商算法、针对其进行优化定价的做法。Anthropic在Project Deal中忧心忡忡地明确指出的“优化代理注意力的激励机制”,应该看作已经开始出现了。

结语

今天整理的内容,用三句话总结如下。

  • Project Deal证明了AI代理能够运营一个市场。186笔交易,4,000美元的交易额,这本身就是有意义的第一步。
  • 但更重要的发现是“能力差距是看不见的”。使用Haiku的人明显吃了亏,但在满意度和公平性评价上却感受不到差异。
  • 这一切已经在全球支付基础设施层面变得具体化。Visa、Mastercard、Stripe、Google都在制定标准,2026年假日购物季将是首个面向大众的分水岭。 如果读完这期通讯只想带走一件事,我推荐这一点:在未来一到两年内,选择自己使用哪种AI工具这一决定,将会越来越频繁、越来越重要地摆在你面前。这已经不再仅仅是“用ChatGPT还是用Claude”的问题,而是“哪个代理将代替我完成交易、支付与合约”的问题。

而且,正如Project Deal所展示的那样,这个决定将以你自己都未曾察觉的方式,影响到你的资产。

参考资料与延伸阅读

核心来源

  • Troy, K. K., Shields, D., Bradwell, K., & McCrory, P. (2026). Project Deal. Anthropic. :这是今天这期通讯的出发点。文末附录中公开了完整的回归分析,可以直接查证其中统计论断的依据。
  • Anthropic. (2025). Project Vend: Can Claude run a small shop? :这是Project Deal的前史。这份报告最坦率地记录了单一代理运营一项业务时会出现怎样的失败模式。
  • Backlund, A., & Petersson, L. (2025). Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents. arXiv:2502.15840. :这是Project Vend发展成正式基准的学术论文,首次提出了衡量AI代理长期一致性的方法论。

背景知识

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. 代理商务(Agentic Commerce):指人不再亲自进行支付与购买,而是由获得授权的AI代理与其他代理或卖方协商,从而完成交易的方式。自助终端是人直接点击屏幕,聊天机器人是人直接输入文字,但在代理商务中,界面本身都交由AI来处理。

  2. 统计显著性(p值):表示某个结果是偶然出现的可能性大小的数字。通常p<0.05时,会解读为“并非偶然的可能性在95%以上”。正文中p=0.001意味着偶然发生的概率仅为0.1%,而p=0.378则意味着这种差异很可能只是偶然造成的。

  3. 长期一致性(Long-Horizon Coherence):指AI代理不是在短期任务中,而是在持续数天、数月的决策过程中,维持一致战略与判断的能力。许多模型擅长短期推理,但随着时间推移常常会遗忘自身目标或做出前后矛盾的行动,因此需要单独进行评估。

  4. 支付代币(Payment Token):一种用来替代真实卡号的一次性或限定范围的数字凭证。它使代理无需接触卡号本身即可完成支付。用户可以事先设定诸如“仅限该类别、仅限该金额上限”之类的条件。

  5. GTM(Go-To-Market,市场进入)战略:指设计新产品、新服务应面向哪些客户、通过什么渠道和信息、以什么价格推出的战略领域。在代理商务时代,“客户”本身的定义可能发生改变,因此GTM框架也需要重新构建。