人工智能给女性员工支付的薪水更少
当决策权交给机器的那一刻,偏见究竟该由谁来负责?

开篇
订阅者朋友,您好,我是Oswarld。
上周,旧金山一家小店引起了全球媒体的关注。这家店名叫“Andon Market”。从室内装修、招聘、定价到营业时间,所有决策都由一个名叫“Luna”的人工智能来决定,这是一家实验性商店。创始公司Andon Labs给这个AI提供了一份3年租约、10万美元预算,以及唯一一条指示:“实现盈利。”

然而,一位记者在采访这家商店时发现了一个奇怪的现象。Luna招聘的两名女性员工,其时薪比一名男性员工少2美元。当被问及原因时,AI给出的回答是“因为这名男性员工的门店工作经验更丰富”。那么这名男性员工的经验真的更丰富吗?根据简历,这名男性员工的工作经历只比女性员工多出约3个月。
我不认为这只是一次简单的插曲。这是AI将“薪酬歧视”这一由来已久的社会问题自动化的一个小样本。更重要的是,这里存在一个治理空白:谁来发现这个问题?谁来承担责任?今天,我想以这家商店为起点,探讨AI偏见与劳动、制度设计之间的交叉点。
🏪 Andon Market里究竟发生了什么
先来梳理一下事实。Andon Labs在旧金山联合街2102号签下了一份为期3年的租约,随后将商店的所有决策都交给了一个名叫Luna的AI代理来处理。Luna由Anthropic的Claude Sonnet 4.6模型驱动。Luna在Indeed.com1上发布招聘信息,进行电话面试,并直接做出招聘决定。从与供应商的价格谈判、信用卡支付,到申请AT&T网络、加入ADT安防系统,全部都由Luna完成。(也就是说,Luna基本上可以理解为一个被起了名字的聊天机器人。)
《纽约时报》记者Heather Knight在采访这家商店时发现的一件事是:Luna雇用的两名女性员工,其时薪比一名男性员工Felix少2美元。Luna给出的解释是“因为Felix的零售经验更丰富”。
让我们在这里暂停一下。“因为经验更丰富所以工资更高”这种解释,表面上看是合理的。但这个决策过程中存在几个无法验证的地方。
**第一,“经验”的评判标准是谁定的?**Luna究竟以怎样的权重来评估“经验”,这种评估又是如何受到招聘当时训练数据的影响的,外部根本无从验证。**第二,2美元这个差距的依据是什么?**这个数字究竟是从市场数据中得出的,还是模型内部某种潜在模式自行产生的结果,我们同样无从确认。**第三,这类决定事后由谁来审查?**至少在Heather Knight记者亲自造访商店、直接询问员工之前,似乎没有任何人对这一薪酬差距进行过监控。(稍微替他们辩解一下的话,这个项目的初衷本就是把所有决策都“交给”AI,所以这一点似乎并未被视为问题,而是被默默接受了。)
Andon Labs在其博客上明确写道:“这是一项受控实验,所有员工都由Andon Labs正式雇用,享有有保障的工资、公平的待遇以及完整的法律保护”。也就是说,确实存在一道安全防线,使得某个人的生计不会仅凭AI的判断而被决定。但这道防线只有在“实验”这一语境下才有效。如果是在实际商店运营中AI做出了同样的决定,这种差距很可能不会被任何人察觉。
📚 这不是第一次——一种反复出现的模式

Andon Market事件之所以在美国社会引起如此重视,是因为这并非例外,而是一种模式。当AI做出劳动市场相关决策时,学习并放大既有偏见的案例,此前已被多次报道。
其中最广为人知的案例是亚马逊。亚马逊自2014年起开发了一款以1到5分对求职者进行自动评分的招聘AI,但后来发现这个工具在技术岗位上偏向男性候选人,于是废弃了这个项目。这个AI是用十年间的简历数据训练出来的,由于技术行业本就以男性为主导,系统便自动倾向于优待男性候选人。系统会对简历中出现“women’s”这个词的内容进行扣分——比如“women’s chess club captain”(女子国际象棋俱乐部队长)——同时也会对两所女子大学的毕业生给出较低评分。亚马逊虽然修正了这些词汇,使其变得中性,但他们判断无法保证模型不会以其他方式产生歧视性的排序,最终解散了这个团队。
这里值得注意的一点是:“即便进行了中性化修正,仍可能产生其他形式的歧视”这一结论。也就是说,偏见并不会因为删掉某一个特定词汇就消失。模型遵循的是训练数据中的统计模式,因此即便去除了表面的信号,它仍可能通过更深层的相关关系得出同样的结果。这不是简单的程序漏洞,而是机器学习工作原理本身所固有的特性。
类似的模式在薪酬决策中同样能够找到。加州大学欧文分校法学院教授Veena Dubal在2023年发表于《哥伦比亚法律评论》的论文《On Algorithmic Wage Discrimination》分析了这样一种现象:Uber、Lyft这类平台将从劳动者身上提取的数据输入机器学习系统,从而产生不可预测、波动且个性化的时薪。劳动者们报告称,他们将这种波动性的薪酬结构体验为一种赌博或欺骗。
Dubal教授将其称为“算法工资歧视”(algorithmic wage discrimination)2或“监控式薪酬”(surveillance pay),并总结道:即便在同一时间、同一地点、以同样的技能工作,不同劳动者所获得的报酬也可能大相径庭。核心问题在于,这种薪酬决策发生在一个黑箱之中,无论是劳动者还是监管机构,都无法直接确认其依据。
Andon Market的案例正处于这两股潮流的交汇点上。就AI决定招聘这一点而言,它延续了亚马逊那种模式;就AI为每个个体核算时薪这一点而言,它又延续了Dubal所分析的算法工资歧视模式。唯一不同的是,在Andon Market,所有这些决策都被整合进了同一个AI之中。
⚖️ 偏见究竟是数据的问题,还是委托结构的问题
这里常见的处方是“用更好的数据来训练”。乍看之下这没错。训练数据有偏见,模型自然也会有偏见。但仅凭这一处方是不够的。
让我们再回到Andon Market。请再想一想这家店的偏见是如何被发现的。并不是AI自己报告说“我的决定存在偏见”,而是一位人类记者亲自造访商店,直接询问员工的薪水,通过比较发现了这一差距。也就是说,偏见只有在存在外部人类核验者的情况下才会显现出来。
然而,在AI被委托做出越来越多决策的环境中,为每一个决定都配上人类核验者,实际上是不可能的。Luna每天做出的决定恐怕多达数百件——招聘、定价、库存订购、营销文案、员工排班……人不可能逐一确认这些决定中哪一个隐藏着偏见。
由此便浮现出真正的问题:谁来测量偏见?谁来为此负责?这不是技术问题,而是委托结构的问题。
美国NIST于2023年发布了《AI风险管理框架》(AI RMF),该框架将AI治理3构建为四个功能:GOVERN(治理文化与责任结构)、MAP(界定情境)、MEASURE(测量与评估)、MANAGE(干预与控制)。其中MEASURE功能下的2.11项,明确要求对公平性与偏见进行评估。也就是说,“引入AI”与“负责任地运营AI”,完全是两码事。后者需要一整套测量体系、审计程序、事后监控,以及最重要的——对决策负责的人。
Andon Market并不具备这样的治理机制。在Luna决定时薪的那一刻,并没有任何审查该决定的程序,直到决定不断累积之后,才被一名外部记者发现。与其说这是AI的过错,不如说这是人类一方在将决策委托给AI时的一次设计失败。
🔧 那么,我们该做些什么
破解这一问题的线索其实早已存在于学界与业界,只是尚未标准化而已。
**第一,需要系统性的审计方法论。**2018年,麻省理工学院媒体实验室的Joy Buolamwini与Timnit Gebru发表的“Gender Shades”研究是一个很好的范例。两位研究者评估了IBM、Microsoft、Face++的商用人脸分析系统,发现深肤色女性的误分类率最高达34.7%,而浅肤色男性的误分类率仅为0.8%。这项研究之所以重要,并不仅仅因为其结果,而是因为它提出了一套测量偏见的方法论。按照菲茨帕特里克肤色量表对数据进行分类,并按人口统计学子群体比较错误率——这一方法此后成为AI偏见审计的标准程序。
**第二,需要决策日志与事后可追溯性。如果不记录AI为何做出某项决定、对哪些输入赋予了怎样的权重,事后验证就无从谈起。**在Andon Market的案例中,Luna回答“Felix的经验更丰富”这一判断究竟基于哪些数据,也从未被公开过。
**第三,人类的责任归属必须明确。当AI做出歧视性决策时,必须清楚谁有义务进行纠正。**这也是为什么欧盟《AI法案》、NIST AI RMF4这类治理框架都强调这一点的原因。AI不能成为责任的主体。既然如此,那么承担决策委托的组织,以及该组织中的人类责任人,就必须承担责任。
Oswarld视角
作为一个长期处理数据的人,我认为这起事件的核心在于“测量的缺失”。
偏见是数据本身潜藏的属性,但如果没有被发现,它就等同于不存在。在Andon Market这个案例中,**2美元的时薪差距从一开始就存在于数据之中,但在被测量出来之前,没有任何人能够察觉到它。**而未被测量出来的偏见,会在AI系统内部转化为学习信号,反过来再次影响下一次决策。这正是偏见得以自动放大的机制。
做过GTM战略的人应该都明白这个道理。**未被测量的指标无法得到改善,而测量方法一旦设计有误,优化的方向也会随之出错。AI治理同样如此。测量公平性绝不只是简单地增加一项KPI而已。**你需要设计:以哪个人口群体作为比较对象、采用哪种统计学意义上的公平性定义(人口统计学上的均等5?机会均等?反事实公平?),以及在哪个时间点进行测量。“Gender Shades”研究之所以具有如此深远的影响力,正是因为它第一次系统化地建立起了这套测量设计。
像Andon Market这样的实验之所以有价值,并不在于“把决策交给AI”这件事本身,而在于它揭示了委托之后所遗留的治理空白。我们真正需要回答的问题,不是“AI能否经营一家商店”,而是“AI所做出的决定该如何被测量,其结果又该由谁来负责”。
结语
我时常在看时事节目时听到这样的论调:每当出现某个不公正的判决,就会有人说“应该让人工智能来当法官”。我在几年前写过的一篇文章中也提到过,如果让深度学习形式的人工智能坐上法官的位置,我们很可能会陷入一种奇怪的境地——不得不与过去的我们自己所积累下来的偏见作斗争。人工智能并不是一个天生公正、理性、总能得出“理想且公正”结果的存在,而是一个基于人类积累下来的知识、善于组合搭配、给出最优答案的伙伴——但它同样也可能给出一个偏向于自己学得较多的那部分内容的答案。
- Andon Market中AI给女性员工更低时薪的事件,是AI偏见延伸到劳动决策领域的一个小样本。
- 偏见既是训练数据的问题,同时也是测量、审计、责任结构缺失的问题。仅仅修正数据是解决不了的。
- 真正的问题不是“AI能否做出决定”,而是**“谁来验证并为这个决定负责”**。 如果贵组织正在推进一个将决策权委托给AI的项目,请在委托之前先审视一件事:这个决定将由谁、在何时、依据什么标准来测量。如果这个答案让你无从下手,建议不妨先从NIST AI RMF的GOVERN部分读起。
参考资料与延伸阅读
核心来源
- Knight, Heather. “AI Store Manager…”, The New York Times, 2026. 这是关于Andon Market商店采访的原始报道文章。时薪差距的发现最早由这篇文章报道。
- Andon Labs. “We gave an AI a 3-year retail lease in SF and asked it to make a profit.” Andon Labs Blog, 2026. :由Andon Labs创始人亲自撰写的文章,梳理了这项实验的背景与相关伦理考量。
- Dubal, Veena B. “On Algorithmic Wage Discrimination.” Columbia Law Review 123, no. 7, 2023. :这是系统性探讨算法工资歧视结构及其法律意涵的最重要论文,从劳动与制度设计的视角阅读会很有收获。
- Buolamwini, Joy, and Timnit Gebru. “Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification.” Proceedings of Machine Learning Research 81, 2018, 77–91. :这是AI偏见审计方法论的起点性论文,很适合作为展示测量设计为何重要的案例。
背景知识
- Dastin, Jeffrey. “Amazon Scraps Secret AI Recruiting Tool That Showed Bias Against Women.” Reuters, 2018. :这是亚马逊招聘AI被废弃事件的第一手报道,是AI偏见案例中的经典之作。
- National Institute of Standards and Technology. AI Risk Management Framework (AI RMF 1.0). NIST AI 100-1, 2023. :这是AI治理领域的标准框架,建议从MEASURE部分读起,可以立刻与今天的内容联系起来。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。
注释
-
Indeed.com(Indeed)是全球排名第一的求职与招聘信息搜索引擎,提供在众多网站、招聘公告板、企业招聘页面上发布的招聘信息的一站式检索功能,目前在包括韩国在内的约60多个国家运营服务。 ↩
-
算法工资歧视(Algorithmic Wage Discrimination):指AI按劳动者个人自动核算不同时薪的做法。即便在相同时间从事相同工作,薪酬也可能因数据不同而产生差异。这一现象最早在Uber、Lyft等零工经济平台上被系统性地报道出来。 ↩
-
AI治理(AI Governance):指管理AI系统开发、引入与运营的组织层面的程序与责任结构。这不仅仅是使用AI,而是要确定如何负责任地使用AI。 ↩
-
NIST AI RMF(AI Risk Management Framework):由美国国家标准与技术研究院(NIST)发布的AI风险管理框架。由GOVERN、MAP、MEASURE、MANAGE四大功能构成,目前事实上已成为AI治理领域的国际标准。 ↩
-
人口统计学上的均等(Demographic Parity):一种公平性定义,要求AI的决策在不同性别、种族等人口群体之间产生相同比例的正面结果。这是众多用于测量公平性的数学定义之一。 ↩
