第 12 章
算法继承的偏见
“这个量表,坦率地说,不允许测量智力。”
这话是阿尔弗雷德·比奈说的。原话写在他的量表出版之后,当时他正眼看着自己发明的工具被翻译成多种语言,被送去筛选学童、分类士兵、切断一些人永远没有机会走上的路。他想把自己和这个势头撕开,于是又写下一句:智力不是一个固定不变的数字,它不是靠一次测试就能定死的。
说书人得先把这句旧话搁在这里。因为一百一十三年后,当上海冰箱门上的成绩单还没被撕下来,旧金山湾区已经有人把比奈最怕的那件事推进到了他根本认不出来的程度。算法不再需要你去考场,不再给你看任何分数,甚至不通知你它已经把你从某个机会里删掉了。中国家长还在用排名表丈量孩子时,硅谷的工程师已经把整本命运判决书写成了代码。这些代码不会告诉你它写了什么,不会给你看你的“分数”。它只是静默地把你放进了一个不被录取的文件夹。
这当中隔着一百多年。要看清当中出了什么事,得从一桩被悄悄处理掉的公案入手。2018年,亚马逊公司悄悄废弃了一套用人工智能筛选求职者简历的系统。注意这两个字——“悄悄”。
不是宣布错了然后公开道歉,不是招来媒体开发布会。就是内部发现不对,内部决定停用,外面的人过了很久才从几篇报道里拼出整件事的轮廓。
现在让我们把这件事拆开。2018年,亚马逊的工程师当时想做一个自动化工具,把公司堆积如山的简历筛选工作交给机器。你投过简历就知道,大公司每年收到几十万份申请,人力资源部门根本看不过来。亚马逊想着,让机器先筛一遍,把最可能被录用的那一批人挑出来,剩下的人力筛掉,效率提升,成本下降。
这套系统用了一个当时听上去很先进的办法:它学习了过去十年亚马逊招聘员工的数据。过去十年里,亚马逊录用了哪些人?他们的简历长什么样?他们后来哪些人表现不错,哪些人不怎么样?算法就拿这些数据当原料,自己“琢磨”出一个打分模型。新来的简历送进去,模型给它一个分数。分数高,进面试。分数低,没人会再看你一眼。
理论上,这比人工筛选快得多,也比人稳定得多。人看简历会累,会烦,会受情绪影响,会看到一个名字像自己大学同学就多给两分。机器不会。
机器只认数据。可问题恰恰出在数据上。工程师们很快发现,这套算法给女性求职者打的分,系统性地低于男性。这不是说某个女性运气不好,被机器误伤了。而是说这个模型学会了:工程师这个职位,女人不那么合适。
它怎么学会的?因为它学习的那十年招聘记录里,亚马逊招的程序员绝大多数是男性。这背后的原因很多——有行业结构的问题,有招聘文化的问题,有早期科技行业性别失衡的问题。但不管什么原因,这十年的历史数据里藏着一个事实:在亚马逊过去录用的技术人员里,男性占比压倒性地高。
算法看到这一点之后,做了一个再简单不过的推理:既然过去录用的人大多是男性,那么现在申请的人里,男性更有“潜力”。于是它把简历里“女性”的信号提取了出来。这个信号可能藏得很间接。简历上写着“女子大学”,写着“女生编程社团”,甚至只是某个女性化的名字。算法不必直接理解“性别”这个词。它只要发现,凡是带着这些信号的简历,十年里被录用的概率更低,然后它就给这些简历打更低的分。
亚马逊的工程师发现问题之后,试图修正它。报道提到他们曾尝试去掉某些与性别直接相关的字段,可是算法总能从其他信号里重新学到偏见。最后亚马逊决定,把这套东西废弃掉。注意,废弃的不是整个招聘,也不是所有人工智能工具,而是这一套用来筛选技术岗位简历的系统。亚马逊继续用其他自动化工具做别的事情。
这个“悄悄废弃”的动作,把一个观念推到了台前。算法没有发明性别歧视,它只是把历史上的歧视翻译成了数学语言,然后自动化了。这不是亚马逊一家公司的事。这也不是一个技术故障。这是一个逻辑被推进到了新阶段。
要看清这个逻辑,得先离开西雅图的办公楼,去旧金山湾区。委托书写这个故事的人,通常会找那些真的被算法拒绝过的人。可这里有一个麻烦:被算法拒绝的人,几乎都拿不到自己被拒绝的证据。路透社报道亚马逊事件之后,很多科技公司的人开始回想,自己过去一年投的那些简历都去了哪里。其中一位女性软件工程师在旧金山找工作时,投过几百份简历,大多数石沉大海。
她不是刚入行的新手,有几年iOS开发经验,上两家公司都能写出说得出口的项目。可她每次打开招聘网站,看到的状态不是“已查看”就是毫无消息。有些平台会显示“您的简历已进入人才库”,之后就再没有下文。她后来换了一家不从主流通用招聘平台收简历、也不用AI工具做初筛的小公司,面试很快通过,进去以后半年就成了技术负责人。她到现在也不知道,此前几百份简历为什么被刷掉,是不是都折在算法手里。更可能的是,永远不会知道。
这不是一个孤例。2018年亚马逊事件之后,美国媒体开始大量报道算法招聘的案例。它们有的来自大公司内部流出的备忘录,有的来自被拒绝者鼓起勇气去追问得到的碎片信息。
但即便亚马逊这样被报道得最充分的事件,外界拿到的也只是二手转述。算法没有提供解释。它不给任何人发一封邮件说:“你的简历因为以下三个原因被打低分。”它不是人,不需要面对质疑。被拒绝的人,只能把愤怒发在投诉栏里,或者像社交媒体上那样发一条“又一次被机刷了”的帖子。问题来了。
为什么说这套算法是智商测试的直系后代?证据链得从二十世纪初比奈量表的教育筛查功能开始。智商测试一开始就是给人分类的工具。测出数字以后,学校把学生分进快班慢班,军队把士兵分到技术岗位还是后勤。IQ分数越被相信是“客观能力”,它就越有权力决定一个人该得到什么。
后来这种量化分类从学校和军队走到企业招聘。二战后,美国企业大规模采用能力测试,把应聘者分出等级。再后来,计算机技术来了。最早用计算机辅助招聘的公司,只是把纸面上的分数数字化,换成电子表格,再换成数据库。
到2010年代,人工智能技术普及之后,这个链条上最后一个环节被打通了:测试、打分、分类、拒绝,全部不再需要人出面。在这个意义上,AI招聘算法就是智商测试换了一副面孔,把比奈那个“一次测试不能定义一个人”的警告彻底反过来做成了产品。
这个谱系不是凭空搭的。看美国招聘测试的历史就知道,它从来不是纯技术问题。
二十世纪七十年代,美国最高法院在一宗著名的雇佣歧视案里说,企业可以测试,但测试必须与工作相关。这句话本来是给被歧视的求职者一个申诉入口。可到了算法时代,这个入口被堵上了。工作相关不相关,你没法问算法。你连算法考了你什么都未必知道。
再往深看一层,算法招聘继承了智商测试的另一项遗产。智商测试最成功的地方,不在于测出了什么,而在于让人们相信它测出的是“真实能力”。算法也一样。
2018年以前,市面上已经有一整条产业链在贩卖“人工智能筛选”服务。供应商会告诉企业,自己的模型能从几万份简历里挑出最有潜力的人,能识别出“高效沟通者”“团队协作者”“自驱型人才”。企业听得很舒服,因为机器说话时带着科学的腔调,还不需要休息,不闹情绪,也没有工会。可这套科学腔调下面铺着的数据,往往就是企业历史上已经存在的招聘偏见。算法没有发明偏见,它只负责把偏见自动化。
把这件事说成“科学”之后,最危险的事情发生了:本来可以被追责的歧视,现在被中性化成了一个技术参数问题。
具体到亚马逊案,最值得留意的细节,不是工程师发现了偏见,也不是公司废弃了系统,而是这件事从发现到停用,整个处理过程在黑箱内完成。亚马逊没有发布完整的技术报告,没有公开模型代码,没有说明到底哪些信号让算法学会了性别歧视,也没有建立一套让被拒绝者申请复查的机制。公众最终能知道这件事,是因为有记者挖出了内部消息源。如果没人泄露呢?如果记者没有追呢?那这套系统可能还在某个服务器里运行,继续给女性打低分。
这就是算法比智商测试更不透明的地方。在智商测试时代,你至少知道自己被测试了。老师把你叫到办公室,给你一张卷子。或者招工时,人事给你一本题目。你知道有分数这回事。如果你觉得不公平,可以提出重测,或者至少知道该骂谁。
算法不一样。它可能在你完全不知情的时候已经评估过你。你刷抖音,刷招聘软件,填写资料,同意那些没人读的用户协议。
在这些动作里,系统已经根据你的点击速度、停留时间、输入习惯、浏览器型号,甚至你填写手机号的位数,给你打了一个分。你不知道有这个分。不知道标准是什么。更不知道谁写了这些标准。
当命运判决书变成了一行你看不到的代码,抵抗就变得几乎不可能。要理解这种抵抗的消失,得看一个更细的现场。
算法招聘在2018年亚马逊事件之前,已经经历过一次重要的变体:从智商测试式的“能力题”,转向所谓“五大人格测试”和“游戏化测评”。许多大公司在网申阶段不发智商题了,他们让你玩游戏。屏幕上出现一个反应速度测试,给你一张图,让你找出哪个形状不一样,或者让你在四十分钟内完成一套选择题。题目看起来无关工作,但背后的逻辑老得不能再老。它是把心理测量工具数字化,把原先放在心理学实验室里的量表,塞进一个用户界面里。你以为在玩游戏,其实每一毫秒的延迟都被记了下来。你选哪个颜色、先看哪里、用鼠标还是键盘,都可能成为算法的输入。
这种测评比智商测试更隐蔽,因为没人会告诉你:这不是游戏,这是测试。游戏化测评这个领域里,有一种流行的做法是把人的反应时间和行为轨迹与“五大人格”挂钩。比如你有没有耐心、是不是尽责、遇到困难会不会轻易放弃。这些概念听上去科学,但在法律和心理学里长期存在争议。尤其是某些行为数据能否代表人格,本身就缺乏严格的因果证据。
但供应商不会跟你讨论这些。他们给企业讲的故事是:我们的算法能帮你找到“契合企业文化的员工”。这句话里有一个词很关键:“企业文化契合”。这个词下面,往往藏着一堆拒绝的理由:说话方式、生活习惯、甚至和既有团队成员的相似程度。
算法把“文化契合”变成了可计算的相似度。你和一个平均员工画像差得远,分数就低。这个画像极容易继承企业既有的隐性排斥。到了这一步,算法招聘已经不只是筛选能力,它开始筛选“像不像自己”。这正是二十世纪初美国企业招聘测试里曾出现过的逻辑:不是看你能不能干活,而是看你是不是“我们这样的人”。
当时是人事经理用眼睛和表格判断,今天是算法用历史数据判断。手段变了,结果没变。
现在需要正面回答一个反方解释。有人会说,智商测试纵有滥用历史,它的核心测的是一种真实且稳定的认知能力,学界叫它“g因子”。这个g因子对个体和群体表现有预测效度,所以被广泛采用是理性选择。算法招聘也一样,它如果能让企业降低招聘成本、提高留存率,那就不只是偏见,而是有效率的工具。
这个说法不能简单否定。智商测试确实在很多场景下能预测某些表现。问题从来不在于“有没有预测力”,而在于这个预测力是从哪里来的、被谁使用、用来决定什么。一个测试可以预测学生在标准课堂里的成绩,因为那套课堂本身就被设计成和测试相似的样子。它预测的不一定是“智力”,而是一种在既定制度里更容易成功的能力。
算法也一样。算法能从历史数据里学到的,不只是什么素质能带来好表现,也包括了谁更可能在旧有制度里被接纳。它的“预测力”有很大一部分来自历史的惯性,而不是来自对一个抽象能力的准确测量。
换句话说,它预测的不是你这个人能做什么,而是你在复制旧秩序的系统里会被怎么对待。再往深一步,这套预测被误认为“事实”。所谓命运技术,就是把人的复杂潜能转化为单一数字标签,并据此分配生命机会的社会技术装置。智商测试是这个装置的经典形态。算法招聘是它的升级版。
它们共享同一个底层操作:先把你变成一个数字,再把这个数字送回社会,让它替你领取机会或者关闭机会。区别只在于算法比智商测试更不透明、更难质疑、更擅长把偏见伪装成科学。
“伪装”这个词,需要一点很克制的证据。亚马逊案之后,美国国会的一些听证会开始讨论算法招聘的公平问题。议员们问得最多的一个问题是:这套算法的标准是什么?企业代表大多回答:这是商业机密,是专利技术,不能公开。欧盟也动了起来。2018年,欧盟《通用数据保护条例》生效,其中有一条规定:如果某一项自动决策对个人产生重大影响,个人有权要求人工介入。这条规定看起来给被算法拒绝的人开了一个口子。
可真要行使这个权利,你得先证明自己受到了“重大影响”,还得让企业承认它确实用了自动决策。很多企业根本不会告诉你它用的是不是算法。美国方面,平等就业机会委员会后来提出了一些技术指引,但要证明一个算法有偏见,你必须先看到它的内部逻辑。算法是商业机密,这个内部逻辑被锁在企业的私有服务器里。法律要触及它,比触及一张考试卷难得多。
这个困境不是理论推演,它有具体的制度现场。以美国为例,现行反歧视法律的起点是“差别待遇”和“差别影响”。如果一个企业的招聘工具对某个受保护群体造成不成比例的不利影响,企业有义务证明这个工具与工作相关。但算法的不透明使得求职者连第一步都迈不出去:我连这个工具怎么打分都不知道,我怎么证明它歧视了我?
在亚马逊案里,歧视是工程师内部发现的,公司主动停用的。如果工程师不查呢?如果公司不承认呢?外界几乎无路可走。
这就是算法继承的偏见最锋利的那一面:它把你变成数字的时候,不给你发票;它在决定你命运的时候,不给你证据。
以前智商测试至少是个看得见的仪式,有测试日期,有分值,有报告。你拿着分数可以去找心理医生说,这个测试有问题,或者找律师说,这个选拔不公平。现在这套仪式消失了。测试不再有清晰入口,分数不再有可读报告,标准不再有公开文件。留下的只是一个通知:很遗憾,我们没有继续推进你的申请。
还有一个变化,比上面这些都更隐蔽。算法不但筛选人,它还训练人。当越来越多的企业用同一种算法逻辑筛选求职者时,求职者也开始适应这套逻辑。简历怎么写、关键词怎么堆、在什么时间投递、在招聘网站上停留多久,都成了“优化”的对象。你不再把自己当成一个复杂的人去争取一份工作,而是把自己当成一组可调整的参数,去拟合一个你不知道的模型。
这个画面是不是很熟悉?就像曾经的学生被训练成考试机器,熟悉题型、掌握时间分配、知道哪些题目放弃、哪些题目死磕。现在求职者也成了“算法考生”,但这一次,没有教材,没有真题,没有分数线。只有一套在后台不断迭代的评估标准。这里可以稍微回望一下上海。
上一章说到上海PISA第一折射出的数字信仰。中国那套以考试排名为核心的教育筛选,如果放到算法时代的延长线上看,其实一直是一个透明度较高的命运技术。它有卷子,有分数,有排名表,有贴在冰箱上的成绩单。你会痛苦、会焦虑,但你知道自己在被什么评估。它甚至提供了一整套应试策略让你去对付它。
而硅谷的算法评分不一样。它什么也不提供,连被评估这件事本身都藏了起来。
从上海的分数到硅谷的算法,命运技术在透明度上完成了一次后退。这个后退,也像一次升级:曾经人们知道数字在统治自己,后来人们连数字在哪里都看不见了。
这个后退的过程,也和智商测试的历史走势重合。比奈量表诞生之初,法国教育部用它筛选学习困难儿童,测试是公开的制度工具。后来美国人把它变成智商分数,用来给移民排队。再后来英国用它分配小学名额,决定谁进文法学校。每一步,测试都越来越有权力,也越来越标准化,但至少受试者还站在考场里。到了算法时代,这一步跨出去了:考场没了,试卷没了,连监考老师都没了。
唯一剩下的,是那个数字继续决定人们的命运。那么,算法继承的偏见,最后落在哪里?
可以把镜头移到一家普通公司的人力资源部门。时间设在2020年代。招聘经理每天打开系统,看到算法推荐的候选人列表。排名前十的人被约来面试。系统同时列出一份“质量分析报告”:这些候选人的留存率预测、绩效评分预测、文化契合度评分。经理不需要知道这些分数怎么来,他只要知道,系统是某家知名科技公司提供的AI方案,模型由海量数据训练,说准确率很高。他点了一下“开始面试”。
而那些没有被推荐的简历,根本不会出现在他的屏幕上。它们进了某一个数据库,标着“未通过”。这个标签是谁给的?算法。为什么给?不知道。有没有解释?没有。
这个画面不是哪一家公司的特例,而是算法招聘普及之后的标准工作流。它的可怕之处不在于哪个工程师写了坏代码,而在于每一个环节都合理:企业需要效率,系统提供效率;企业需要预测,算法提供预测;企业需要客观,数字看着就客观。合理,顺畅,无法挑战。
2019年1月,梁世宗应柳演锡、孙浩俊邀请,和崔智友一起成了《Coffee Friends》的固定成员。他们在济州岛一间旧仓库改成的咖啡店里忙前忙后,手冲咖啡、烤橘子酱吐司、端盘子。店里没有收银机,没有扫码枪,只有一个玻璃罐,客人想给多少就给多少。营业所得最后全部捐出去。说书人把这件事提出来,不是要聊综艺。你注意这间咖啡店里的支付方式:客人喝了一杯咖啡,自己估一个价,把钱放进罐子。
没有算法在后台监控他喝了多少口、咀嚼速度是多少、是否把餐巾纸折成某种形状。没有人给他打“慷慨指数”或者“善行潜力分”。评价是公开的,行动是自愿的,结果也是透明的——营业结束,钱有多少,捐到哪里,看得见。这个画面很轻,可它偏偏和同一时期另一套评估体系形成了死硬的对照。
就在这间不设收银机的咖啡店开门营业前后,旧金山湾区那些失眠的求职者正躺在床上刷招聘软件。他们不知道,自己每一次点击“立即申请”,每一次修改简历里的某一个副词,甚至每次把手机从床头拿到洗手台再拿回来时的停留时长,都可能被记录下来,喂进一个他们永远看不到的模型。那个模型不会像济州岛的玻璃罐一样摆在台面上。它藏在人力资源供应商的服务器里,替企业决定哪些人值得被看见。客人把钱放进罐子是自愿的;求职者把数据交出去,是因为如果不点“同意”,他连下一步页面都进不去。透明和黑箱,在2019年初的这两个场景里各自运转。
我们可以顺着这个对照,重新看一遍2018年亚马逊悄悄废弃的那套AI招聘系统。它学习的是过去十年的招聘数据,而这些数据里,男性程序员占了压倒性多数。算法没有“发明”性别歧视,它只是把历史里已经写下的偏见,翻译成了一条条权重。比这更麻烦的是,当工程师尝试修正时,算法总能从别的信号里重新拼出一个“不选女性”的代用逻辑。女子大学、女生编程社团、甚至某个拼写上更常见的女性名字,都可能成为新的负面权重。亚马逊最后把这个系统停掉了,但没有公开完整的出错路径。它停掉一个模型,不代表它停下了其他模型。它停掉的,只是外界偶然知道的一件。
这个“偶然知道”,恰恰是抵抗消失时的具体形状。2019年之后,欧洲有求职者试图援引《通用数据保护条例》里的“人工介入”条款,要求企业解释为什么自己连面试都没进。企业通常只回一封模板邮件:感谢申请,已进入人才库。没有哪一行写着你被算法打了多少分、标准是什么。如果你追问,对方可能说这是商业机密,或者干脆不再回复。
美国那边也一样。要想起诉算法歧视,你得先证明算法确实歧视了你;要证明算法歧视,你得先看到算法内部怎么打分;要看算法内部,你就撞上商业机密和代码闭源。法律刚伸出手,手腕就被一根看不到的线扣住了。这不是哪个法官不愿意管,而是整套程序在设计时就没有给被评估者留下取证的口子。
更隐蔽的压力发生在求职者自己身上。因为不知道算法看什么,人们只能猜。有人开始花钱买“简历优化”服务,依照网上流传的关键词表把简历改得不像自己。有人在深夜反复调整领英页面的第一句话,只因为听说“全栈”“自驱”“跨职能协作”这几个词能提高匹配分。还有人学习怎么把游戏化测评玩出高分——不是提高工作能力,而是训练自己迎合一套看不见的题目。这和一百年前学生反复做智力测验真题没什么两样,只不过那时你知道自己在准备一场考试,现在你连考卷长什么样都不知道,却已经在复习了。
这就是命运技术在二十一世纪的新形态。说书人得在这里停一下,做一个判断。
IQ测试的故事没有结束。它只是换了一副面孔。从比奈的量表到亚马逊的算法,一百多年来,人们一直在做同一件事:把人变成数字,然后用数字决定人的命运。区别在于,比奈至少警告过我们不要这样做。而算法不警告任何人。
它只是在后台运行,安静地给每个人打分,安静地把历史上积累下来的偏见原封不动地搬进下一轮筛选。你永远不会知道自己被打了多少分。你只会收到一封模板邮件:感谢您的申请,很遗憾我们无法继续。这就是算法继承的偏见。
而这个时候,智商测试的跨国传播已经在大半个世纪前埋下了更深的制度性伏笔。那些在美国和欧洲形成的量化分类逻辑,被翻译、被改造,被带到完全不同的社会和政治土壤里。当一套决定人命运的工具不再给你证据时,你拿什么去反对它?法律刚伸出手,就撞上了商业机密和算法黑箱。企业可以废弃一个系统,但不需要解释为什么废弃;可以继续用另一个系统,但不需要告诉你它在运行。
被拒绝的人仍然不知道自己的简历上少了什么关键词,自己的游戏操作里暴露了什么“缺陷”。这个压力,悬在亚马逊案之后,至今没有落地。