第 21 章
雇主的量尺
“过去,人是第一位的;未来,制度必须是第一位的。”这句话出自弗雷德里克·泰勒的《科学管理原理》,后来被美国企业人事部门印在培训手册里、贴在招聘办公室的墙上,比泰勒当年站在车床边说这句话的时候更冷。泰勒原本说的是工厂,要摆脱对老师傅个人手艺和性子的依赖。等它传到战后那些大公司的人事部,意思就变了:招聘和晋升要摆脱主管的好恶、熟人的请托、族裔关系的纠缠。制度怎么才能摆在第一位?
你先得有一把尺,能把人量成可以互相比较的数字。二十世纪中叶以后,美国大型企业开始把智力测验用于招聘和晋升,尤其是文职岗位和管理培训生项目。电话公司是动手最早、用得最狠的一批。那时候,贝尔系统刚刚经历战后的扩张,电话用户猛增,线路要架,设备要换,接线员和基层主管的缺口大得惊人。
人事部门不可能一个一个去认识申请者。他们需要一道快速、便宜、看起来又公正的筛选程序。纸笔测验正好摆在手边。但先别看表格。表格前面站着人。
一个从太平洋战场回来的退伍兵,回到伊利诺伊州,手里有高中文凭,在军队里做过几年信号兵。他到电话公司应聘基层主管。人事部没有问他爬过什么样的电线杆、带过什么样的兵,只让他参加一项能力测验。几天后,名单出来,主管培训那一栏没有他。
分数不够。他也许能看懂一张复杂的线路图,也许能在暴风雪夜里把一组抢修工组织起来,但这些都不在试卷上。试卷考的是词汇对应、数字规律、图形补缺。分数把他留在了基础岗位那一列。主管那扇门没有开。
这个人的名字不必记,因为同样的故事在战后的电话公司、保险公司、银行和制造企业里重复了成千上万次。人事档案里留下的不是这个人,而是一行分数、一个岗位代码、一个“晋升资格不足”的结论。我们不知道他后来去了哪里。也许他继续做基础岗位,也许他走了。但有一点很清楚:学校如果给过他一张低分标签,企业现在又给他一张。两张标签叠在一起,看起来就像他本来就只有那么宽的可能性。社会看到这个结果,反而说,分数早就显示过了。
企业难道不知道测验不准吗?他们为什么非要用一把不太准的尺子?这个问题问到了点上。
回答它,不能从测验本身说起,得从人事部的一张桌子和一堆申请表说起。战前,美国大企业招人靠什么?熟人推荐、亲戚担保、主管认识、族裔网络。电话公司里面,父亲是线务员,儿子也容易进去;爱尔兰工头带爱尔兰小伙子,意大利领班介绍意大利邻居。
这种挑法有两个问题:第一,它不科学;第二,它容易惹麻烦。不科学意味着效率低,一个人可能只是因为认识某人就被录用,也可能因为不认识谁就被拒掉。惹麻烦意味着,一旦公众开始追问公平,这种看人下菜碟的选法就站不住脚。
企业真正想要的,是一种能快速分类、看起来又公平的方法。智力测验正好递到了手边。这把尺子不是企业自己发明的。
十九世纪末二十世纪初,美国工业界开始热心地引入“科学管理”。泰勒在工厂里拿秒表测动作,把工人拆成一组一组的动作,目的是让生产更有效率。泰勒之后,心理学家也想把自己的实验室方法用到工厂。
哈佛的雨果·闵斯特伯格在《心理学与工业效率》里说,要建立一门介于实验室心理学与经济问题之间的新科学。他研究电车司机怎么注意路况,电话接线员怎么听清号码,然后说:心理测验可以帮助企业挑选最合适的人。
那是1913年。那时候比奈量表刚刚进入美国,心理学家正急着证明这门科学有用。第一次世界大战帮了他们一个大忙。
美国陆军要迅速把几百万新兵分到合适的岗位,心理学家带着团体智力测验进了军营。陆军甲种测验、乙种测验,能写字的人考一套,不识字的人考另一套。战争结束后,心理学家们带着名声和测验材料回到民间。学校先接了过去,企业随后跟进。
1920年代开始,一些公用事业公司、保险公司和银行开始用纸笔测验招文员、推销员和基层管理人员。到了三四十年代,测验公司已经能提供现成的“人事分类测验”,把陆军那套词汇、算术、图形推理重新包装,卖给企业人事部门。翁德利克人事测验就是其中一种,薄薄一页,几分钟就可以考完,分数马上能算出来。
企业喜欢它,不是因为准,而是因为快。这时候,企业使用测验的逻辑已经很清楚了。
他们不是真的相信智力测验能预言一个接线员以后会不会迟到、会不会和顾客吵架。他们真正想要的,是标准化。标准化意味着:同一个岗位,所有申请者做同样的题,按同样的时间,用同样的答案键评分。录用不录用,看分数。
这样,主管个人的偏见至少从程序上被排除了一部分。经理也可以向上级交代:不是我不要他,是分数没到线。如果出了纠纷,企业可以拿出一张试卷和一份评分表,说这是客观的。
测验成了一套抵御人情压力的技术装置。这个装置正是“命运技术”的职场形态。所谓命运技术,是把人的复杂潜能转化为一个单一数字标签,然后依据这个标签分配生命机会的社会技术。
学校用它分轨,军队用它分兵种,企业则用它分岗位、分晋升、分收入。量化分类在这里体现得最赤裸:连续的认知能力分布,本来没有清晰的界线,却被划成“合格”和“不合格”。线划在哪里,谁划的,却很少被追问。电话公司是最典型的。
战后贝尔系统需要大量的接线员和基层主管。接线员这个岗位,需要听清声音、记住号码、在压力下快速反应。基层主管还要读工作单、写报告、管理一个小班组。
电话公司的人事部门设计了一组测验,有的考听力记忆,有的考语词和算术,有的考图形逻辑。然后他们根据分数把申请者分成几档。最高一档进入主管培训,中间一档可以做技术岗位,最低一档只能做最基础的接线,或者直接淘汰。
这里有一个关键问题:这些测验真的能预测工作表现吗?后来的工业心理学研究反复证明,纸笔智力测验对大多数文职和蓝领岗位的工作表现预测力相当有限。它确实能测到一些东西,尤其是语言、运算和抽象推理方面的差异;对于那些复杂程度较高的管理岗位,智力分数也许有些许预测价值。
但它远没有企业宣传的那么准。一个接线员能不能耐心听一个愤怒的顾客抱怨,能不能记住一个号码,和他在词汇测验里选出哪个词最接近“快速”的同义词,相关性很弱。一个基层主管能不能让班组里的人愿意跟他干,和图形推理分数几乎没有关系。
心理学家后来发展出更好的人事筛选方法,比如结构化面试、工作样本测试、情境判断测试,正是因为智力测验在很多岗位上的预测效度不够。那企业为什么还用?
因为效度不是企业最看重的东西。企业最看重的,是测验作为一种组织工具的功能。它快,便宜,能大规模实施,能产生一个看起来精确的分数。
战后的人事经理面对的不是几十个申请者,而是几百个、几千个。他们需要一种方式,能把人迅速分流。这时候,论文里关于效度的争论对他们来说太书生气。他们要的是可比性、可记录性、可防身性。分数就是最好的选择。
我们不妨把话说得再白一点:企业采用智力测验,并不是因为测验能准确预测工作表现,而是因为它提供了一种看似公平、可标准化、能抵御人情压力的筛选方式。这是本章的核心判断,也是理解后来一连串法律纠纷的钥匙。说企业拿测验当盾牌,不是后来的事。美国文官委员会的初级文职岗位考试,早就用了类似的纸笔测验。十九世纪末的文官改革,本来是为了打破政党分肥,让政府职位不再靠关系分配。
到了二十世纪,文官考试大量采用智力测验和一般能力测验,用来筛选书记员、打字员、邮务人员。那个逻辑和电话公司如出一辙:考试不会看你的出身,只会看你的分数。听起来很公正。
但它也带来一个问题:如果分数本身偏向某些家庭、某些学校、某些语言背景,那么“客观”就成了一种新的偏袒。这一点,我们在前面讲埃利斯岛移民检查站的时候已经说过。
1910年代,那些意大利和犹太移民在纽约港口被测出“弱智”,不是因为他们笨,而是因为他们不懂英语、不熟悉美国中产阶级的文化套路。当时用来测移民的量表里,有许多题目是土生土长的美国孩子才会答的。分数低的人被挡在国门外。到了企业里,类似的事情发生了,只不过国门换成了公司大门。
测验的题目、语言和出题人的假设,本身就带着教育和文化的筛选。一个在南方黑人学校里读完高中的年轻人,和一个在城郊白人学校里读完高中的年轻人,面对的可能是同一份词汇测验,但他们获得词汇的环境完全不同。分数把他们分成两列,企业却说这是能力差异。
这就是“公平包装排斥”的最典型细节。企业培训手册里印着“客观筛选”四个字,但没有人告诉你,那套试题是从哪个群体身上标准化出来的。人事部门的墙上贴着“不论种族、信仰、出身”,但淘汰名单上的颜色却总是扎眼。
泰勒说的“制度必须是第一位的”,在这里变成了一个悖论:制度并没有消灭偏见,它只是把偏见藏进了分数里。1960年代的民权运动改变了游戏规则。
1964年《民权法案》第七条禁止就业中的种族、肤色、宗教、性别和民族血统歧视。企业不再能公开在招聘广告里写“只限白人”,也不再能随意用主管的“直觉”把黑人申请者拒之门外。表面上看,这是测验的好日子:既然不能凭肤色筛人,那就凭分数。分数不看肤色,只看答案。
于是,大型企业反而更依赖测验分数来证明招聘决策的客观性。测验公司的生意更好了。但很快,人们发现分数也会筛出肤色。民权活动人士和律师开始收集企业雇佣数据,发现一个刺眼的规律:在同样的岗位测验中,黑人申请者的淘汰率远高于白人申请者。
有时是两倍,有时更高。企业耸耸肩,说分数面前人人平等。他们说:我们不看肤色,我们只看分数。低分的人,无论黑白,都会被淘汰。这个说法在逻辑上无懈可击,但它避开了另一个问题:低分是怎么来的?如果分数主要是教育和环境的产物,那么用分数筛人,就是把历史的不公输入到新的雇佣决定里。
这正是学校慢班故事的延伸。那些被分进慢班的孩子,课程更浅、作业更简单、对自己能力的估计更低,毕业时拿到的文凭和技能信号已经比快班的孩子窄。他们带着这些信号走进就业市场,企业的人事部门再用一份测验把他们筛一遍。结果出来,低分者集中在那些被慢班、被差学校、被资源不足的社区标记过的人身上。社会看到了这个结果,却说:看吧,他们本来就只有那么宽的可能性。
慢班标签在毕业时转化为文凭类型和技能信号,又在企业测验里转化为分数和晋升门槛。这是一条完整的转化链。有一次,民权调查人员翻看一家电话公司的人事记录,发现主管培训名单上几乎全是白人,而接线员名单里黑人占了很大比例。
公司说,这是测验分数自然分布的结果。调查人员问,你们的测验在哪里标准化过?
效度数据在哪里?公司拿不出多少可靠的证据。那套测验能预测主管工作表现吗?也说不清。它只是沿用多年,最初由某个咨询公司卖给公司,后来就再也没有人追问过。
这就是“客观筛选”的底子:分数是客观的,但分数的社会含义不是。这里需要停下来做一个公平的回应。有人会说,智商测验虽然在历史上有滥用,但它确实测到了某种真实而稳定的认知能力。心理学家称之为g因子。这个g因子在个体身上相对稳定,对教育成就和一些复杂工作有预测力。
企业采用它,是不是也可以看作一种理性选择?我们不能简单否认这个说法。智力测验确实不是完全无效。一个在词汇、算术和抽象推理上得分很高的人,在那些需要大量阅读、计算和计划的管理岗位上,平均而言也许会比得分很低的人表现好一些。这个“平均而言”不是零。但问题在于,企业大量使用智力测验的地方,恰恰不是那些复杂管理岗位,而是门槛较低、标准化程度较高的文职和蓝领岗位。
接线员、文书、邮务、收银、仓库记录员。对这些岗位,一般智力分数的预测效度并不高。
更重要的是,企业用人决策是高风险、低反馈的:一个被测验淘汰的人,我们永远不知道他如果被录用会表现如何。企业很少去追踪那些被分数挡在门外的人。结果,分数看起来一直是对的,因为只有被分数选中的人才有机会产生工作表现。这又是一个自我实现的闭环,和学校里慢班的逻辑一样。
所以,企业采用测验,不能完全解释为理性的能力预测。更准确的说法是,测验让企业在合法性和效率之间找到了一个平衡点。它给人留下了科学管理的印象,又帮企业避开了一个更麻烦的问题:如果不用分数,用什么?
用主管的推荐、老员工的担保、人事经理的面谈?那些东西更容易被指责为私相授受。分数不会说话,但分数可以存档,可以在法庭上摆出来。它把录用决定从人的手里,转移到一张试卷的手里。于是企业主和人事经理都觉得松了一口气。这里有必要把镜头拉回一个具体的人身上。
战后的电话公司里,有这样一类员工:他们从战场上回来,身上带着军队教会的纪律和岗位经验。一个在太平洋岛屿上架过通讯线路的通讯兵,退伍后进了电话公司的线路维修组;一个在陆军通讯队做过接线员的年轻人,回来以后接着干接线。这些人对电话通讯的活儿并不陌生,有的人甚至比那些从大学直接招进来的管理培训生更熟悉机房和设备。但他们大多没有上过完整的中学,或者在军队里只受过技术训练,没有受过那种坐在课桌前、限时涂答题卡的训练。
公司要提拔基层主管了。考试那天,他们坐在公司的培训教室里,面前是一本印着选择题的小册子。题目问的是词汇、图形排列、数字推理。没有一道题问到线路故障该优先怎么处置,也没有一道题问到夜班人手不够时该先通知哪一个分局。一个干了四年接线员的退伍兵,考完出来,以为自己已经尽力。几周后名单贴出来,名字不在上面。人事处找他去谈话,说的不是他工作不好,而是分数差了几分。他问,哪几分?人事处说,语言推理那一项。他再问,这和接电话有什么关系?
人事处没有回答,只说标准是统一的。这个人的故事没有被记进心理学史,也没有成为某本畅销书的第一章。但它在那几万份人事档案里反复出现。不是一个人,而是一批人。
他们没有在战争中掉队,却在公司的晋升阶梯前被一张试卷挡住。他们不是不能干,只是不擅长那套考法。企业并不需要为他们修改标准,因为分数就是标准。工业心理学的发展给这套做法提供了理论基础。
这门学科在第一次世界大战前后开始在美国大学里成形。最初的研究者们怀着很大的雄心,要把心理学从实验室带进工厂和军队。他们设计测验、建立常模、写报告,告诉管理者如何把合适的人放在合适的位置上。这些心理学家的初衷未必是恶的。
他们相信,测量可以帮助企业减少浪费,帮助工人找到适合的岗位。但他们也带来了一个副产品:把人的可雇用性转化成一条正态分布曲线上的位置。到了战后,工业心理学从学院走进了咨询公司。一些测试出版商开始向大型企业推销成套的人事测验。
他们提供的产品非常简单:付一笔钱,就能买到试卷、答题卡、评分标准和一份“职业能力剖面图”。人事部门不需要懂因素分析,也不需要读过斯皮尔曼的论文,只要照着手册打分,把分数填进表格,然后把低分者的申请表放到一边。测验变成了可以购买的技术黑箱。谁也不会去拆开黑箱,问里面装的是什么。
这里要回应一下那些为测验辩护的人。他们说,智商测验虽然有过历史的滥用,但它测到的是真实而稳定的认知能力,心理学家称之为g因子。这个g因子确实存在。对个体来说,语言、运算、空间推理等各项能力之间确实有正相关;对群体来说,这个因子也相对稳定。企业若把它当成一个参考指标,可以理解。我们没有必要把测验说得一文不值,那不是事实。
但问题是,企业拿来用的,远远超出了一个参考指标该有的分量。参考指标可以辅佐判断,却不会自动划出淘汰线。而企业要的是淘汰线。因为企业每年要筛掉的人太多,它需要一个一锤定音的数字。于是g因子这个科学概念,落到了人事表格里,变成了“录取线以下”。
一个原本只是相关程度的概念,被塞进了二选一的决定之中。这是量化分类最典型的操作:把一条连续的曲线,切成两段,然后说,这一段是可以用的,那一段是不可以用的。
民权运动之后,这套操作不但没有消失,反而收得更紧。1964年《民权法案》第七条禁止就业歧视。对企业来说,这本来是压力,但也成了继续使用测验的借口。
为什么这么说?因为法律没有禁止测验,只是禁止基于种族、肤色、性别等因素的歧视。测验不属于这些禁止项目。只要企业能说,我只看分数,不看肤色,它就可以在表面上站住脚跟。于是,从前可能靠主管个人关系把少数族裔挡在门外的企业,现在换了一副面孔:不是不要你,是你分数不够。
这恰恰是那个年代最深的讽刺之一。民权运动推动了平等,但平等的实现方式,却被一部分企业挪用为不平等的庇护所。只要标准是“客观”的,淘汰就不再需要解释。一个黑人申请者被刷掉,不是因为他是黑人,而是因为他在语言推理测验里少得了几分。这几分从哪里少下来,企业不追问,法律也不追问。
测验把歧视从台面上,压到了分数下面。它不是取消了排斥,而是把排斥变成了一个看起来中性的流程。
后来,民权律师开始打这一类官司。他们不只是在法庭上讲“这家公司歧视黑人”,而是走向了一个更刁钻的入口:请把你们的测验拿出来看看。那一刻,许多企业发现自己拿不出一份可靠的工作效度研究。那份测验用了十来年,最初由某个咨询公司卖给人事部,后来咨询公司被另一家公司收购,原来的出题人早就不在了。没有人知道那些题目为什么是五选一,也没有人知道及格线为什么定在七十分。但他们一直用着,因为它没有给人惹过麻烦。直到被人告上法庭,它才第一次露出破绽。
这个破绽,早在学校分轨的时候就已经埋下。慢班里的孩子,日复一日做着低一级的练习,老师把他们当成需要放慢进度的人,他们也慢慢相信自己确实不行。毕业那天,他们中的一些人去申请电话公司的岗位。申请表上写着“教育程度”,他们如实填写那所名声不好的学校。笔试那天,试卷上的词汇来自中学高级班的阅读材料;
图形推理的题目,有些孩子从未练习过。分数出来,他们排在末位。企业说,这是能力。其实这是教育、家庭、社区资源在纸上的投影。只是投影看起来像原物,于是人们不再去问光源在哪。
美国电话系统在二十世纪中的扩张,给这场投影提供了巨大屏幕。电话公司不是一家小作坊,它每年要招聘成千上万的人。当规模这么大,人事经理根本不可能一个一个去认识。测验于是成了机构的眼睛。它看得快,看得标准,但只能看见分数。它看不见一个人为什么分数低,也看不见他有没有别的本事。它把复杂的人,看成一个可比较的数字。而现代企业需要的,恰恰是这个数字。
一个更冷的事实是:企业用测验淘汰了那么多人,却很少去统计自己淘汰得对不对。如果你把一个测验淘汰掉的接线员重新请回来,给他两个月在岗培训,他会不会干得和及格者一样好?企业不知道,也不打算知道。测验的结果一旦形成,就没有对照组。这是所有筛选制度共有的保护壳。每一次失败都印证了分数,而分数永远不需要反思自己。但法律的眼睛开始睁开了。
民权调查人员把几家大公司的人事材料搬到桌上,开始做最简单的比较。他们发现,某些岗位测验的通过率,白人和黑人之间差得不是一点半点。有的地点,白人申请者通过主管选拔测验的比例超过一半,黑人申请者通过的比例不到十分之一。企业拿出一堆纸,说这是测验公司的效度手册。
调查人员翻开,里面只写了“可用于筛选文职岗位”之类笼统的话,没有一个数字说明这套测验能预测接线员或基层主管的实际表现。手册写的是产品介绍,不是科学证据。那一页页写着“客观筛选”的培训手册,在灯光下看起来格外坚硬。它们用标准化的语言,把不平等变成了流程。可一旦有人追问流程的源头,那些手册上就只剩下一片沉默。
结尾,我把它落在一个具体的对照上。后来在法院卷宗里出现过这样的材料:某电话公司同一年的基层主管选拔,测验分数排在前两成的申请者,百分之八十几是白人;排在后两成被淘汰的申请者,黑人占了将近六成。企业说不清为什么比例如此悬殊,只说分数自然如此。
但恰恰是这份“自然”,让官司变得不可避免。因为当分数总和肤色如影随形,却拿不出它与工作表现的联系时,分数就不再只是分数了。它成为一道门,门上写着公平,却仍然只放过某些人。那些被挡在门外的退伍兵和年轻黑人接线员,不会再去敲第二下。他们把低分装进口袋,转身走进下一份被人挑拣的表格里。