第 17 章
看不见的审判
那份《内容审核操作手册(征求意见稿)》的附录里,藏着三行铅笔字。第一行写在中文版“低俗”条目的页边:“带有性暗示的肢体动作,含舞蹈类。”第二行写在英文版同一位置:“sexually suggestive content,context-dependent。”第三行写在东南亚某国版本的“政治敏感”条目下,字迹最潦草:“涉及王室内容一律升级,不申诉。”
三行字出自同一人之手。但手册在四个部门流转了三个月,没人知道这个人是谁,也没人问过。铅笔字被复印、扫描、录入电子版,最终以“地区差异化备注”的名义正式归档,成为审核员培训材料的一部分。
规则就这样诞生了——从一个人的铅笔备注,变成一万五千人的日常判断依据。
这份手册的草稿送达朱文佳邮箱的时间是2019年9月17日,凌晨两点零四分。他的手机在床头柜上震了一下,屏幕亮起,又暗下去。第二天早上他翻看邮件,发现手册的发送者设置了一小时后自动撤回,但附件已经被系统归档。
他打开附件,翻到第三十七页,看到那张流程图:算法初筛、人工复审、申诉处理,三级架构。流程图下方有一行小字,是后来加上去的,字体与正文不同,像临时补录——算法初筛准确率约92%,人工复审团队规模约两千人。
朱文佳盯着那行字看了很久。他记得两年前这个团队不到两百人。他记得更早的时候,审核是算法团队兼着做的,没有独立部门,没有标准手册,遇到拿不准的内容就发到群里问,谁在线谁回答。
那时候判断一条内容该不该删,靠的是常识和直觉。现在他们有了手册,有了一千三百条规则,有了三级架构和九十二的准确率。但那个铅笔字的问题还在:谁来决定什么是低俗,什么是政治敏感,什么该升级什么不该升级?
当天下午的跨部门联席会议在总部一层会议室召开。法务、公关、政府关系、内容安全中心和推荐算法团队各派代表,共七人。
会议桌是浅灰色的,边缘有一道明显的划痕,像谁用钥匙划过。朱文佳坐在靠门的位置,面前摊着那本手册。
法务负责人先发言,提到一份来自监管部门的问询函,具体内容不便全文传达,但核心指向一个判断:算法推荐的内容,平台应当承担与传统媒体同等的责任。这句话落下后,会议室安静了大约五秒钟。
朱文佳在那五秒里翻到手册第三十七页,又看了一遍流程图。他知道这句判断的重量——如果接受,抖音要从信息分发平台变成内容出版者,审核成本将呈指数级上升;如果不接受,继续坚持技术中立,在监管语境中已失去说服力。算法团队的一位负责人先开口。
他说,从技术角度,平台无法对每一条推荐内容承担出版者责任,因为推荐是概率系统,不是编辑选择。每一条被推荐的内容,背后是数亿次特征匹配和权重计算,不存在一个“决定推荐这条”的人。
法务负责人反问:那用户看到的每一条内容,是谁决定的?算法负责人沉默了几秒,说,是模型决定的。
法务追问:模型是谁训练的?训练模型的数据是谁标注的?标注数据的规则是谁定的?三个问题,一个比一个短,一个比一个难回答。
会议室里有人开始翻笔记本,有人低头看手机。朱文佳没有翻笔记本。他在想那三行铅笔字——如果规则最终追溯到一个人的铅笔备注,那这个人是否应该承担规则带来的所有后果?如果这个人不存在,或者找不到,那责任该由谁承担?
会议持续了四个小时。前半段各部门陈述立场,后半段逐条讨论审核标准边界。
争议集中在“软色情”和“低俗”的界定上。法务倾向从严,理由是监管处罚案例在增加。算法团队反复强调,过严标准会导致误杀率上升,正常内容被错误拦截,直接影响用户体验和创作者生态。朱文佳问了一个问题:“上个月误判了多少条?”
算法团队负责人翻了翻笔记本:“约三十万条。申诉成功比例百分之十七。”
“剩下的百分之八十三呢?”
“用户没有申诉。可能没注意到,也可能放弃了。”
朱文佳没有再追问。他知道那百分之八十三意味着什么——三十万条内容被拦截,超过二十四万用户选择沉默。沉默背后是创作者收入损失、表达中断、对平台信任的缓慢侵蚀。这些损失不会出现在财报里,但它们真实发生着。
每一条被误删的视频,都有一个具体的人在屏幕另一端感到困惑或愤怒,然后关掉应用,或者换一个平台。
会议结束时,法务负责人做了总结。他说监管逻辑正从结果监管转向过程监管,不仅要看平台有没有有害内容,还要看平台有没有建立持续发现和处理有害内容的机制。这套机制的存在本身就是合规的一部分。
“我们需要证明算法不只追求点击率,也在识别和过滤有害内容。这个证明的过程,可能比结果更重要。”
手册草稿最终没有正式发布。它在内部流转三个月,被修改十一次,每一次修改都伴随着跨部门的拉锯。
最大的裂痕出现在人工干预的权限上。算法团队坚持,人工只应介入算法明确标记的高风险内容,不应大规模干预正常的推荐流。内容安全团队则反驳,算法的标准过于机械,大量灰色地带需要人的价值判断。
“谁来定义什么是灰色?”这个问题在一次次内部讨论中被反复抛出,却始终没有一个能让所有人闭嘴的答案。灰色地带之所以是灰色,恰恰因为它无法被任何一条简单规则覆盖。
一条视频可能包含轻微暴力,但语境是反暴力;一段文字可能带有性暗示,但讨论的是性别平等。算法能识别关键词、分析画面特征,但它读不懂语境,更读不懂反讽。
而人虽然能读懂,却无法把这种理解转化为可复制、可规模化的规则。每一次判断都是一次性的,无法被标准化。
当每天有数千万条内容需要判断时,人的理解能力就成了瓶颈。张一鸣在2019年秋天的一次内部讲话中提到了这个问题。讲话没有对外公开,内容在管理层中流传。
他说早期相信技术中立,相信算法只是工具,工具本身没有价值观。但现在不得不承认,当工具被数亿人使用,它就在事实上塑造着人们看到什么、讨论什么。这种塑造力本身就是一种价值判断,无论是否承认。
这段话在推荐算法团队内部引发震动。一些早期加入的工程师感到困惑——他们当初加入字节跳动,正是因为相信技术可以超越人为偏见,用数据和效率取代编辑的主观判断。现在创始人却说算法本身就有价值观,这几乎是在否定他们最初的信念。
一位算法工程师在内部论坛匿名发帖,标题是《我们到底在优化什么?》。帖子写道:如果算法需要承载价值判断,优化目标就不再是单一点击率或停留时长,而是多目标平衡。但多目标平衡意味着无法再用清晰数字衡量成功。我们怎么知道做对了?
帖子没有被删除,也没有官方回复,但在内部被转发数百次。朱文佳看到了。
他没有直接回应,而是在一次团队会议上提到另一个角度:审核团队每天面对的内容里,有大量无法用简单规则判定的灰色地带。每一次判断都涉及价值取舍——这条内容该不该推荐,该不该限流,该不该标记。这些判断累加起来,构成平台实际的内容生态。“我们不是在优化一个数字,”他说,“我们是在决定什么样的内容值得被更多人看到。这个决定就是价值判断。”
会议室的灯管发出持续的嗡鸣。朱文佳的话落下后,是一段漫长的沉默。有人低头翻笔记本,有人盯着投影幕布上残留的流程图。没有人反驳,也没有人立刻点头。
那段时间,审核团队经历了一场爆炸式扩张。从两千人到五千人,再到接近一万。招聘速度赶不上内容增长的速度,培训周期被压缩,审核标准的统一成了几乎不可能完成的任务。不同批次入职的审核员,对同一条内容可能做出完全不同的判断,申诉率居高不下。
一份内部审计报告显示,审核团队对“低俗”类内容的判定一致率只有百分之六十八。同一条内容,交给不同审核员,有近三分之一的可能性得到不同的处理结果。报告在管理层会议上被讨论,结论是需要更详细的审核标准、更系统的培训、更严格的质量控制。
但更详细的标准意味着更多的规则条目。规则条目越多,审核员的判断空间就越小,工作的机械性就越强。一位审核团队主管在内部会议上说了一句话,让很多人记住了:我们把审核员变成了算法的延伸,但算法本身还在学习,审核员却已经被规则框死了。
有人认为是在批评管理僵化,有人认为是在质疑算法局限,还有人认为是在暗示一个更深层的问题——当审核标准复杂到没有人能完全掌握时,所谓“人工复审”就成了一种形式上的安慰,实质判断权已经转移到规则制定者手中。规则制定者是谁?
这个问题在2019年冬天的一次高层会议上被正式提出。会议议题是“内容治理体系的下一步”,参会者包括张一鸣、梁汝波、朱文佳以及法务、公关、政府关系负责人。会议从下午两点持续到晚上九点,中间只休息十五分钟。
前半段聚焦监管环境变化。法务团队汇报国内外监管动态:国内对算法推荐的监管正从原则性要求转向具体技术标准,要求平台提供算法推荐解释说明;海外市场数据合规要求越来越严格,TikTok在多个国家面临数据存储和内容审核本地化压力。这些变化意味着字节跳动需要在不同市场建立不同内容治理体系,每个体系都需要投入大量人力物力。后半段转向内部机制讨论。争论焦点集中在价值判断权归属上。
算法团队认为价值判断应尽可能前移到规则制定阶段,由跨部门委员会确定审核标准,算法只负责执行。内容安全团队则认为规则永远无法覆盖所有情况,必须保留人工判断空间,人工判断标准应由一线审核团队根据实际情况灵活掌握。“灵活掌握的意思是,同一个问题在不同情况下有不同答案?”张一鸣问。“是的,”内容安全负责人回答,“因为语境不同。”
“那用户怎么知道什么能发什么不能发?如果同一个内容今天能过审明天不能,创作者怎么建立稳定预期?”
最终会议达成折中方案:成立跨部门内容治理委员会,由法务、公关、政府关系、内容安全和算法团队各派代表组成,负责制定和修订审核标准。委员会决定需三分之二多数通过,但紧急情况下内容安全团队有权先行处置,事后报委员会备案。
这个方案没有解决价值判断权归属问题,只是把问题暂时封装在流程里。但流程本身也是一种答案——它承认没有任何一个部门可以单独承担价值判断责任,必须通过协商和制衡分散风险。
张一鸣在会议结束前说了几句话。他没有总结,也没有表态,只是提到很久以前观察到的现象。
他说2011年注意到地铁上看报纸的人越来越少,人们开始低头看手机。那个瞬间让他意识到信息获取方式正在发生根本变化。
根据他2015年在南开大学的演讲,他曾说:“在2011年,我就注意到在地铁上看报纸的人越来越少了。中国的智能手机销量也出现了爆发式增长。我认为智能手机会取代报纸,成为最重要的信息传播媒介。”这个判断催生了字节跳动,也催生了今天这场关于算法责任的争论。
但他当时没意识到的是,当信息获取方式变化后,人们对信息的信任方式也会变化。以前人们信任报纸,因为报纸有编辑、有品牌、有历史。现在人们信任算法,因为算法推荐的内容符合偏好。但这种信任是脆弱的,因为算法不懂什么是真相,只懂什么是相关。张一鸣曾将他的产品愿景比作“将人与信息连接起来”,就像Facebook连接人与人,Uber连接人与车。但连接之后呢?“我们建了这么大一个系统,”他说,“但系统的核心问题始终是:我们到底在帮用户做什么选择?如果只是在帮他们选择想看的东西,那我们和一面镜子有什么区别?但如果要帮他们选择应该看的东西,就必须回答‘应该’的标准是什么。这个标准,没有人能替我们定。”
责任越分散,做出判断的人就越难感到自己是在做正确的事,而只是在执行流程。
一位在2019年加入审核团队的前媒体编辑,在离职前写了一份备忘录。备忘录没有对外公开,但在小范围内流传。
她写道:我以前在报社做编辑,每天要决定哪些新闻上头版。那个决定很重,因为我知道成千上万人会看到我的选择。但那个决定也很清晰,因为我知道我的标准是什么——新闻价值、公共意义、社会影响。
在这里,我的标准是规则手册。规则手册有一千三百条,每一条都有例外,每一个例外都需要请示。我做了八个月,从来没有一次觉得自己是在做判断。我只是在匹配规则。
这份备忘录没有被正式回应,但它提出的问题在组织中缓慢发酵。当规则复杂到没有人能完全掌握时,规则的执行者就变成了规则的奴隶。而当规则的制定者也无法完全预见规则的所有后果时,规则本身就成了一种风险。2020年春天,一份来自监管部门的处罚决定书送达字节跳动。
责任越分散,做出判断的人就越难感到自己是在做正确的事,而只是在执行流程。
一位在2019年加入审核团队的前媒体编辑在离职前写了一份备忘录。备忘录没有对外公开,但在小范围内流传。
她写道:我以前在报社做编辑,每天要决定哪些新闻上头版。那个决定很重,因为我知道成千上万人会看到我的选择。但那个决定也很清晰,因为我知道我的标准是什么——新闻价值、公共意义、社会影响。
在这里,我的标准是规则手册。规则手册有一千三百条,每一条都有例外,每一个例外都需要请示。我做了八个月,从来没有一次觉得自己是在做判断。我只是在匹配规则。
这份备忘录没有被正式回应,但它提出的问题在组织中缓慢发酵。当规则复杂到没有人能完全掌握时,规则的执行者就变成了规则的奴隶。而当规则的制定者也无法完全预见规则的所有后果时,规则本身就成了一种风险。2020年春天,一份来自监管部门的处罚决定书送达字节跳动。
处罚原因是平台未能有效过滤某类有害内容,罚款金额不大,但处罚决定书中的一段话被管理层反复研读:平台应当建立与其用户规模和技术能力相匹配的内容治理体系,不能以技术中立为由规避主体责任。
“不能以技术中立为由”——这七个字像一枚钉子,钉在字节跳动过去几年赖以立足的逻辑上。从今日头条到抖音,核心叙事始终是技术连接信息与人,技术是桥梁,不是内容本身。但现在监管在说,当桥梁大到所有人都必须走它时,桥梁就不再只是桥梁,它是一条路,而路是有方向的。
方向由谁决定?这个问题没有在公开场合被回答过。但在2020年的一次内部战略会上,张一鸣提到了一个词:算法向善。他没有展开解释这个词的含义,只是说,过去相信算法可以把对的内容推给对的人,现在还需要相信,算法可以把好的内容推给更多的人。但这个“好”是什么,需要我们自己来定义。
“我们自己”——这三个字在会议室里回荡了很久。没有人追问“我们自己”到底是谁,是管理层、算法团队、审核员,还是整个组织。
因为所有人都知道,这个问题没有标准答案,而追问下去只会暴露更多分歧。那段时间,朱文佳经常在深夜离开办公室。他习惯走楼梯而不是坐电梯,因为楼梯间安静,可以想事情。从十二楼走到一楼,大约需要七分钟。这七分钟里,他会回想当天的会议、邮件、数据报告。他发现自己越来越多地在想一些非技术的问题——什么是公平、什么是责任、什么是信任。这些问题在教科书里都有定义,但在实际工作中,每一个定义都显得苍白。
有一次,他在楼梯间遇到一位审核团队夜班主管。两人点头致意,没有交谈。但朱文佳注意到那位主管手里拿着一份打印材料,封面上写着“本周争议案例汇编”。他看不清具体内容,但能想象那些案例的样子——每一条都卡在规则的缝隙里,每一条都需要人做出最终判断。
那位主管走进电梯,门关上。朱文佳继续往下走。楼梯间的声控灯在他身后一盏盏熄灭。2020年夏天,字节跳动宣布投入巨资建设更负责任的人工智能体系。
新闻稿提到,公司将建立专门的算法伦理委员会,聘请外部专家参与审核标准制定,并定期发布内容治理透明度报告。这些措施被外界解读为对监管压力的回应,也被内部一些人视为对技术中立信念的正式告别。
但就在新闻稿发布的同一周,一起诉讼案件在北京市某法院正式立案。原告是一位普通用户,他在抖音上发布的一段视频被算法误判为违规内容并遭到删除,导致其经营的店铺损失了大量订单。他起诉字节跳动,要求恢复视频并赔偿损失。案件标的额很小,但诉讼请求中有一条引人注目:要求平台公开算法推荐和内容审核的具体标准。这条请求在法律上几乎不可能被支持,因为涉及商业秘密和技术专利。
但它的存在本身就是一个信号:当算法成为亿级用户获取信息的默认通道,它的规则就不再只是平台内部事务,而是一个公共问题。公共问题需要公共答案,而公共答案需要公共讨论。字节跳动还没有准备好进行这样的讨论,但讨论已经找上门来。
那起诉讼最终以调解结案。原告恢复了视频,字节跳动支付了一笔赔偿金。
案件没有公开审理,也没有形成判例。但它像一个楔子,打入了组织对责任的理解中。以前,责任是内部管理问题——如何提高准确率、如何降低误判、如何优化流程。现在,责任是外部关系问题——平台与用户之间、算法与权利之间、效率与公平之间。
这种转变不是一夜之间发生的。它由无数具体事件累积而成:一份监管问询函、一次内部争论、一位审核员的离职备忘录、一起用户诉讼。每一个事件单独看都不足以改变什么,但它们叠加在一起,就形成了一种压力。这种压力不像商业竞争那样直接,它更安静、更持久,像水渗进墙缝,不知不觉间改变了墙的结构。
朱文佳在2020年秋天的一次内部复盘会上提到了那起诉讼。他没有谈法律细节,只是说,那位用户的视频被误删了,他损失了订单,他起诉了我们。我们赔了钱,恢复了视频,事情结束了。但那位用户以后还会信任抖音吗?他的朋友、他的客户、看到这个案件的人,他们还会信任抖音吗?
“信任,”他说,“不是靠准确率百分之九十九点九来建立的。那百分之零点一的错误,对遇到它的人来说,就是百分之百。”
会议室里没有人接话。投影幕布上显示着下一季度的审核准确率目标,那个数字比上一季度又提高了零点零一个百分点。所有人都知道,这个数字的提升意味着更多规则、更复杂流程、更高人力成本。但没有人知道,这个数字的提升是否能让那位用户重新信任抖音。
张一鸣在那次会议上没有发言。他坐在长桌一端,面前放着一杯已经凉了的茶。他的目光停留在幕布上的数字上,停留了很久。没有人知道他在想什么,但熟悉他的人注意到,他的手指在桌面上轻轻敲了两下——那是他思考时的习惯动作,通常出现在他面对一个无法用现有框架回答的问题时。
会议结束后,朱文佳回到办公室。他打开邮箱,看到一封来自审核团队的邮件,主题是“关于近期误判案例的分析报告”。
他没有立刻点开,而是走到窗边。窗外是北京秋天的黄昏,天空呈现出一种浑浊的橙色。楼下车流已经开始拥堵,车灯连成一条缓慢移动的光带。他想起很多年前,张一鸣在地铁上看到人们低头看手机的那个瞬间。
那个瞬间催生了一个判断,那个判断催生了一家公司,那家公司催生了一套算法,那套算法催生了一个生态。现在,这个生态里生活着数亿人,他们每天在这里获取信息、表达观点、做生意、交朋友。他们中的绝大多数人不会去想算法是什么、规则是谁定的、判断是怎么做出的。他们只是使用它,信任它,或者在某一天突然发现它错了,然后失去信任。
朱文佳回到桌前,点开那封邮件。报告第一页是一张图表,显示近三个月误判案例数量变化。曲线在缓慢下降,但下降速度越来越慢,像是逼近了一个无法突破的极限。图表下方有一段文字说明:随着审核标准细化,边际改善难度正在增加。每减少一个误判,需要投入的成本比上一阶段增加了约百分之四十。
他合上电脑。窗外橙色天空已经暗下来,车灯光带变得更加明亮。他拿起手机,打开抖音,随手刷了几条视频。一条是餐厅老板展示新菜品,画面里锅气蒸腾,评论区有人问在哪里。一条是街头摄影师拍摄的雨中行人,配乐很安静。
一条是某个小县城的年轻人用方言讲笑话,点赞数不高,但评论很热闹。这些内容都很普通。它们没有被误判,没有被限流,没有被删除。它们正常地存在着,被推荐给可能感兴趣的人。这是算法每天在做的事,也是数亿用户每天在经历的事。
但朱文佳知道,在这条正常的河流下面,有一层看不见的河床,由规则、判断、争议和妥协构成。河床在缓慢改变形状,而河流的方向,最终取决于河床的形状。
他关掉手机,起身离开办公室。走廊里很安静,只有应急灯发出微弱的光。他走进电梯,按下一楼按钮。
电梯门关上时,他忽然想到一个问题:如果有一天,算法能够完美识别所有有害内容,准确率达到百分之百,误判率降到零,那时候还需要审核团队吗?如果需要,他们在做什么?如果不需要,那套由一万五千人构成的判断体系,又意味着什么?
电梯到一楼。门打开,大厅空荡荡的。他走出去,推开玻璃门,秋天的凉意扑面而来。停车场里,他的车停在角落,车顶上落了几片枯叶。他走过去,拉开车门,坐进驾驶座。
发动机启动的声音在安静的地下停车场里显得格外清晰。他驶出停车场,汇入车流。车灯连成的光带在眼前延伸,像一条没有尽头的河。他打开收音机,电台正在播报新闻:某地发生了一起网络谣言事件,造谣者被行政拘留。主播声音平稳而克制,像在念一份公文。朱文佳听着,忽然想到,那条谣言在被删除之前,可能已经被算法推荐给了成千上万人。算法不知道那是谣言,它只知道那条内容引发了大量互动。互动是它的燃料,而真相不是它的责任。
他把收音机关掉。车里安静下来,只剩下轮胎碾过路面的声音。那天晚上,字节跳动内部系统里多了一份文件。文件标题是《内容治理委员会章程(试行)》,正文共四章二十七条,规定了委员会的组成、职权、议事规则和保密要求。文件最后一条写道:本章程自发布之日起生效,解释权归内容治理委员会所有。没有人知道这份文件会在未来几年里被修改多少次,也没有人知道它是否真的能回答“谁来定义准确”这个问题。
但它的存在本身,就是一个答案——一个不完美的、临时的、充满妥协的答案。而这个答案的背后,是无数个深夜会议、被否决的方案、重新站起来的人,以及那些永远不会出现在财报里的代价。
车驶过一座立交桥。桥下车流像一条发光的河,无声流动。朱文佳想起那本培训手册第三十七页的流程图,想起流程图下方那行小字:算法初筛准确率百分之九十二,人工复审团队两千人。那个数字现在已经被新的数字取代,但流程图的结构没有变。算法在前面跑,人在后面追。算法跑得越快,人追得越累。但人不能停下来,因为一旦停下来,算法就会跑出视线之外,而没有人知道它会跑向哪里。
他把车停进小区停车场,熄了火。仪表盘的光暗下去,车里陷入黑暗。他坐了一会儿,没有立刻下车。
手机屏幕亮了一下,是一条推送通知:某地发生了一起网络谣言事件,造谣者被行政拘留。他盯着那条通知看了几秒钟,然后把手机翻过去,屏幕朝下扣在副驾驶座上。他推开车门,走进秋天的夜色里。那三行铅笔字还留在手册附录的页边上,没有被擦掉。
手册被归档、被扫描、被录入电子版,三行字变成了“地区差异化备注”正式条目。没有人追问是谁写的,也没有人追问为什么同一条规则在不同地区有不同的解释。规则就这样生效了,从一个人的铅笔备注变成一万五千人的日常判断依据。而那个写铅笔字的人,可能已经离职,可能已经忘记自己写过什么,也可能在某一天刷抖音时,看到一条被误删又恢复的视频,想起自己曾经在某本手册的页边上,用铅笔写过一个没有人追问的答案。