第 22 章

出海船队的裂缝

那封邮件是在一个周二凌晨抵达的。都柏林时间四点十七分,北京正午刚过。邮件没有加急标记,没有抄送高管,标题只有一行字:“离职交接——文化审核标准差异记录”。收件人是TikTok欧洲内容审核团队的直属上级,以及一个三个月没有更新的产品反馈邮箱。发件人在都柏林办公室工作了两年零四个月,职位是内容审核负责人。

邮件正文很长。手机屏幕上需要滑动七次才能读完。他列举了十七个具体案例,每一个都附有截图和标注,说明算法推荐结果与当地文化规范之间发生了怎样的冲突。这些案例此前从未被系统性地反馈到产品团队。

提过,但没有下文。邮件最后一段写得极其克制:“我仍然相信这个产品能连接不同文化的人。但连接的方式需要重新思考。我无法在一个不允许我思考这些问题的结构里继续工作。”

发出后四十八小时内,这封邮件被转发了三次。最终归档在北京一个名为“海外运营反馈”的内部系统里。系统显示的状态是:已阅,待处理。

那是2022年秋天。同一时期,TikTok的全球月活跃用户数正逼近十亿关口。增长曲线在大屏幕上平滑上扬。北京总部每两周一次的全球业务复盘会上,这条曲线总是被放在第一页。没有人注意到都柏林、伦敦、新加坡、洛杉矶的办公室里,离职申请正在以另一种斜率上升。

出海船队的龙骨出现了结构性疲劳。这种疲劳不是断裂,不是巨响。是金属在反复应力下产生的细微裂纹,肉眼看不见,每一次风浪都会让它延长一点。要看清裂缝从何而来,需要先看清这艘船的构造。

字节跳动的海外扩张从一开始就采用了一种特殊的管控方式。推荐算法的核心参数由北京团队统一调校,内容审核标准却需要各地团队自行把握。这个安排在早期运转良好。产品规模小,各地团队有足够的自由裁量空间去处理文化差异。

但随着TikTok在2020年至2022年间从一款娱乐应用演变为全球文化基础设施,这个结构的张力开始显现。算法参数在北京统一调校意味着什么。意味着一个印尼用户打开TikTok时看到的推荐逻辑,与一个巴西用户、一个德国用户、一个美国用户看到的推荐逻辑,共享同一套底层架构。这套架构的目标函数从未改变:最大化用户停留时长和互动率。这个目标函数在中文互联网语境下经过了千锤百炼。它知道什么样的内容能让手指停下来。但它不知道的是,在某些文化语境里,让手指停下来的内容可能同时触犯了某种看不见的禁忌。

都柏林那位离职的审核负责人曾经做过一个实验。他把同一段视频分别标注为“印尼市场可推荐”和“德国市场可推荐”,然后观察算法在两个市场的实际推送情况。结果让他困惑:算法在印尼市场的推送量是德国市场的十七倍。他调取了两个市场的用户特征数据,发现印尼市场的用户画像与这段视频的特征匹配度确实更高。算法没有错。错的是他试图用同一种审核标准去覆盖两个完全不同的文化语境。

他在离职邮件里写:“我们不是在审核内容,我们是在审核文化。而文化不能被算法自动化。”

这句话后来被截图发在一个内部讨论群里。群里有二十七个人,来自六个国家的办公室。没有人回复。

跨时区会议是另一个裂缝的高发地带。字节跳动的海外团队与北京总部的沟通主要依赖视频会议。视频会议的物理特性决定了它天然不利于深度讨论。都柏林下午三点是北京晚上十点。洛杉矶上午九点是北京午夜十二点。新加坡上午十点是北京上午十点,但新加坡团队与北京团队之间横亘着语言转换的延迟。

一位前TikTok新加坡运营团队成员后来在职业社交平台上写道:“每次会议的前十五分钟都在等技术调试和翻译确认。等真正进入议题时,北京那边已经有人开始打哈欠了。”这不是抱怨。这是物理事实。

更麻烦的是翻译造成的语义损耗。中文里的“内容生态治理”翻译成英文后变成了“content ecosystem governance”,再翻译回中文时可能变成“内容生态系统管理”。词汇的漂移看似细微,但在具体决策场景中会造成实质性误解。有一次,北京团队在会议上提出“需要加强对低质内容的识别”。

都柏林团队理解为“需要提高审核标准”,于是将一批原本合规的本地创作者内容标记为待审核。这批内容在待审核状态下被算法降权推荐,导致几位在当地有影响力的创作者公开抱怨TikTok“莫名其妙地限流”。都柏林团队花了三周时间才弄清楚问题出在哪一次会议的哪一句话上。

这些日常冲突不会出现在财报里,不会出现在产品发布会的幻灯片上。但它们正在一点点侵蚀海外团队对总部的信任。

2022年11月,在一次复盘会上,梁汝波难得地发了火。那次会议的主题是TikTok在东南亚市场的增长放缓问题。北京中台团队提交了一份分析报告,结论是东南亚市场的推荐策略需要更激进地追求互动率。报告用数据支撑了这个判断:印尼市场的用户日均使用时长在过去六个月增长了百分之三十四,但互动率的增长只有百分之十九。“这说明推荐策略没有充分挖掘用户的互动潜力。”报告的结论写得斩钉截铁。梁汝波在会上问了三个问题。第一个问题:互动率增长低于使用时长增长,有没有可能是内容供给结构的问题。

第二个问题:如果提高互动率意味着推送更多具有争议性或情绪煽动性的内容,这在印尼市场的文化语境下是否可行。第三个问题:谁去评估这个策略的本地化风险。没有人回答第三个问题。因为答案很清楚:没有人专门负责这件事。北京中台团队负责算法参数调校,东南亚本地运营团队负责内容审核和创作者关系维护。两者之间的衔接地带——算法策略的文化风险评估——处于组织架构的真空区。梁汝波没有继续追问。他只是在会议结束时说了一句话:“我们要的是可持续的增长。”

这句话后来被不同的人做了不同的解读。北京中台团队理解为“增长不能停”。东南亚本地团队理解为“总部终于意识到不能只看互动率了”。而都柏林那位已经提交离职申请的审核负责人当时还在职,他在会议纪要里看到这句话时,在笔记本上写了一行字:“可持续的定义是什么。谁来定义。”

那本笔记本后来留在了都柏林办公室的抽屉里。离职时他没有带走。裂缝的另一个维度是人才流失的结构性特征。2022年至2023年,字节跳动国际化团队经历了成立以来最严重的人才流失。这个判断需要拆解才能看清其含义。流失的不是基层审核员——虽然他们的流动率也在上升——而是中层管理者。那些在2019年至2021年间加入TikTok海外团队、亲手搭建起本地运营体系的人,正在批量离开。

他们的离职原因高度相似。不是因为薪酬,不是因为工作强度。是一种逐渐累积的无力感。

一位曾在TikTok洛杉矶办公室负责创作者运营的总监在离职后的一次行业活动上被问到为什么离开时,他的回答被在场的人记录下来:“我在这个位置上能做的事情越来越少。算法决定了什么内容能被看见,北京决定了算法怎么调,本地团队决定的事情只剩下执行和解释。我花了两年时间建立起来的创作者信任关系,在一次算法调整后就可以被清零。”

这段话后来被多家媒体引用。但很少有人注意到它揭示的结构性困境:当算法成为产品的核心决策者时,人的角色被压缩为算法的解释者和执行者。而在跨文化场景中,“解释”本身就是一项极其困难的工作。

你如何向一位印尼的本地创作者解释为什么他的视频突然没有流量了。你只能说“算法调整了推荐策略”。这句话翻译成印尼语后听起来像什么。像一句敷衍。

更深层的问题在于文化认同的流失。TikTok早期吸引海外人才加入的一个重要原因是“连接世界”的愿景。这个愿景在2019年至2021年间具有真实的感召力。产品确实在打破文化壁垒,让不同国家的用户看到彼此的生活。但到了2022年,随着商业变现压力的增加和算法策略的功利化转向,“连接世界”逐渐沦为一句空洞的口号。

一位在2023年初离职的TikTok柏林办公室政策经理后来写道:“我来的时候以为自己在参与一个让世界更开放的项目。走的时候我觉得自己在维护一个让世界更碎片化的机器。”

这句话的尖锐之处在于它指出了算法理性的内在悖论:算法以“连接”为名推送内容,但算法的目标函数是“停留”。而最能让人停留的内容往往是那些强化既有偏见和情绪对立的内容。“连接”与“停留”之间的张力,在跨文化场景中被放大为“理解”与“误解”之间的鸿沟。

柏林那位政策经理在离职前做了一件事。他整理了一份长达四十七页的文档,标题是“德语区文化敏感内容清单”。文档里列举了三百多个在德语语境下具有特殊含义的词汇、符号和表达方式。其中很多在算法看来只是普通的高互动内容元素。比如某些历史符号、某些地域性笑话、某些在特定政治语境下具有隐含意义的表达方式。他把这份文档提交给了北京中台的产品反馈系统。反馈系统的自动回复是:“已收到您的反馈,我们将进行评估。”

然后就没有然后了。那份文档后来被归档在系统里,标签是“待评估”。评估的标准是什么。没有人知道。评估的周期是多久。没有人知道。评估的结果如何反馈。没有人知道。

文档归档的那天是2023年1月17日。柏林办公室外面的街道上积着雪。那位政策经理提交完文档后关掉了电脑,收拾好工位上的私人物品——一个马克杯、一本德语版的《推荐系统实践》、一张贴在显示器边框上的全家福——然后离开了办公室。他没有发告别邮件。他的离职手续在一周前就已经办完了。

他的工位在接下来两周内一直空着。桌面上留着一份打印出来的文档草稿,页脚标注着“版本3.7”。没有人去动它。

北京这边,算法团队正在为另一件事忙碌。2022年底到2023年初,字节跳动的投资节奏明显放缓。全年投资的公司数量同比下降了百分之七十三,投资金额收缩到三十一亿元人民币左右。这个数字背后是一个更宏观的转向:公司正在从扩张期进入效率期。效率期的核心逻辑是聚焦。把资源集中在确定性最高的业务上。

什么是确定性最高的业务。在国内市场增长趋缓的背景下,答案是海外市场。TikTok的用户规模仍在增长,商业化空间尚未充分释放。于是资源进一步向海外倾斜。

但这种倾斜的方式是加强中台控制而非扩大本地自主权。逻辑很简单:中台控制能保证效率的一致性,本地自主权会导致资源分散和策略不统一。这个逻辑在工程层面是自洽的。但它忽略了一个事实:海外市场的增长本身正在遭遇文化层面的摩擦力。这种摩擦力不会体现在用户增长曲线上——用户还在增长——但会体现在组织健康度上。人才流失是组织健康度下降的最直观指标。

北京中台的算法工程师们并不了解这些。他们看到的是数据面板上的全球用户增长曲线,看到的是A/B测试中不同策略的用户留存差异,看到的是推荐效率的持续优化空间。他们的工作对象是数字,不是文化。这不是他们的错。组织架构就是这样设计的。

一位曾在字节跳动北京算法团队工作的工程师后来回忆说:“我们每天处理的是全球用户的行为数据,但我们很少接触到这些数据背后的人。我们不知道印尼用户为什么对某类内容反应更强烈,我们只知道他们的反应数据是这样分布的。”

这种数据与意义的分离是算法理性的固有特征:它能告诉你“是什么”,但很难告诉你“为什么”。而在跨文化场景中,“为什么”恰恰是最重要的。

回到那封都柏林的离职邮件。邮件里提到的十七个案例中有一个被反复引用。案例涉及一段在爱尔兰地区被算法大量推荐的短视频:视频内容是几个年轻人用夸张的口音模仿东欧移民的说话方式。这段视频在爱尔兰本地的互动率很高——点赞和分享数据都远超平均水平——算法因此加大了推荐力度。但这段视频同时引发了东欧移民社区的不满,认为它强化了刻板印象。都柏林的内容审核团队试图将这段视频标记为“文化敏感”。标记之后发现没有对应的处理流程——因为“文化敏感”这个标签在北京中台的审核标准体系里并不存在。

审核标准体系里有的是:色情、暴力、仇恨言论、虚假信息、未成年人保护。这些是全球通用的类别。“文化敏感”是一个无法被通用化的类别,因为它依赖于具体的文化语境。在爱尔兰被认为是文化敏感的内容,在波兰可能完全正常;

在德国被认为是历史禁忌的符号,在奥地利可能具有不同的含义。都柏林团队最终的处理方式是:不做处理。因为不知道该怎么处理。这段视频继续被算法推荐,继续获得高互动率,继续引发争议。直到爱尔兰当地媒体开始报道这件事,总部才介入处理——但处理方式是将整个话题从推荐池中移除,而不是建立一套能够识别和处理此类问题的机制。

这种“事后灭火”的模式反复出现。每一次都消耗着本地团队对总部的信任。因为本地团队知道问题在哪里,也知道解决方案的大致方向——他们需要的是决策空间和资源支持——但他们得不到这些。

那位离职的审核负责人在邮件里写道:“我们不是没有判断力的人。我们每天都在做判断——这条内容能不能推、那条内容要不要限、这个创作者的申诉有没有道理、那个社区的反馈是不是代表了真实的民意。但我们做的判断不被系统承认。系统只承认北京中台的判断。”

这段话指向了一个更根本的问题:当组织规模扩大到一定程度时,“信任”变成了一个需要被制度化的东西。而在字节跳动的海外扩张中,“信任”的制度化方向是单向的——总部信任本地团队的程度远低于本地团队信任总部的程度。

这种不对称的信任结构在早期可以被创业热情所弥补——大家都相信自己在参与一件大事——但随着组织规模扩大和商业压力增加,创业热情被KPI体系取代,不对称的信任结构就变成了一个持续制造摩擦的机器。2023年春天,TikTok在海外市场的用户规模仍在增长。增长曲线依然平滑上扬。北京总部的复盘会上,这条曲线依然被放在第一页。

但曲线的斜率开始出现微小的变化——不是下降,而是增长的速度在放缓。这种放缓在数据上还不明显,但在组织层面已经有了征兆。征兆之一是海外团队的招聘周期变长了。以前从发布职位到入职平均需要六周左右,现在延长到了十周以上。候选人拒绝offer的原因中,“对公司海外战略的不确定性”出现的频率在上升。

征兆之二是内部转岗申请增加了。海外团队的成员希望转到国内业务线或者更靠近总部的岗位。“离决策中心更近”成为转岗申请中最常出现的理由。征兆之三是跨时区会议的效率进一步下降。以前会议的核心议题是“怎么做”,现在越来越多的会议时间被用来讨论“为什么要这么做”。这种讨论往往没有结论,因为“为什么”的答案在总部和海外团队之间存在着根本性的分歧。梁汝波注意到了这些征兆。2023年3月的一次小范围管理会上,他问了一个问题:“如果TikTok的增长曲线在未来六个季度内趋于平缓,我们的海外组织能不能撑住。”

没有人直接回答这个问题。因为所有人都知道,“撑住”的含义取决于太多变量:人才流失的速度、本地监管环境的变化、竞争对手的动作、以及最关键的——北京总部愿不愿意给海外团队更多的决策空间。

会议结束后,梁汝波独自留在会议室里看了一会儿数据大屏。屏幕上显示着全球各市场的用户增长曲线和互动率曲线。两条曲线都在上扬,但上扬的角度不同——互动率的增长慢于用户的增长。这个差异在过去两年中一直在扩大。他关掉大屏,走出会议室。

走廊尽头的落地窗外是北京的夜景。远处有一栋楼的灯光正在逐层熄灭——那是字节跳动另一栋办公楼的下班时间到了。都柏林那边是下午。伦敦那边也是下午。那位离职审核负责人的工位已经空了两个多月。桌面上的那份“版本3.7”文档草稿还在那里——清洁人员没有动它,新来的员工也没有动它——它就像一块化石,记录着某种曾经存在但已经消失的东西。那份文档的最后一页写着一行字:“如果这份清单能被采纳哪怕十分之一的内容,我们就能避免至少一半的社区冲突。”

这行字下面没有签名。文档也没有被提交到任何正式的反馈系统里——那位审核负责人离职前把它打印出来放在桌上时说过一句话:“也许有一天有人会看到它。”

没有人看到它。或者说,看到了但没有停下来读它。北京这边的算法团队还在优化推荐效率。他们正在测试一个新的模型版本——内部代号V8——目标是将全球市场的平均互动率再提升百分之三到五。测试数据看起来不错:印尼市场提升了百分之四点二,巴西市场提升了百分之三点八,德国市场提升了百分之二点一。

德国市场的提升幅度最小这件事没有被特别讨论——因为德国市场的基数本来就低,提升空间有限。没有人把德国市场的低提升幅度与柏林办公室那份四十七页的文化敏感词清单联系起来。那份清单还躺在反馈系统的归档区里。标签是“待评估”。评估的标准是什么?

没有人知道。也许那个标准根本不存在——因为“文化敏感”这件事本身就无法被标准化为一条评估指标。这就是出海船队龙骨疲劳的本质:不是某个具体的决策失误导致了裂缝的产生——而是整个结构的承重方式决定了裂缝必然会出现。

都柏林的那位审核负责人不是唯一一个试图用文档对抗遗忘的人。在他发出离职邮件的三个月前,TikTok伦敦办公室的一位政策分析师做过类似的事。这位分析师此前在BBC国际频道工作了六年,2021年加入TikTok时带着对跨文化传播的学术兴趣。

她的工作职责是评估TikTok在英国市场的政策风险,但她很快发现,这个岗位的实际工作内容与招聘时的描述存在偏差——她大部分时间花在将北京中台下发的审核规则翻译成英文操作手册上。翻译过程中她注意到一个反复出现的问题:中文规则里那些看似中性的表述,在英文语境下会衍生出截然不同的操作含义。

比如“对涉及公共秩序的内容保持审慎”这条规则,在中文语境中指向的是对群体性事件相关内容的处理惯例,但翻译成英文后,“public order”在英国法律传统中涵盖的范围要宽泛得多——它可能包括足球比赛后的街头骚乱、环保组织的道路封锁、甚至某些类型的罢工纠察。

伦敦团队按照这条规则处理了一批内容,结果在英国创作者社区引发了关于“TikTok是否在配合警方监控抗议者”的质疑。北京中台收到反馈后的回复是:“请按照当地法律框架自行判断。”这句话在操作层面等于什么都没说——因为“当地法律框架”本身就是一个需要大量专业判断才能落地的概念,而伦敦团队没有法务人员常驻。

这位政策分析师后来制作了一份对照表,左边是北京下发的审核规则原文,右边是她标注的“英国语境下的潜在歧义点”。表格一共四十三行。她将这份对照表通过内部系统提交给了北京中台的产品反馈邮箱,同时抄送了自己的直属上级。

两周后她收到一封自动回复:“您的反馈已进入评估队列。”又过了三周,她在一封跨时区会议的议程附件里看到了自己提交的对照表——它被作为“海外团队反馈汇总”的一部分附在邮件末尾,但会议议程上没有任何一项与它相关。会议持续了九十分钟,讨论了印尼市场的创作者激励方案和巴西市场的直播电商测试数据。

对照表没有被提及。会议结束后,她在自己的工位上把那份表格打印出来,用荧光笔在四十三行标注中圈出了七行——那是她认为最紧迫、最可能导致监管风险的七条。然后她把这张纸贴在了显示器旁边的隔板上。这张纸在那里贴了将近一年。2023年夏天她离职时,那张纸还贴在那里,荧光笔的颜色已经褪成了浅黄色。

跨时区会议中的误解并不总是源于翻译本身。有时候问题出在视频会议的物理特性上——当都柏林团队说到某个具体案例时,北京这边因为网络延迟只听到了后半句;当北京团队展示一组数据时,洛杉矶团队看到的幻灯片比讲解慢了十几秒。这些技术层面的错位在会议纪要中不会留下任何痕迹,但它们确实影响了决策质量。

“算法集权、运营分权”的模式在效率上是合理的——它保证了产品体验的一致性——但在组织健康度上是有代价的——它把本地团队变成了执行者而非共建者。当本地团队还是共建者时——那是2019年到2021年的事——他们愿意忍受模糊性和不确定性,因为他们相信自己在参与创造历史。

但当他们变成执行者后——2022年到2023年的现实——模糊性和不确定性就变成了纯粹的消耗。消耗到最后就是离开。离开的人带走的不只是技能和经验——还有对“连接世界”这个愿景的最后一点信念。而留下的人继续在各种会议中讨论增长策略和效率优化——他们知道裂缝在哪里——但他们已经没有力气去修补了。

2023年4月的一个深夜,北京总部的算法团队还在加班测试V8模型的新参数组合。屏幕上滚动着全球用户增长曲线和互动率数据面板。一条新的反馈线程出现在系统里——来自都柏林办公室的新任内容审核负责人——标题是“关于建立本地化审核标准的建议”。系统自动将这条线程标记为“已归档”。

因为V8模型的测试结果显示互动率又提升了零点三个百分点。这个数字比那条反馈线程重要得多。至少在那个深夜是这样。伦敦那边天亮了。都柏林那边也是。那份放在空工位上的文档草稿还在那里。页脚的“版本3.7”是它最后的编号。不会再有人更新这个编号了。而北京这边的数据大屏上——全球用户增长曲线依然平滑延伸——只是延伸的角度比上个月又平缓了一点点。这一点点变化还没有引起任何人的警觉。但它存在。就像龙骨上的裂纹一样——存在但不被看见——直到某一天风浪足够大时才会显现出来。那一天还没有到来。但它在靠近。以一种算法无法计算的速度靠近着。