第 30 章

身体之后

太平洋两岸从不缺少静默的行业信号,它们大多藏在版本记录、测试日志和不对外公开的研发文档里。2024年夏天,一条横跨东西岸航线的两端,两个信号几乎同时出现。横滨某栋五层小楼里,独立开发者为一款面向老年人的虚拟相册应用写下更新说明,只有一行:“为提高可访问性,确认操作改为手柄输入。”

门洛帕克一间测试室里,工程师在当日日志记下一名受试者的困惑:“他分不清想捏合与不想捏合但也不刻意抑制之间的区别。”两行记录都太短,短到无法进入任何发布稿。

但它们隔着太平洋彼此映照,标记出体感交互走到2024年时被迫面对的新边界:当一套平台定义的“自然”手势无法覆盖七十岁僵硬的手指,当一条肌电腕带试图绕过手指直接读取意图,却撞上意图本身的模糊性,身体作为输入设备的百年史,正被一个更棘手的问题从内部顶开。

这个问题过去五年一直在积蓄。手势识别从2019年进入消费级头显后,平台试图把人类习以为常的动作转译为一套标准化语法。

但手指的弯曲速度、捏合力度、维持时长,都带着年龄、职业、文化甚至病痛带来的差异。独立开发者遇到的那位七十岁用户无法在系统时间窗内完成捏合,场景本身毫无戏剧性:他只是在虚拟相册前停下来,手指有些僵硬。返回手柄的决定也不醒目,安静到可以藏进版本记录。

恰恰是这类安静撤退,暴露了依赖身体外部动作的交互范式,已经触到一根更深的天花板。身体不像键盘,没有被设计为统一接口。外部动作的多样性无法靠一组手势模板穷尽。

于是,产业不再沿着“增加手势、优化识别”的老路前进,而开始问另一个问题:能不能绕过手,绕过手指,绕开所有受文化训练和生理限制的肢体,直接读取身体内部的东西。

这个问题把体感控制器的半世纪历史推到临界位置。1972年,Magnavox Odyssey光枪指向电视屏幕上的光点,机器第一次试图理解人在空间中的位置。那支光枪看上去像枪,实际上只装了一枚光敏电阻和一片透镜,成本不到一美元。

2024年,加州门洛帕克,一群工程师测试一种腕带,不看你手的外部运动,而监听前臂肌肉发出的电信号。从不到一美元的光敏电阻到十亿美元级别的神经接口收购,间隔五十二年。把两者并置在同一个故事里,会显得时间尺度和资本密度都被严重压缩。但驱动这两者的底层结构没有变:精度、成本、内容生态三方来回拉扯,谁先失衡,谁就会逼出下一场范式转移。

这不是一条光滑的技术成熟曲线。如果技术进步和成本下降能自动推动交互革命,那么Kinect在2010年的深度感应精度已经足够高,微软也把价格压到了消费级区间,可它最终没有成为常驻客厅的通用输入设备,原因不在传感器,而在内容生态未能跟上——玩家买了设备,却没有足够的游戏和应用可玩。

反过来,Wii遥控器的空间追踪精度远逊于同期方案,任天堂却靠《Wii Sports》一揽子内容,把控制器卖进许多非玩家家庭。两次转折放在一起看,生态从未只是被动响应技术,它在三角中常常是决定人愿不愿意长期使用的那个变量。

技术成熟度曲线只描述某一种技术何时变得可用,却不解释为什么可用的技术有时打开市场、有时被市场绕过。后者的答案必须回到精度、成本、内容生态三方的具体关系里找。到2024年,这个三角的每一极都被神经接口重新定义。精度不再是传感器物理分辨率,而变成预测意图的时间提前量;成本不再是物料清单,而变成训练模型所需的海量神经数据和算力;内容生态也不再是开发工具链,而变成意图理解算法与用户心理模型之间的匹配度。三极的性质变了,三角的结构没变。认识这一点,是理解“身体之后”这片水域最可靠的坐标系。

推动这一转向的公司并非同时出发。最先把前臂肌电信号带进消费级视野的,是一家名为控制实验室(CTRL-labs)的初创公司。它提出的技术路径不新鲜:运动皮层在肌肉收缩前大约两百毫秒就已经出现可识别的电信号模式。

神经科学家很早知道这个提前量,但直到深度学习算法足够快、柔性干电极足够廉价、虚拟现实头显卖出足够多台,这个两百毫秒才从一个实验室观测变成可能的交互窗口。CTRL-labs做的,是用皮肤表面高密度电极阵列捕捉前臂肌电信号,再通过卷积神经网络解码具体手指动作的意图。2018年公开的一段演示中,工程师手和手腕纹丝不动,屏幕上的虚拟手却捏合、指点、抓取。那几秒钟没有立刻改变市场,但留下了一个精确的暗示:机器可以不再等待身体行动,而提前读取身体准备行动的信号。

这个提示的产业价值,在2023年9月Meta完成对CTRL-labs收购时变得清晰。收购价格据公开报道在五亿到十亿美元之间,对一家尚未发布消费级产品的公司而言,这个数字表明的不是对一项配件技术的估值,而是对重新定义市场竞争格局的押注。Meta高层在交易后公开阐释其逻辑:肌电腕带若能解码手指意图,用户就不必再学习平台定义的手势集。

对从2019年起陷入手势语法麻烦的行业来说,这个承诺诱人。它试图把“自然交互”从一套需要学习的语法,还原为“像平时一样活动手指”。

但“像平时一样”隐藏了巨大工程难题。肌电信号不是标准语言。每个人的肌肉结构、皮下脂肪厚度、皮肤导电特性都不同;同一个人在不同疲劳程度、不同含水量、不同佩戴位置下,信号特征也会波动。

因此,每个用户戴上腕带后,都需要先校准,让算法学习他独有的肌电模式。校准需要多长时间,直接决定消费者会不会在体验中途摘下设备。若只需三十秒,产品有机会;若要半小时,大多数人会放弃。

这个难题把三角的新权重暴露出来。在肢体动作追踪年代,精度由传感器空间分辨率和采样率决定,成本来自制造传感器和芯片,内容生态围绕游戏引擎和动作识别算法。

在神经信号解码年代,精度变成意图预测提前量与准确率之间的权衡——越早预测,准确率越低;等待更多信号,延迟越大。成本从硬件制造转向数据采集与模型训练。

每个用户都要提供个人化训练数据,每组数据都需要算力处理。内容生态则从设计“X动作触发Y结果”的规则,转向让算法对意图的预测与用户实际期待之间建立映射。这不是原有三角的缩小或放大,而是它的内部化学变化。

这种变化更深一层来自数据性质。肌电信号不只是手部意图的电报,它还包含自主神经系统特征:心率变异性、肌肉紧张基线、疲劳程度。持续记录并分析这些信号,足以重建用户的情绪状态、压力水平和注意力起伏。

传统“疲劳经济”把身体出汗、心率、卡路里转化为可交易健康价值,神经接口则把认知疲劳、情绪波动、注意力散焦也纳入可量化范围。它不再只测量你做了多少动作,而要测量你准备做多少动作,以及你为这些动作付出了多少不可见的神经代价。

于是,设备采集的对象不再只是交互数据,而升级为生理状态数据。法律上的隐私门槛随之抬高——眼睛看哪里已经算高度敏感,前臂肌肉发出的电信号比注视方向更进一步,它可以接近一个人的内在状态。苹果进入同一片水域时选择了更保守的路径。

2023年6月发布的Vision Pro没有使用肌电腕带,而是把意图拆分成两个系统:眼动追踪负责判断用户可能想要什么,拇指和食指轻捏负责确认。

这个组合像先瞄准后开枪,比起直接解码运动皮层信号,其好处是每一步都可观测、可修正、可向用户解释。眼动追踪的传感器阵列精度出色,多数早期评测者用“几乎读心”形容其响应。但这份精度对应于高昂物料成本:多颗红外摄像头从不同角度照射眼球,分析瞳孔位置和角膜反射,再配合头部摄像头追踪手部动作。这套硬件的成本远高于单摄像头方案,并且它记录的眼动数据如果被上传,将比面部图像或声纹更私密。

注视模式可能透露性取向、政治倾向、认知状态,甚至可作为某些精神疾病的辅助诊断信号。苹果在发布时更新隐私政策,承诺眼动数据留在设备本地。

但第三方应用仍可请求“使用注意力数据改善体验”。什么构成“改善体验”,解释权并不总在用户手里。苹果内部也有工程师在讨论中承认,眼动系统不可能完全不预测。

当用户的注视点快速扫过多个目标,系统必须判断哪一个才是真正想要交互的对象,这个判断本身就是预测。区别只在于时间窗长短,以及系统是否把预测结果显式提示给用户。苹果的选择是黑箱化:让用户感到系统似乎瞬间理解了自己的意图,而该理解实际建立在数百毫秒眼动轨迹分析和机器学习推断之上。一个工程师在内部评论中写道:“这就是为什么我们不做预测,只做响应。”这句判断不是技术真理,而是产品伦理立场:系统可以在后台预测,但不把预测变成引导。

这个立场揭示神经接口产业最尖锐的张力之一:当机器从追踪可见动作转向解读身体内部信号,因果链不再被用户直接看见。Wii时代挥一下手臂,屏幕人物挥一下球拍,你看见原因与结果。肌电腕带时代,你产生一个意图,传感器捕捉一组信号,算法解码,系统执行,中间两个环节完全不透明。用户无法知道系统是否真的执行了自己想要的,还是算法在信号模糊处做出最佳猜测。

在西雅图东北方向一处商业园区,Valve在这个问题上保持了与Meta和苹果都不同的节奏。Valve创始人加布·纽维尔(Gabe Newell)在2020至2021年新西兰隔离期间接受少量远程采访时,说了一句被广泛引用的话:“脑机接口不可避免。”紧跟着的半句更容易被忽略:“问题在于时间尺度。人们往往高估两年内能实现的事,低估十年内能实现的事。我们的投资按十年尺度规划。”这句话没有给出具体产品,但给出了判断方式。

Valve在脑机接口上的投入从未官方公布金额或时间表,专利文件和招聘信息却拼出一条可追踪的路径:2019年与一家名为开放脑电(OpenBCI)的公司合作,开发能嵌入头显的非侵入式脑电传感器;2022年申请免校准稳态视觉诱发电位脑机接口专利;2023年申请头显干电极阵列专利;2024年初申请多模态用户意图预测系统专利,输入包括脑电、眼动、手部姿态和心率。与CTRL-labs走肌电不同,脑电直接从头皮采集皮层电活动。

它更原始、信噪比更低,但能触及更早的一层:不是运动指令发出后的残留,而是运动指令刚形成时的皮层激活模式。肌电腕带若提供约两百毫秒提前量,脑电理论上可达三百至五百毫秒。在游戏上这点提前量可能决定胜负,但在更广人机交互中,它意味着机器可能在用户自己意识到某个意图之前就开始响应。

这个时间窗口把“意图”从哲学概念拖进工程学。算法若能在人有意识决定之前预测其行为,那么预测是在读取意图,还是用户的意图因被读取才被构造为意识经验?

2008年柏林伯恩斯坦计算神经科学中心一项经典实验声称,受试者在两个按钮间做自由选择时,其前额叶皮层可在有意识决定之前最长达十秒表现出偏向性激活。实验方法后受到争议,未能成为定论,但它悬留的问题没有消失。若有意识决定只是神经活动的后果而非原因,机器读取这些神经活动时,究竟是在读你的决定,还是读那些你以为“自己做出”的决定之前的放电模式?2024年这个问题没有确定答案,却已在产业实践中产生后果。

Meta在Quest头显某次固件更新中加入实验功能:系统依据手部姿态和注视方向,预测用户接下来半秒可能点击哪个界面元素,提前高亮该元素。有用户觉得自然,有用户觉得被引导。一位用户在技术社区写道:“它不是在读我的心,它是在写我的心。”这句评论未改变任何产品路线图,却指出预测型交互的一句潜台词:在用户意识到选择之前显示选项,可能不是在服务意图,而是在塑造意图。

这种被推动的感觉,在产业层面更加清楚。三家公司的三条路径,构成某种默认分工。Meta押注前臂肌电,希望离手部动作生理信号最近,信号相对清晰,但要佩戴腕带且需要校准。苹果押注眼动加微手势,传感器都在头显内部,无需额外穿戴,但物料成本高,双手必须留在传感器视野的狭窄空间里。Valve押注脑电与多传感器融合,信号维度最丰富,信息量最大,但信噪比最低、技术成熟度最远、产品时间表最不确定。

三种路径同时出现,不是某家公司的研发路线图提前写好的,而是三股压力共同作用于2024年的结果。

手势语法标准化困境推动它们向身体内部寻找更普适的信号;硬件补贴模式难以为继推动平台采集和分析更高价值的生理数据;竞争对手任何一家先实现“不用学、不用校准、不用可见动作”的自然交互,就可能一夜重排行业格局。没有一家敢赌自己站在原地还能安全。2024年秋天,东京游戏展的虚拟现实专区把三种路径摆在同一片展馆里。Quest展台把肌电腕带封闭在独立体验间,参观者需预约,每人体验结束。

工作人员每轮清除数据,既为隐私,也为校准精度。Vision Pro展台把整套手势流程变成标准化考试:引导员口述步骤,参观者按指定节奏注视、捏合、松手,动作规范得几乎看不出个人差异。展区边缘,京都大学神经科学博士生搭了个更不起眼的展位。

十六个干电极脑电帽,开源信号处理算法,能识别四种运动想象。无人预约,无人清除数据。任何走过的人都可以坐下,戴上帽子,想象自己正在捏左手或右手,然后看屏幕上的虚拟手延迟约一秒半后做出相应动作。准确率约七成。

它不采集个人数据、不校准、不收费、不隐藏算法,在展馆里像一种安静的挑衅。一位游戏产业分析师在展后评论中捕捉到这种张力。他写道,当科技公司说需要我们的神经数据让交互更自然时,我们需要问两件事。第一,他们说的自然是谁的自然?是二十五岁硅谷工程师的手指活动模式,还是七十岁横滨退休教师的?第二,当交互变得如此自然,以至于我们分不清是自己在决定还是算法在替我们决定——那还叫交互吗?

这个问题没有技术答案,但它标出了一道边界。五十年间,体感交互一直在问机器如何理解身体。从2024年起,问题被替换成机器理解身体之后会发生什么。前一个是工程问题:传感器精度、算法效率、用户体验。后一个是政治问题:谁拥有被解码的身体信号,谁有权解释这些信号的含义,谁从解释中获利。

门洛帕克那栋三层建筑里,一场测试正在进行。一位六十岁的测试者被招募进来,正是因为他不在二十五到三十五岁硅谷工程师的常规区间。他第一次戴上肌电腕带。

校准程序引导他按屏幕指示做出捏合、抓取、伸展。前两次尝试,系统准确率在六成左右徘徊。技术人员调整腕带位置,重新开始。第三次校准,准确率升到八成五。

但测试进入下一个环节后,系统要求他不要移动手指,只在心里想着捏合的动作。准确率跌到四成以下。他摘下腕带时说了一句话。现场一位工程师把它写进当天的测试日志:“他说,他分不清‘想捏合’和‘不想捏合但也不刻意抑制’之间的区别。他说他的手指有一个自己的意愿,不总是听他的。”这行日志不会出现在任何产品发布会上。它太朴素了。

但它描述的现象——当身体动作被绕过,当意图被要求以一种可由机器读取的形式出现,当想和做之间的缝隙被拉大到人的感知无法弥合——将在未来很多年里成为体感交互最深的张力源。在横滨,那位独立开发者的版本记录只有一行字。在门洛帕克,测试日志上也只有几行字。两段文字隔着太平洋,分别记录了两个技术路径上的微小阻力。

把它们放在一起读,会看到某种对称:手势交互试图覆盖所有人时,遇到了身体的多样性;神经接口试图绕过身体多样性时,遇到了意识本身的模糊性。在这两者之间,一个产业正在认识到,它试图解决的问题——如何让机器理解人——可能不是可以被彻底解决的技术问题,而是一个需要持续谈判的社会问题、商业问题、政治问题。这种认识并不虚无。

它恰恰说明旧的解释框架为何仍然有效。当有人试图把体感控制器史写成一条技术成熟度曲线时,他们漏掉了每一次范式转换真正发生的条件:不是某个技术参数突破了临界值,而是精度、成本、内容生态三者之间的既有平衡被打破,新的平衡又无法立刻建立。Wii打破了成本与精度的平衡,用低精度换来低价和大规模内容供应。Kinect打破了内容生态与硬件的平衡,让内容数量第一次受到身体追踪精度的直接牵制。

手势识别打破了手柄与裸手之间的成本假设,却没有准备好覆盖不同身体的内容语法。如今神经接口正试图再打破一层——从追踪身体动作到预测身体内部意图。

精度被重新定义成提前量与准确率的权衡,成本从物料清单转向神经数据与算力,内容生态从规则设计转向对用户心理模型的匹配。三角没有消失。三角内部的东西被替换了,结构仍在运转。

这也许就是“身体之后”最准确的含义。不是身体不再重要,而是身体从被观看的物体变成可被计算的信号源。光枪时代的身体是枪口对准的姿势和扣动扳机的手。Kinect时代的身体是骨骼点与深度图。手势识别时代的身体是一套需要学习的语法。神经接口时代的身体不再是统一的、公共的动作,而是每个人独有的、杂乱的、被噪声淹没的肌肉电信号与皮层活动。越向身体内部走,身体越不像一台标准设备。

越接近所谓“自然交互”,越暴露出自然这个词的人为构造。那个东京游戏展上的开源脑电帽没有校准,没有隐私协议,也没有商业闭环。它识别四种运动想象,延迟一秒半,准确率七成。

它站在三家公司的展台之间,像一个未经打磨的反例:如果意图读取必须依赖个人化模型和海量数据才算“好用”,那么它究竟是在消除身体的差异,还是在把差异转化为新的资源?旧金山现代艺术博物馆的那件装置仍然立在那里。

枪口对准显示器镜片,眼睛看向枪管。这件1999年入藏的作品无意中捕捉到了比任何路线图都长命的真相:体感交互的历史,既是一部人类将身体翻译给机器的历史,也是一部机器在翻译中反过来重塑身体的历史。

光枪教人们瞄准、扣动、追踪移动目标。那些动作在光枪出现前已存在,但在光枪之后被标准化为与机器对话的语法。肌电腕带教人们在手指移动之前就产生可被解码的明确意图。这种意图在腕带出现之前是否以同样形式存在,在腕带出现之后是否会被训练成更清晰可读的模式,没有人确定。

那个在门洛帕克摘下腕带的六十岁测试者说,手指有自己的意愿。那个横滨开发者在版本记录里写,确认操作改为手柄输入。两句话都不构成对未来的判断。它们只是同一个历史进程晚期出现的两处细小注脚。

这个历史进程从1972年一把低精度的塑料光枪开始,到2024年一条尚未量产的肌电腕带,中间是半个世纪的博弈和反复。精度、成本、内容生态每一次失衡,都逼出一段新的产品史,也逼出人类身体与机器之间新的翻译协议。身体之后,翻译并没有结束。

它只是进入了原文与译者开始互相干扰的区域。而那个区域,仍然需要被三角框架照亮。当算法能够在人的有意识决定之前预测行为,当平台把神经信号当作新的数据资产,当“自然交互”成为一件需要付费购买、预先定义、持续校准的商品,体感控制器的百年进化并没有停在某一台设备上。

它停在一个问题上:机器理解身体之后,谁来决定这个理解应该服务于什么。这个问题不是总结,它已经写在下一个十年的产业选择里,写在每一份隐私政策、每一次固件更新、每一次是否允许第三方读取注意力数据的批准或拒绝中。它仍然是精度、成本与内容生态的博弈,只是这一次,三条边都伸向了人体内部。