第 29 章

手势的语法

从深圳港到长滩港,再到横滨港,一条横跨太平洋的消费电子产品航线在2020年代初期变得比以往更加繁忙。集装箱里装着的除了手机和游戏主机,还有一种新的货物:头显。这些头显在离开代工厂之前,被装入同一个固件包,包里除了操作系统和安全更新,还有一组被称为“手势识别”的模型权重。这批货物抵达不同港口之后,会进入完全不同的客厅、办公室和游戏房。等待它们的用户说着不同的语言,使用不同的货币,更关键的是,他们使用双手的方式并不一致。

这个事实在运输报表和海关文件里完全不可见。没有人会为一个手势申报关税,也没有货单会标注“本产品包含硅谷身体习惯”。但这些习惯确实被装进了每一台设备,跟随跨国航线一起,被送到了那些从未踏入门洛帕克实验室的人手中。

这条看不见的手势航线在2019年秋天形成。那一年,Oculus公司向Quest头显推送了第一版裸手追踪功能。此前的体感交互都依赖物理控制器,用户手里必须握着什么东西。

任天堂Wii的手柄,索尼Move的发光棒,微软Kinect虽然不需要控制器,但它识别的是全身骨架,不是手部细节。Quest的手势追踪第一次把手指从设备中解放出来。用户只需要把手举到头显摄像头前方,用食指和拇指捏合,就可以选中菜单上的项目。手掌向左划就是翻页,食指伸出就是指向。Oculus的工程团队在发布说明中把这些操作称为“自然手势”,并强调用户无需借助任何按钮或触摸板。

对很多用户来说,这确实是一种解放。他们从抽屉里拿出已经吃灰的控制器,发现它不再被需要了。

但解放只是一种错觉。控制器被拿走了,取而代之的是一套更加隐蔽的规则。这套规则的成文版本可以在Oculus开发者文档中找到,但它的真正来源在门洛帕克的测试间里。

Oculus的测试间是手势语法的第一所语法学校。每天下午,测试者会轮流戴上头显,在摄像头前重复几十组动作。工程师在旁边记录识别精度,调整算法参数,然后让测试者再来一遍。

测试者大多来自公司附近的社区,年龄集中在二十到四十岁之间,职业以工程师、设计师和游戏测试员为主。他们习惯用食指指向屏幕,习惯用拇指和食指捏合表示确认,习惯在思考时把手掌摊开。这些习惯被摄像头捕捉下来,成为训练数据的组成部分。识别算法通过这些数据学会了什么是“指向”,什么是“捏合”,什么是“滑动”。开发者文档中的参数随之确定下来。

捏合被定义为一个极其精确的动作:拇指指尖与食指指尖的距离必须小于某个像素阈值,两指关节的弯曲度必须同时进入预设区间,整个动作的持续时间必须在极短的时间窗口内完成。这个定义足够精确,精确到可以被写进一行代码。但也足够狭窄,狭窄到此后五年里,那些不属于门洛帕克测试间的双手,都在为这一行代码付出学习成本。

这个学习成本首先在距离硅谷九千公里的地方显现。2020年,Oculus开发者论坛上出现了一批新的帖子。这些帖子不是英语母语用户写的,其中一些来自日本开发者。

他们描述了一个反复出现的现象:当地用户在测试社交类应用时,会不自觉地在对话结束时做出轻微点头和身体前倾的动作,头部前倾的幅度很小,但双手有时会随着身体微微下移。这种动作在面对面沟通中表示礼貌和确认,是高度社会化的身体语言。但Quest头显的摄像头追踪的是手部位置相对于头显坐标系的移动,身体前倾导致的相对位移被算法解读为“向下滑动”。一个表达感谢的鞠躬,在系统里变成了一次页面下拉。用户的初衷与系统接收到的指令完全相反。

更棘手的是,这个误读不是偶发的。因为它来自一组高度一致的文化习惯,所以每次用户做出类似动作时,系统都会给出同样错误的响应。

日本开发者在论坛上贴出了视频。视频中,头显画面里,光标随着用户鞠躬而向下移动,页面上的内容也跟着滚动。用户抬起头后,页面已经不在原来的位置。

开发者在帖子里写道,他最初以为这是某个环境变量的干扰,后来发现所有日本测试者在社交场景中都会触发同样的行为。技术支持人员给出的建议是让用户“保持头部稳定”“将手部动作与头部动作分开”。

这些建议在技术上没有错误。但在社交现场,一个人如果被要求“保持头部稳定”表达感谢,他就不再是在表达感谢了。他在执行一个技术动作。

技术支持人员给出的建议是让用户“保持头部稳定”“将手部动作与头部动作分开”。这些建议在技术上没有错误。但在社交现场,一个人如果被要求“保持头部稳定”表达感谢,他就不再是在表达感谢了。他在执行一个技术动作。

这正是手势语法面临的第一重困境:它把社会性的身体动作当成了机器指令,并假设这些指令在任何文化中都有相同的形态。它没有意识到,身体动作首先是社会动作,然后才是输入信号。

对于系统而言,鞠躬只是手部位置在空间中的向下位移;对于用户而言,鞠躬是一个完整的社会表达,手部动作不过是附带发生的。系统只看见了手,没看见鞠躬。这种“看”的方式,是门洛帕克测试间里没有人教过它的。

同一时期,来自中东地区的开发者开始报告另一类问题。一些当地用户在尝试指向物体时,会使用四指并拢、掌心朝下的手势,或者用并拢的食指、中指与拇指形成特定角度。在部分情境中,单独伸出食指被认为不够礼貌,因此用户在公共空间中更习惯用整只手或者并指的方式指示方向。

但在Quest的追踪算法里,只有一个明确的食指轮廓才能被识别为“指向”。并指的手势在灰度图里显得模糊,食指与中指的轮廓边界不够清晰,算法因此将整只手判定为“手掌张开”,从而触发一个完全不同的命令。用户多次尝试,系统都没有把光标移动到目标位置。开发者尝试在应用层做二次识别,但系统底层传来的数据已经经过了Oculus手势模型的过滤,原始像素无法获得,应用开发者不能自己训练模型。

他们只能建议用户改用单根食指。一位开发者在自己的博客中写道,他的测试用户在头显前经历了一种“身体上的外语感”——他们知道自己要做什么,但系统听不懂,于是他们被迫用一个不熟悉的动作去表达一个熟悉的意图。

这句话后来被多个论坛引用,但Oculus的更新日志从未承认过这个问题是一个跨文化适配问题。它始终被归类为“手势识别精度待提升”。

为什么提升识别精度没有解决这些问题?因为所谓识别精度,通常指的是算法在特定测试集上的误差率。测试集由谁构成,决定了精度被指向何方。

如果测试集里的“指向”样本全部来自食指伸出的动作,那么算法对食指的识别精度越高,它对并指指向的排斥就越强。高精度不是中立地“更好地识别”,而是更严格地执行某种被选定的标准。Oculus在2019年到2023年间确实多次更新了手势追踪模型。论坛上的用户也普遍承认,捏合识别的稳定性提高了,滑动动作的误触减少了。

但这些改进都发生在同一套手势词汇的内部。它们让系统更快地识别门洛帕克定义的动作,同时更果断地拒绝了那些门洛帕克没有定义的动作。这就像一本语法书修订了标点规则,却没有收录任何新词。外国用户依然在学习一门他们从未参与编写的语言。

微软比Oculus更早进入手势领域。HoloLens在2016年左右就采用了空中手势交互。它的开发者版本定义了一套简洁的手势集:食指与拇指捏合相当于“点击”,伸出手掌相当于“菜单”。

微软的设计团队把目标用户定位在企业和行业应用,因此手势数量刻意控制得很小。

雷德蒙德的工程师们相信,越少的手势意味着越少的学习成本。这一策略在企业场景中确实有效。培训一名工厂工程师记住两三个手势,比记住十几个手势要容易得多。

但微软的手势同样来自雷德蒙德实验室的身体习惯。它的“点击”手势与Oculus的“捏合”在物理形态上非常相似,但在识别判定上存在差异。

微软的系统更依赖深度传感器对手指落点的空间计算,而Oculus在Quest上使用的是单色摄像头加神经网络估计。两家公司对同一个物理动作给出了不同的算法定义。这意味着用户实际执行的动作,在微软设备上可能被判定为一次点击,在Oculus设备上却不被识别。同样一个动作,跨过两家公司的设备边界,就不再是同一个动作。

苹果在2023年的加入使这种分裂进一步制度化。Vision Pro发布会上,苹果的人机交互团队展示了一套令人印象深刻的方案。用户不需要用手去指向任何东西。他们的眼睛先注视目标,然后手指做一个极轻的捏合动作,系统就完成一次选择。

苹果称之为“眼动与手指轻捏”的组合。在库比蒂诺的设计哲学中,这是最接近人类本能的交互方式。人类天然会注视自己感兴趣的对象,也天然会用手指做出细微的确认动作。

苹果的工程团队花了大量时间测试“轻捏”的力度阈值。最终确定的标准是:用户只需要让拇指和食指的指尖发生轻微接触,接触力度低于通常触发压力传感器的阈值,指尖位移不超过几毫米。

这个动作的力度之轻,轻到几乎不能称之为“捏”。苹果的工程师在专利文件中把它与“捏合”区分开来。他们认为捏合需要肌肉主动发力,而轻捏更接近一种神经层面的微动。

这是一种设计上的雄心。苹果想把用户从肌肉中解放出来,只保留最小限度的身体参与。但这个最小限度的定义,完全来自库比蒂诺的测试人群。

当Vision Pro进入市场后,用户很快在这个“最小限度”上暴露出差异。有些人无法稳定地控制指尖接触的力度,他们要么用力过猛,导致动作被判定为“拖动”或“长按”,要么接触时间过短,系统没有捕捉到。

有些用户则是反过来:他们太习惯按钮了,无法相信如此轻的接触能触发操作,因此在捏完之后还在等待反馈,结果眼动已经移到了下一个目标。苹果在指南中给出了大量练习建议,帮助用户掌握眼动与手指的协同节奏。一个被包装为“天生就会”的交互方式,在官方文档中需要花掉一整章来解释其正确使用方法。这个反差比任何分析都更有说服力。

自然手势并不是不需要说明书,而是它的说明书被写在了与“自然”不同的另一个层面:对身体的规范化要求。这些要求越是精确,就越容易在文化、年龄和身体机能的差异中暴露出边界。

三套手势语法到2024年形成事实上的分裂。Meta的Quest体系保留了捏合、滑动、指向等多个手势,并在后续更新中增加了系统级快捷操作,试图用手势覆盖大部分菜单交互。微软的HoloLens体系维持了少量手势,服务于企业培训和远程协作。苹果的Vision Pro体系则把大部分选择交给眼动,手指只承担极轻的确认。三家公司的专利文件把这种分裂写成了法律权益。

对于同一个“选择”操作,Meta的专利描述的是手指姿态的组合识别,微软的描述侧重于空间深度传感器中的指尖位置关系,苹果的描述则是眼动注视与轻捏动作之间的时间协同。一个“选择”,三种技术定义,三种权力归属。开发者若想跨平台部署应用,就必须为这三种定义分别适配。适配成本并不低。

那些以手势交互为核心的虚拟白板应用、远程协作工具和游戏菜单,需要在代码中维护三套手势映射。有的开发团队选择只支持最基础的动作,以求在多个平台上保持一致。结果就是,手势交互的词汇量在生态压力下被压缩。平台间的语法分裂没有激发出更多手势创新,反而让开发者更加保守。

这种保守正是“精度-成本-内容生态”三角失衡在交互设计层面的体现。手势识别精度的提升没有降低生态适配的成本,反而因平台差异而提高了跨平台开发的复杂度。内容生态的收缩又反过来减少了用户接触新手势的机会,用户越少使用手势,平台就越没有动力扩大手势词汇。三角中没有一方能够单独打破循环。

Meta选择增加手势数量,但它无法强迫苹果和微软接受同样标准。苹果选择精简手势,但它无法让Meta的开发者放弃他们已经在应用中使用的手势集。微软坚持企业场景,但企业用户也会在个人生活中使用其他设备。标准的碎片化让手势交互无法获得稳定内容生态的规模效应。

这与手柄交互形成鲜明对比。手柄按键在不同平台上几乎是通用的,A键就是A键,扳机就是扳机。手柄是一个工业标准化的产物,而手势是一个被平台私有化的技术对象。

平台私有化的最大代价,落在了用户的身体上。跨文化人机交互研究在2020年代初期开始积累一些田野调查。

这些调查往往由高校研究团队完成,样本量不大,但记录了许多工业开发团队不会注意到的细节。在东亚部分地区的社交情境中,用整只手掌指向物体比用食指更常见,因为后者可能带有指责意味。在一些中东和南亚地区,用并拢的手指或头部轻微倾斜来指示方向是常见的礼貌做法。拉美一些地区则在非正式交流中使用拇指动作表达不同层次的含义。

这些田野记录显示,指向、确认、否定、滚动等操作,并没有全球统一的“自然”形式。每一种形式都嵌入在特定的社交规则中。然而,这些研究大多发表在人机交互学术会议上,影响因子不高,工业界很少有人专门跟进。原因在于,这些差异并不像肤色、手型、关节角度那样可以被计算机视觉系统直接量化为“特征分布”。

文化是一个需要被标注和分类的维度,而数据工程师并不擅长处理这种维度。更根本地说,收集不同文化中的手势样本,并把它们加入训练集,需要一家公司承认其现有“自然手势”并不自然。这种承认本身就是一个商业和品牌问题。承认自然是被建构的,就是承认自己的设计需要修正,而修正往往意味着成本上升和发布周期延长。

这种成本压力解释了为什么三家公司都不约而同地使用“自然”这个词。它不是对事实的描述,而是一种营销修辞。它把用户期待设定为无需学习的即时掌握。当用户发现需要学习时,他们倾向于把失败归因于自己,而不是系统。这正是身体规范得以隐蔽建立的原因。

论坛上,用户问得最多的问题不是“为什么我的习惯不被识别”,而是“我怎么才能做出标准动作”。用户已经接受了系统的标准,并试图通过改变身体来接近它。只有少数开发者和研究者把这个逻辑翻转过来,问了一句:为什么标准不能来自我们的身体?这个反问在论坛里得到的回应通常很冷淡。技术支持人员不会回答它。产品经理不会回答它。它太深,也太难,不适合进入迭代排期。

但这个问题并不会因为没人回答就消失。它在日常使用中反复出现。老年用户无法做出标准的轻捏,因为他们手指关节的灵活性在下降。手部震颤患者无法保持指尖在镜头前稳定,因为他们的手在不受控制地移动。单侧肢体不便的用户无法同时完成眼动和轻捏的协调,因为他们的身体已经适应了另一种输入节奏。这些用户不是少数。

世界卫生组织的统计中,有相当比例的人口存在某种形式的运动功能限制。当手势交互声称“没有控制器,更自然”时,它其实建立了一个更高的身体门槛。

控制器按钮需要的肌肉活动很少,而裸手交互对肩部、手部和指部的控制精度要求更高。虚拟健身一章中暴露的生理极限在这里以另一种形式回来了:身体差异没有被消除,只是从健身场景移到了基础交互场景。这种状态让所谓“手势的语法”处在一种未完成中。语法之所以叫语法,是因为它提供了可预期的规则系统。

但这些规则在2024年并不统一。Meta的语法和苹果的语法不同,微软的语法又与前两者不同。用户在设备之间迁移时,并不是在翻译,而是在重新学习。开发者面对的不是一部通用语法书,而是三本互相矛盾的地方用语手册。

内容生态因此不可能围绕手势形成像现代游戏手柄那样的成熟产业标准。手柄时代,任天堂、索尼和微软的控制器布局虽有差异,但按钮功能在游戏开发商和玩家之间高度通用。这种通用性让游戏产业得以标准化,让手柄成为跨越平台和内容的稳定输入端。裸手手势恰恰相反。它本应比手柄更普遍,因为每个人都有一双手。

但手势的定义权被平台切碎,反而让这双人人拥有的手变得比塑料手柄更难通用。这个反讽正是手势语法标准化困境的实质。一个追求普遍性的输入方式,因为定义权的分裂而失去了普遍性。2024年的公开数据显示,全球头显出货量在增长,但手势交互的使用时长占比没有同步扩大。许多用户在浏览菜单和媒体播放时使用手势,在进入游戏或复杂应用时依然拿起手柄。

这并不意外。手柄的物理反馈、稳定识别和低疲劳特性,使得它在高频交互中仍然优于裸手。裸手手势在长时间使用时还会带来新的疲劳。手臂悬空在胸前,肩膀持续发力,手指不断做出微小动作。这种疲劳不是虚拟健身式的大肌肉群消耗,而是一种更细微的静态疲劳。

它发生在肩关节和指关节,用户往往在摘下头显后才感觉到。这个体验很少被厂商提及,但它直接影响用户是否愿意在下一次进入头显时继续使用手势。身体记忆会记住那些不舒适的瞬间,并自动回避它们。用户的双手在虚拟空间中的自由,是有生理条件的。这个条件被“自然手势”的修辞掩盖得非常好。

手势语法的文化冲突和身体门槛,共同构成了体感交互在2020年代初期的深层危机。但这个危机并不等于失败。它更像是一面镜子,把整个体感控制器发展史中一直被回避的问题照了出来:每一个关于“自然”的交互设计,都是对某些身体习惯的选择和对另一些身体习惯的排除。这个过程从Wii时代就开始了。

Wii的手柄让用户用挥动代替按键,但它假设用户能够握住一个柱状物体。Kinect让用户用全身控制游戏,但它假设用户面前有一块足够大的空地。Quest让用户放下手柄,但它假设用户的手能被摄像头看到,并且动作符合算法预期。Vision Pro让用户用手指轻捏,但它假设用户能够完成极细微的指尖控制。

每一代交互创新都在扩大某些身体的使用范围,同时制造出新的排除边界。裸手手势只是一个更极端的版本:它把排除机制从硬件兼容性扩展到了文化兼容性。用户手里确实不再需要控制器了,但他们的身体必须学会一种新方言。三家公司仍然在各自的发布台上展示着未来。

演讲者站在暗场中,手指轻轻一捏,虚拟界面便响应。台下掌声响起。这个画面在Meta Connect、苹果全球开发者大会和微软Ignite上都出现过,几乎成了行业的标准演出。它传递的信息始终一致:手是最终的输入设备,自然的动作无需翻译。

但在这些舞台之外,开发者论坛和用户社区里,另一组画面正在累积。有人在头显前反复练习捏合,直到肩酸。有人因为系统无法识别他们的指向而放弃了一个应用。有人在日本用鞠躬表达感谢,页面却向下滑走。这些画面没有出现在发布视频里。

它们散落在网络边缘,数量不大,却足够说明一个问题:手势语法的标准化,并不是选择几个最优动作那么简单。它要回答的是不同文化、不同年龄、不同身体在同一个虚拟空间中如何共同存在的问题。这个问题没有一个算法可以单独解决,也没有一个标准可以单独建立。

它需要跨文化的测试、跨学科的设计和跨平台的协商,需要以身体差异为起点,而不是以身体差异为噪声。然而,三家公司都不愿意放弃对“自然”的定义权。

这个定义权意味着谁能决定全球用户在虚拟空间中的标准动作。它带来的是平台的排他性、开发者的依赖和用户的习惯锁定。如果用户习惯了苹果的轻捏,他们就会在交互标准上依赖苹果的生态。如果开发者围绕Meta的手势库建立了内容,他们就不会轻易离开。手势语法在2024年的分裂,因此不能被简单地视作一个短暂的行业过渡状态。它更接近于一种新的竞争前沿。

专利、框架使用条款和设备底层权限,正在把所有不受平台控制的手势排除在标准之外。用户可以随意做出任何他们从小就在使用的动作,但只要这些动作没有进入平台的手势库,它们就无法激活任何功能。真实的身体动作是公共的,可被机器识别的手势是私有的。

这个落差在五年间被逐渐固化。它使得“自由”成为一项需要由用户付费购买的、被平台预先定义好的体验。在横滨的一间小办公室里,一位独立开发者正在测试一款面向老年人的虚拟相册应用。

他的初期版本使用了Quest的手势模板,测试过程中,一位七十岁的用户在尝试捏合时手指有些僵硬,无法在系统要求的时间窗口内完成动作。开发者随后把确认方式改成了手柄按键,测试顺利通过了。这个改动被写在版本记录里,只有一行字:“为提高可访问性,确认操作改为手柄输入。”这是一种安静的撤退。

它没有否定手势交互的未来,也没有改变任何平台标准。它只是在具体用户的面前,重新拿起了一个被宣称已经过时的设备。虚拟手柄在那个瞬间重新出现,就像一个被遗忘的翻译者站回了对话现场。它不理解用户的文化习惯,但它抓住了用户能用身体掌握的唯一通用动作:按下按钮。这个动作也不是天生自然的。它同样是工业时代的身体训练产物。

但至少它的训练成本低廉,它的反应可预期,它在不同文化之间的摩擦更小。于是,在裸手手势高调登场的五年之后,控制器依然留在桌上。手势的语法在成形,但它的词汇还很短,它的边界来自一次次误识别。用户的双手握着虚空,偶尔出错,偶尔被理解。而理解他们的,还远不是这架机器的全部。