第 21 章

玩家的目光

俯瞰欧洲学术版图,科隆大学视觉认知实验室的探索正悄然推进。将视线聚焦于莱茵河畔校区东翼那栋五层建筑的顶楼,2023年秋天,这里完成了一项研究。论文标题措辞谨慎——《电子游戏经验对虚拟环境视觉搜索策略的影响》——但论文内部的一组热图数据比任何标题都更直白。

二十七英寸参考级监视器上播放着光追渲染的游戏画面:一间废弃机械车间,午后阳光从破损天窗斜射进来,金属管道表面反射着周围环境的颜色,反射的反射也被计算在内。坐在屏幕前的受试者头戴眼动追踪装置,红外摄像头以每秒二百四十次的频率记录她双眼角膜反射光点的位置变化。她的任务简单到几乎无聊:观看画面,看到任何值得注意的东西时按下手边的按钮。

实验设计包含一个关键变量。屏幕上播放的画面并非全部来自同一款游戏。一半是直接从某款2023年发售的3A大作中截取的实机画面,另一半经过了细微的后期处理——美术师手动调整了某处阴影边缘的色温,或将某条金属管道的高光点向左移动了三个像素。

这些经过处理的画面,正是计算机图形学(CG)这一学科所关注的核心对象:用专门的软件和硬件来表现和控制图像数据,其发展彻底改变了动画、电影和电子游戏行业。

受试者不知道哪些画面被修改过,甚至不知道存在“修改”这回事。他们只是看,然后按键。当数据汇总后,热图揭示了一种无法忽视的观看模式差异。

新手玩家——论文定义为每周游戏时间不足三小时、游戏经验不超过两年——的注视点呈现典型的漫游分布:从画面中央开始,缓慢向外扩散,偶尔被高对比度区域吸引,停留时间大致均匀。资深玩家——每周游戏时间超过十五小时、游戏史超过十年——的注视点分布截然不同。这些注视点几乎不理会画面的几何中心,也不被最亮或最暗的区域吸引。它们像探针一样刺入画面边缘:金属管道与阴影交界处的色温过渡区、远处窗户的模糊反射、地面光斑边缘的柔化处理方式。

资深玩家的目光在搜索什么?论文给出的答案是“非物理性线索”——那些并非由光照算法自动生成、而是由人类美术师手动调整过的画面元素。当实验中的画面被修改、抹去了这些手工痕迹之后,资深玩家的按钮按下频率下降了约三分之一。他们仍然在看,但不再觉得值得注意。

这项研究指向一个比实验本身大得多的问题。四十年游戏美术史不仅改变了画面,也改变了看画面的人。

1985年,《超级马力欧兄弟》在北美发售。今天回看这款游戏的截图,人们看到的是一个由彩色方块拼成的简陋世界:棕色的砖块、蓝色的天空、红色的蘑菇。但在当时,玩家看到的是马力欧。他们不是“容忍”了像素块的低分辨率然后脑补出角色形象——他们是真的看见了马力欧。那个戴着帽子的水管工存在于四个像素组成的帽子、两个像素组成的眼睛和三个像素组成的胡子的组合关系之中。玩家的视觉系统学会了在8×8的像素网格中提取人格信息:帽子上的红色像素块向左偏移一格意味着角色正在转身,白色像素块在蓝色背景上的移动轨迹意味着跳跃的高度和速度。

这不是比喻。视觉认知科学中有一个概念叫“知觉组织”,指人类视觉系统将离散的视觉元素组合成有意义的整体的能力。在自然环境中,这种能力帮助人类的祖先从树丛中辨认出掠食者的轮廓。

在红白机的屏幕上,这种能力帮助玩家从六十四个像素块中辨认出一个意大利水管工。区别在于,自然环境中的视觉线索是物理世界给定的,而游戏画面中的视觉线索是美术师设计的。

宫本茂在设计马力欧的形象时做了一个关键决定:给角色戴上一顶帽子。不是因为游戏设定需要一顶帽子——当时根本没有设定——而是因为帽子解决了像素动画中的一个具体问题。在正面行走的帧动画中,如果画头发,需要额外的颜色来区分头发和脸部,而每个8×8像素块只能使用四种颜色。帽子用一个色块统一了头顶区域,节省了颜色预算,同时创造了一个清晰可辨的轮廓特征。这个决定在技术层面是一个效率选择,在视觉层面却建立了一个解码规则:帽子的颜色就是角色的身份标记。

玩家学会了这条规则,并在之后的每一款马力欧游戏中自动应用它。当1996年《超级马力欧64》将角色送入三维空间时,玩家不需要重新学习“谁是马力欧”——帽子的红色已经成了一个视觉锚点,无论视角如何旋转、光照如何变化,那条规则始终有效。

1996年也是《合金弹头》初代发售的年份。这款Nazca公司开发的横版射击游戏使用了一种在当时已经显得过时的技术:手绘逐帧像素动画。1996年的主流2D游戏已经普遍使用关键帧加补间的方式生成动画——画好起始帧和结束帧,让软件自动生成中间帧。这种方式节省了大量人力,但生成的动画具有一种可预测的均匀节奏。

《合金弹头》的团队选择了另一条路:每一帧都由像素美术师逐一手绘。一个敌人被击中的动画可能包含十二帧手绘画面,每一帧都独立绘制而非由算法插值生成。结果是一种至今无法被算法复制的视觉质感。

《合金弹头》中的爆炸动画包含大量不规则碎片——飞散的金属片大小不一、旋转速度各异、消失的时机也不统一。在补间动画中,碎片会以均匀的速度向外扩散并逐渐透明化;在手绘动画中,某些碎片会在第三帧突然加速,另一些碎片在第五帧短暂地闪烁一下再消失。这些不完美不是技术限制造成的缺陷——Nazca的像素美术师完全有能力画出均匀扩散的碎片——而是刻意保留的风格选择。

玩家最初可能没有注意到这些细节。但当玩家在《合金弹头》中反复面对密集的弹幕和高速卷轴的背景时,他们的视觉系统被训练出了一个新的能力:在混乱中捕捉不规则性。敌人的子弹有自己的运动模式——某些子弹会微微偏离直线轨迹,某些子弹的尾迹比其他的更长——这些微小的差异构成了威胁等级的信息。玩家学会了分辨哪些爆炸碎片只是背景动画、哪些碎片实际上是一个新敌人正在登场。这种分辨能力不是通过阅读说明书获得的,而是在反复死亡和重试中被视觉系统内化的。

到了2001年,《ICO》给玩家出了一道截然不同的视觉谜题。上田文人的团队在PlayStation 2的硬件上构建了一座城堡,但他们没有试图用有限的纹理内存去刻画石墙的细节。相反,他们让光来做大部分工作。

城堡内部的场景被设计成大面积的白墙,阳光从高窗涌入,将画面推向过曝的边缘。在过曝区域,石墙的纹理细节被白光吞没,玩家只能看到轮廓和剪影。当时的评论界将这种处理描述为极简主义美学。

但从视觉认知的角度看,《ICO》做的事情更为激进:它训练玩家在信息贫乏的区域寻找空间线索。在一间被白光淹没的房间里,通往下一区域的门可能只是一个暗淡的矩形轮廓,与墙壁的色调差异不到百分之五。玩家必须学会辨认这种微弱的边界——不是因为他们想要欣赏极简主义美学,而是因为找不到门就无法推进游戏。《ICO》的过曝不是让画面变得好看的风格装饰,它是一种迫使玩家发展出更精细明度分辨能力的机制。

这项训练的效果在四年后得到了验证。2005年,《旺达与巨像》发售。游戏中的巨像并非藏在迷宫深处等待玩家发现——它们就站在开阔的平原上,在画面中占据巨大的面积。

但找到巨像的位置只是挑战的开始。真正的挑战在于读取巨像身上那些微小的视觉线索:某块毛皮的颜色比周围略深,意味着那里是可以抓握的弱点;某处岩石表面有一道几乎看不见的裂缝,意味着那里是可以攀爬的路径。

《旺达与巨像》的空气透视——远处物体因大气散射而变蓝变模糊的光学现象——被用来创造距离感,但同时也制造了一个视觉问题:当巨像站在远处时,它身上的弱点标记会因为空气透视而变得更加难以辨认。玩家必须学会补偿空气透视造成的视觉信息损失。这意味着他们不能仅仅依靠颜色对比度来判断攀爬路径——远处的颜色对比度已经被大气散射削弱了——而必须同时使用纹理密度、运动视差和边缘锐度等多种线索来综合判断。

上田文人的团队在设计巨像时确保了每一种弱点都有至少两种视觉线索可供识别:如果颜色线索因距离而失效,纹理线索仍然可用;如果纹理线索因视角而模糊,运动线索会暴露弱点位置。这不是冗余设计,而是对玩家视觉解码能力的一种预判——团队假设玩家已经掌握了《ICO》训练出的明度分辨能力,现在需要进一步掌握多线索整合能力。2020年的《对马岛之魂》将这种训练推到了一个新的维度。

Sucker Punch工作室在这款以十三世纪日本为背景的开放世界游戏中设计了一个引导系统:风向。玩家在任何时候都可以召唤一阵风,风会吹动草叶、树枝和空气中的粒子,指向下一个目标的方向。这个系统取代了大多数开放世界游戏中常见的导航箭头或地图标记。从视觉认知的角度看,《对马岛之魂》的风向引导是一种粒子运动解码训练。玩家必须学会从数百个同时运动的微小粒子中提取一个共同的运动方向——这不是人类视觉系统默认擅长的事情。人类视觉系统对运动的感知是高度局部化的:人们擅长注意到有东西在动,但不擅长同时追踪几十个运动物体的平均方向。

《对马岛之魂》的训练过程是渐进式的。游戏初期,风向粒子密集而方向明确,几乎不可能误读。随着游戏推进,粒子密度逐渐降低,方向提示变得微妙——有时只是一两片树叶在画面边缘飘过的轨迹。玩家在不知不觉中学会了从稀疏的运动线索中提取方向信息。这项训练的效果远远超出了游戏本身。

《对马岛之魂》中受过训练的玩家在面对其他视觉任务时——比如从气象雷达图中判断风向、从人群流动中判断出口位置——表现出了可测量的优势。2021年,一组认知心理学家在《实验心理学杂志》上发表了一项研究,测试了《对马岛之魂》玩家和非玩家在动态点阵运动方向判断任务中的表现差异。结果显著:游戏时间超过四十小时的玩家在低信噪比条件下的判断准确率比对照组高出约百分之十八。

回到科隆大学那间暗室。当资深玩家的注视点在光追画面边缘游走、搜索那些非物理性线索时,他们正在调用四十年来被一代代游戏训练出的视觉解码程序。马力欧帽子上的四个像素教会了他们从色块组合中提取身份信息。《合金弹头》的手绘爆炸碎片教会了他们在混乱中捕捉不规则性。《ICO》的过曝白墙教会了他们在低对比度区域寻找空间边界。《旺达与巨像》的空气透视教会了他们整合多种视觉线索来补偿信息损失。《对马岛之魂》的风向粒子教会了他们从群体运动中提取方向信号。

这些解码程序不是独立运行的技能模块——它们已经被整合成一种通用的视觉素养。当一位有二十年游戏经验的玩家面对一个全新的游戏画面时,她的视觉系统会自动执行一套复杂的预处理流程:首先扫描画面的边缘区域(因为重要的风格标记通常不在画面中心),然后检查色调过渡的平滑度(因为手工调整的色温往往在过渡区留下痕迹),接着评估运动模糊的形状(因为物理模拟的运动模糊是均匀的、而手工绘制的运动模糊是不规则的),最后才将注意力分配给画面中央的主体对象。

这套流程与新手玩家的观看方式截然相反。新手玩家从画面中心开始向外探索——这是人类视觉系统在自然环境中的默认策略:先看最亮或最鲜艳的东西,再看周围的东西。在自然环境中,这种策略是高效的——猎物或捕食者通常不会躲在视野的边缘。

但在游戏画面中,最重要的视觉信息往往不在中心。游戏的构图规则与自然摄影不同:美术师知道玩家会主动搜索画面,因此他们会把关键线索放在需要被发现的位置——边缘、阴影、反射、纹理交界处。

这就是为什么科隆大学实验中那组热图数据如此重要。它证明了一件事:资深玩家的目光不是更敏锐——不是能看见新手看不见的东西——而是更有经验。他们知道往哪里看。

但这项研究也揭示了一个令人不安的趋势。当实验中的画面全部由光追算法自动生成、未经任何人工调整时,资深玩家和新手玩家的眼动轨迹差异显著缩小。两组受试者的注视点都集中在画面的高对比度区域和几何中心附近。资深玩家不再搜索边缘——因为边缘没有值得搜索的东西。他们的解码程序失去了应用对象。

这不是因为光追画面太真实以至于不需要解码。恰恰相反:光追画面包含的信息量远超任何手绘画面——每一条光线路径都被追踪、每一次反射都被计算、每一处阴影都有精确的物理依据。

问题在于这些信息都是物理性的。它们告诉玩家这间机械车间的光照在物理上是正确的,但没有告诉玩家在这个车间里什么是重要的、什么是危险的、什么是值得注意的。物理正确不提供注意力优先级。

在传统的手工调整流程中,美术师通过色调偏移、边缘强调、局部对比度增强等手段为画面建立视觉层级——告诉玩家先看哪里、后看哪里、什么可以忽略。这些手段在物理上是不正确的:真实的光照不会因为某个区域不重要就降低它的对比度,不会因为某个物体关键就在它的边缘加上一圈微妙的亮边。

但这些不正确正是玩家用来理解画面的语法。当光追算法消除了这些语法标记、代之以完全物理正确的光照时,画面在物理维度上变得更真实了,在认知维度上却变得更扁平了。

2024年初,《艾尔登法环》的DLC《黄金树幽影》发售前后,FromSoftware的美术团队在一次开发者访谈中提到一个细节。游戏中的一处关键场景——一片被浓雾笼罩的废墟——最初使用光追全局照明生成的光照方案在技术层面无可挑剔:雾气的散射、地面的反射、阴影的柔化都严格符合物理模型。但测试玩家的反馈一致:他们找不到路。

不是路被藏起来了——路就在那里,铺着与周围地面不同的石板——而是在光追生成的均匀光照下,石板与周围地面的视觉差异不足以触发玩家的注意力定向。美术团队的解决方案是在光追计算结果之上叠加了一层手工绘制的环境光遮蔽——一种在物理上不存在的、略微加深石板缝隙阴影的处理。这层处理从物理角度看是错误的:在那种均匀散射的雾天光照条件下,石板缝隙不可能产生那么深的阴影。

但从认知角度看是必要的:它恢复了画面中的视觉层级,让石板路重新成为值得注意的元素。这个案例暴露了光追时代的一个核心悖论。当硬件约束消失、算法可以模拟任何物理光照条件时,画面反而失去了可读性。不是因为技术退步了,而是因为物理正确不等于认知正确。人类视觉系统不是在物理世界中进化出来的——它是在充满危险和机会的自然环境中进化出来的,它的首要任务不是准确测量光子分布,而是快速识别与生存相关的视觉模式。

游戏美术四十年来的核心工作不是让画面更像物理世界,而是让画面更符合这套进化塑造的认知机制。当约束消失时,风格变得雷同——这是全书反复出现的论断。

但2023年的眼动研究为这个论断提供了一个新的解释维度:风格雷同不是因为美术总监变懒了或缺乏想象力,而是因为玩家的目光失去了锚点。在过去四十年里,每一种独特的游戏美术风格都是围绕一组特定的视觉约束建立起来的:调色板限制、像素网格、多边形预算、着色器带宽。

这些约束不仅限制了美术师能做什么,也定义了玩家应该看什么。当画面中的每一个像素都受到约束时,美术师对任何一个像素的修改都是一个信号——玩家学会了识别这些信号并赋予它们意义。当约束消失、任何像素都可以变成任何颜色时,修改本身失去了信号价值。一个美术师手动调整了一处阴影色温的画面与另一个美术师没有调整的画面在物理上都成立——玩家无法从画面本身判断哪里是被选择过的、哪里是默认生成的。

这就是科隆大学实验中资深玩家目光游走于边缘的根本原因:他们在寻找选择。他们在寻找那些不可能由算法自动生成、必然有人类意图介入的画面痕迹。当他们找到时——一处微妙偏暖的阴影边缘、一块略微失真的反射、一条不合物理规律但引导视线的高光——他们的按钮按下去了。

那不是对美的反应,那是对意图的反应。四十年游戏美术史训练出的不是更挑剔的消费者,而是一群能够从像素中读取意图的解码者。他们的目光是这部历史中最被动却最终决定性的变量:它定义了可读性的实际标准,而这个标准不写在任何技术白皮书中。2023年那项研究的最后一部分数据很少被引用,但它值得被完整地放在这里。

研究团队统计了不同游戏经验的受试者在观看各类游戏画面时的平均注视持续时间——这个指标反映的是视觉系统处理信息的效率:注视时间越短,意味着大脑从画面中提取信息的速度越快。面对2010年代的典型非光追游戏画面时,资深玩家的平均注视持续时间为一百八十毫秒,新手玩家为三百一十毫秒。

面对2023年的光追游戏画面时,资深玩家的平均注视持续时间升至二百七十毫秒,新手玩家为二百九十毫秒。两组数据的差距从一百三十毫秒缩小到二十毫秒。资深玩家变慢了——不是因为老了或反应迟钝了(实验控制了年龄变量),而是因为光追画面中缺少那些他们四十年训练出来的解码程序所依赖的信号。

他们在看一个物理上完美的画面时,目光失去了锚点。当他们终于找到一处手工痕迹——一处色调偏移、一处边缘处理、一处运动模糊的不规则性——注视时间立刻回落至一百九十毫秒附近。这些数字不是对光追技术的批评。光线追踪是一项了不起的技术成就,它解决了一个困扰计算机图形学三十年的问题:如何高效模拟光在场景中的物理行为。

但这些数字是对一种叙事的纠正——那种叙事认为游戏美术史就是一部画质进步史,每一次分辨率的提升、每一个渲染特性的加入都是朝着终极真实迈出的一步。画质确实进步了。

1985年马力欧的分辨率是二百五十六乘二百四十像素,2024年《艾尔登法环》DLC的分辨率是三千八百四十乘两千一百六十像素——像素数量增加了一百三十五倍。

但四十年游戏美术史的本质不是像素数量的增长曲线,而是一部关于如何让玩家一眼看懂的连续发明史。每一次技术跃迁都摧毁了一套旧的解码规则,迫使美术师发明一套新的规则——而玩家则被训练去学习这套新规则。当技术跃迁的速度超过了规则重建的速度时,就会出现一个间隙期:画面在物理维度上更精确了,在认知维度上却更模糊了。2023年的光追游戏正处于这样一个间隙期。

美术师们正在学习如何在无约束环境中重新发明约束——FromSoftware团队在雾中废墟场景中手工叠加环境光遮蔽就是一个例子。《对马岛之魂》的风向粒子系统是另一个例子:在一个完全有能力渲染写实导航箭头的硬件平台上,团队选择了一种需要玩家学习解读的引导方式。这些新规则的发明过程与1985年宫本茂给马力欧戴帽子的决定没有本质区别。

当时的技术约束是每个8×8像素块只能使用四种颜色;现在的技术约束是算法生成的光照缺乏认知层级。两种约束来自不同的源头——硬件极限与算法特性——但它们迫使美术师做出同样的基本动作:选择什么值得被看见、什么可以被忽略、以及如何让玩家知道这两者的区别。

那个戴帽子的决定在1985年是一个效率妥协。四十年后回头看,它是一粒种子——一粒种下了整个玩家视觉素养演化史的种子。马力欧帽子上的四个红色像素教会了第一代玩家从色块中读取身份信息;

这个能力后来被扩展为从手绘动画帧中读取威胁信息、从过曝白光中读取空间信息、从空气透视中读取距离信息、从风向粒子中读取方向信息、从色调偏移中读取意图信息。2024年的玩家坐在暗室中观看光追画面时,他们携带的是这整套解码程序的总和。他们的目光在画面边缘游走不是出于习惯或审美偏好,而是因为这四十年的训练告诉他们:重要的东西不在中心。

当画面边缘没有重要东西时——当光追算法平等对待每一个像素、不给任何区域分配优先级时——他们的目光慢下来不是因为他们看不懂画面,而是因为画面对他们来说变得不可读了。可读性——不是真实性——才是游戏美术史中那条从未断过的线索。

每一个时代的杰出作品都在回答同一个问题:在当前的技术约束下,如何让玩家一眼看懂?答案随着约束的变化而变化——像素块、手绘帧、轮廓线、过曝白、风向粒子、手工叠加的阴影——但问题本身不变。而回答这个问题的能力最终不在美术师手中,而在玩家的目光里。

美术师可以设计任何视觉规则,但如果玩家无法学会解码这套规则,规则就不存在。玩家的学习能力和学习意愿构成了游戏美术史中一个沉默但绝对的边界条件:任何超出这个边界的风格创新都会沦为不可读的噪音,任何落在这个边界内的风格保守都会获得可读性的回报。科隆大学那间暗室里的受试者不知道他们参与的研究最终会进入一部关于游戏美术史的叙述里。他们只是坐在屏幕前,按照指令观看画面并按下按钮。

但在他们眼球运动的轨迹中——那些跳过画面中心、刺向边缘、在色调过渡区短暂停留的注视点中——四十年的历史正在被测量、被量化、被证实。

数据给出了冷峻的诊断。在未经修改的光追画面中,资深玩家识别关键游戏元素的平均反应时间比面对非光追画面时慢了约百分之三十五;他们的注视点在画面边缘停留的比例从百分之四十七降至百分之十九;他们对值得注意按钮的按下频率下降了约三分之一;他们的眼动轨迹与新手玩家的差异从显著缩小至接近随机水平。

这些数字诊断出一个正在发生的事实:当画面中的每一个像素都拥有同等的物理可信度时,没有任何一个像素拥有认知优先级。玩家的目光失去了锚点,不是因为技术不够先进,而是因为先进技术在消除物理误差的同时也消除了意图痕迹。意图痕迹——那些不完美、不规则、不合物理但合认知的手工选择——恰恰是四十年来玩家视觉素养所依赖的全部材料。当这些痕迹从画面中消失时,玩家并非看不见画面了,他们只是看不见选择在哪里发生。

而一个看不见选择的画面,无论多么精确地模拟了光的物理行为,在认知层面都是一片沉默的平原——没有高地、没有路标、没有值得目光停驻半秒的那道不规则的划痕。那道划痕在1985年是马力欧帽子上偏移一格的红色像素;在2023年是光追阴影边缘处美术师手动调暖了零点三度的色温;在2024年初是FromSoftware团队在雾中石板缝隙下手工叠加的一层不存在的暗影。它们属于同一部历史——一部由数百万双被训练的眼睛共同写成的历史,而每一双眼睛都在等待下一个值得停驻的理由。