让AI把整个画面读一遍,听上去很周到,真做一次就会发现问题:一个战斗场景里可能有几十个物体,读完需要很长时间,而玩家此刻真正需要的,也许只有“出口在右前方,门后有人”这一句。场景描述的难点不在于“看得见”,而在于判断什么值得说、什么时候说、说到什么程度。九游会AI把这件事当作一个信息筛选问题,而不是一个朗读问题。

先问玩家在做什么,再问画面里有什么

同一个画面,在不同任务下要说的话完全不同。玩家在找出口,重要的是门、通道和障碍;在辨认敌我,重要的是角色类别和朝向;在读界面,重要的是按钮、数值和当前选中项;在探索,重要的是可交互的物件和地形变化。任务不同,“关键目标”的定义就不同,所以九游会的设计里,场景描述先读取当前的游戏状态与玩家选择的模式,再去决定画面中的哪些内容进入候选。

需要描述的玩家也并不一致。全盲的玩家依赖描述建立整体空间感;低视力的玩家可能只是在某些场景下看不清小目标或低对比度的物体;视野受限的玩家更需要画面边缘的提示;还有些玩家是在注意力已经被战斗占满时需要少量的补充说明。把他们统一成“看不见的玩家”,几乎必然会说得太多或者太少。

什么时候才该开口?

触发条件决定了描述是帮助还是打扰。可以把它们分成三类,按打扰程度从低到高排列:

  1. 玩家主动询问。一个按键、一句口令,或者一个开关输入,触发一次“我在哪、前面是什么”的回答。这是最安全的方式,也应当永远可用。
  2. 关键事件触发。目标首次进入视野、附近出现了可交互物件、角色状态发生明显变化、场景切换。这些事件由游戏状态或画面变化检测得到,只播报一次,不重复。
  3. 周期性巡检。每隔一段时间自动概括一次周围环境。这一档最容易打扰,所以默认关闭,只有玩家在需要慢速探索时手动开启。

三类触发之间要设置冷却时间。刚刚播报过“前方有门”,短时间内即使画面轻微变化,也不应该再说一遍。

识别出来的东西,哪些值得说?

画面识别(Computer Vision,计算机视觉)通常会给出一批候选:物体类别、大致位置、有没有在移动。九游会的做法是先按相关性排序,再取最靠前的少数几条。排序时大致遵循这样的次序:与当前任务直接相关的目标,优先于直接的威胁,再优先于可交互的物件,最后才是装饰性内容。装饰性的内容,比如远景的树木、墙上的图案,在默认模式下不进入播报。

还有一点常被忽略:如果游戏本身能提供对象标签,比如“这是一扇可以打开的门”,就应当优先使用,而不是重新去看图猜。画面识别在风格化的美术、大量粒子特效、界面遮挡和快速镜头切换下,稳定性会明显下降。对开发者而言,给关键对象加上简单的语义标签,成本很低,却比任何视觉模型都可靠。九游会AI在没有标签可用的时候才依赖视觉识别,并且明确它是补充手段。

一句话该怎么说?

语音是线性的,玩家不能像看画面那样一眼扫过,所以描述必须短,而且格式稳定。一个可用的模板是“类别,方位,状态”,比如“出口,右前方,未上锁”“敌人,左侧,正在靠近”。方位以玩家角色的朝向为准,而不是屏幕坐标;距离使用“近、中、远”这样的粗档,或者“几步”这样的游戏内单位,避免精确到让人分神的程度。

目标很多的时候,要做归并:“前方有三个敌人,最近的在左侧”,好过逐个报名。玩家想知道更多,再追问,系统才展开第二层。也就是说,默认短,追问长,而不是默认长、让玩家自己去打断。同时,术语要保持一致。今天说“出口”、明天说“离开点”,玩家的理解成本会持续累积。

语音和游戏自己的声音抢通道怎么办?

场景描述最终要经过文字转语音(Text-to-Speech,TTS)播出来,而游戏本身也在用声音传递信息。两者一旦重叠,玩家两边都听不清。可以采取几条规则:描述播出时,把背景音乐和环境音的音量适度压低,但不压掉关键的提示音;正在播报的时候,如果出现更高优先级的事件,就中断当前的播报并说新的;排队中的描述如果超过一定时间没有播出,直接丢弃,因为一条过时的“前方有敌人”比没有更糟。

延迟同样必须计入。画面被识别、生成文字、合成语音、再播放,每一步都会花时间;如果游戏节奏很快,说出口的时候情况可能已经变了。所以描述要带“时效性”的判断,节奏快的场景只保留最紧急的一两条,节奏慢的探索场景才展开。语速、音色和音量则完全归玩家,因为有的玩家习惯很快的语速,有的玩家在嘈杂环境里需要更慢更清晰的播报。声音方向的提示还可以配合字幕里的方向与事件信息,让玩家从不同通道拿到同一份情报。

识别错了,怎么让玩家知道?

画面识别一定会错,可能把一个箱子认成敌人,也可能漏掉一个在阴影里的目标。这不能靠“提高准确率”一句话解决,只能在设计里承认。九游会的设计是让描述带上把握程度:把握高的直接陈述,中等的用“可能是”,很低的不主动说,只在玩家询问时才带着提示给出。玩家可以追问“确认一下”,系统再次针对同一个区域重新识别,或者说明“无法确定”。

对于危险相关的信息,比如悬崖边缘、致命陷阱,场景描述只能作为辅助,不能被当成唯一来源。九游会不会给出诸如识别准确率这样的承诺数字,因为准确率取决于游戏的画风、分辨率、帧率和光照,任何一个通用数字都会误导玩家。

把控制权留给玩家

说到底,场景描述是无障碍游戏里多种输出方式中的一种,它能不能用,取决于玩家能否调整:触发方式选哪几类,详细程度分几档,哪些类别的目标不必播报,语速与音量,是否只在特定的游戏模式里启用。这些选项应当在游戏中途就能改,不必退出到设置菜单再回来。系统可以在发现玩家反复追问同一类信息时提出建议,比如“是否把这一类目标加入自动播报”,由玩家选择接受或忽略,被拒绝以后不再反复提示。

评价一套场景描述好不好,有一个简单的办法:让玩家闭上眼睛玩一个关卡,看他需要主动追问的次数,和被无关信息打断的次数,哪个更多。如果两个数都不少,那么问题多半出在“说什么”的筛选,而不是“怎么说”的语音。