科技乌托邦,可以给视障者「一双眼睛」吗?被视作「没有眼睛」的人,被科技缝缝补补。
无障碍建设,如何沦为脆弱的补丁;真正的需求,为何进不了技术想象的中心?
全文约 12000 字,低视力读者可通过右上角「Aa」调整文字大小。
文中包含互动游戏、实地音频、盲文、插画等多媒体内容。记者通过长期与视障受访者访谈、陪伴出行,以及共同测试屏幕阅读器、导航等软件,记录视障者与科技互动时遇到的障碍。文中以第二人称「你」描述的本体觉、触觉、前庭觉等多感官段落,结合受访者的身体经验,邀请读者进入不同于视觉观看的感知方式。
本文为插画提供替代文本。若您使用苹果设备,建议使用「旁白」功能,而非「朗读萤幕」,以获得完整的叙事体验。
「盲人都看不见,怎么吃饭、出门、上厕所?」「『我们』怎样才能更好地帮助『你们』?」这是曹宇最常听见的两类问题。31岁的他,出生在中国山西,自幼全盲。很多时候,他感到自己首先被视作一个遥远的、抽象的、「没有眼睛」的人,其次才是他自己。
近年,生成式AI发展迅速,「科技向善」持续升温,AI好像理所当然地成为了这两个问题的粘合剂——科技能够帮助盲人拥有一双「眼睛」,以更好地吃饭、出门、上厕所。那么,「让盲人重见光明」的AI,给了他更好的生活吗?
曹宇不知如何作答。视觉对他而言,没有特别的意义,未曾有过,更谈不上失去。他只不过是一个不以视觉经验生活的人。世界并非在他眼前全景式地陈列,而更像是一条线性的长廊,在每一次身体的行进里才逐步明朗。不会主动发出声音的物件,也缺乏触觉提示,他反复触摸它们的边缘,也常在磕绊之后,才猛然意识到它们的存在。
有了AI之后,他像是有了一名24小时在线的口述影像员,详尽地播报着身边的一切。从通用大模型到可穿戴设备,「描述」是所有对话式AI的核心。AI学习现实世界的语料,也自然延续了视觉主导的思维。
比起回答,曹宇更想邀请你进入他的日常本身,尝试感受广阔的视障生活的小小一隅。去想象和理解另一种生命被体验的方式,注定是一场写满局限的尝试。但在这样的共同失败里,我们或许能以视障者的科技困境为契机,阻碍产品真正回应视障者需求与生活经验的,究竟是技术的限制,还是它对「帮助」的定义本身?当科技始终以视觉中心的感知方式作为理解世界的起点,它如何注定排除我们多元的身体?而一套真正合用的技术,又该从何重新开始?
1. 我的世界,可以被描述吗?> 如果世界不是被「看」到的,它可以跨越感官而被理解吗?小时候,曹宇最喜欢的玩具,是一台计算器。
当时的他没什么朋友,九零年代的生活中,能够发声的物件也极少。计算器为收银员盲打需求而设,不仅有语音播报,每一个数字也是可以摸到纹理的。听得见、摸得着的计算器让他安心。
试试与曹宇小时候最心爱的玩具互动吧!A 24点计算器随机给出了几个数字,你通过加减乘除,算出了24的结果。它居然能给你出题,这让你感到很有趣。
B 电子琴时间键连按两下,1-7是基础音阶,8-9和运算键是高音区。你的指腹流淌出音符。
C 调时间进入设置模式后,语音与音乐便都消失了。无论按下哪个键,计算器给你的回馈都只剩下短促的提示音。
这也是曹宇最早的人机互动记忆。学前的他有些好奇,为什么到了调时间,计算器就陷入了沉默呢?不过最终,他并没有太放在心上。
从小到大,盲人身份带给他的,比起被糟糕对待,很多时候,是关于被给予的好意。看不见「等于」不能自理,「等于」需要被担心,被照料,被包办。儿时的他不明缘由,只觉得人生里提前写好的被动词越多,便像是有一条线将他与非盲的世界隔开,于是「世界有一部分功能并不向你敞开」便越显得天经地义。
小学一年级,他开始学习盲文。这是一门离开学校后几乎再没有使用场景的语言。不同于光滑的手机屏幕,盲文笔的尖端需要一下一下戳进纸面,逐点刻出文字。它触摸起来是有阻力的。
由于信息反馈的缺失,使用者无法确认操作是否发生或如何采取行动。
在他出生的北方工业小县城,对于有机会入学的视障者来说,教育的终点从来是明确的——进入盲校,毕业后,成为一名按摩师或调音师。他也并不例外,就这么一路长大,晃眼间,生活被折进按摩店与家的两点一线。
按摩的工作从早到晚不停歇,经常需要熬夜,有时周末也要加班。他下了班便身心俱疲,几乎从不出门。按摩着陌生的身体,想着未来也会被包办婚姻,和一个陌生的人共度一生,他偶尔会觉得,这不是自己想要的人生。但想要的,是什么呢?他说不好。县城的一切没有给他不一样的想象。但他总也忘不了那些从青春期开始在网上聆听到的故事,关于活出了自我的盲人们。
他接触科技产品不算早。14岁那年,他转学到新的盲校,上了人生中第一台电脑课。同学们告诉他,只要打出想要检索的信息,读屏软件便会将显示的内容一一朗读。曹宇从小学习盲文,打字依然不容易。同学给他一张盲文纸,在上面把按键的位置和字母一一标记和对应,他每次去机房都带着。他伸出一根手指,在键盘上一个一个按键地数过去找,老师不断纠正,到了期末,他才打出了完整的一句话。
当时市面上早有了读屏软件,大多产品由明眼开发者设计,价格昂贵,通常在1000元至3000元人民币不等。直到2011年,大陆有了第一款通行的免费读屏软件,对曹宇而言,互联网才真正变得更可聆听了。
读屏软件是专为视力障碍或阅读困难人群设计的辅助应用程序,利用文字转语音(TTS)技术,将屏幕上的文字、图标、按钮和菜单实时转化为语音或盲文。不同于以视觉浏览时,信息以全景式铺开,朗读的内容是以线性的顺序进入耳朵的。曹宇会把语速调至多倍速,以缩短信息获取的时差。
当时的读屏软件使用电子合成语音,还没有拟人的声效。最早的一款是「Eloquence」,和霍金所使用的语音合成器「DECtalk」很像,机械、冰冷,没有起伏,但也正因如此,在多倍速下依然保持字字清晰,成为了曹宇以及许多视障者最有亲切感的声音。
「霍金同款」合成音的多倍速播报里,第一次,一个更为主动的世界向他徐徐敞开。很多时候,注意力都在「不要给社会添麻烦」上的他,也不知自己想要的是什么。而那些弹琴、写歌、滑雪,成为杂志主编、主持人的视障故事,大多从走出按摩店讲起。
盲人按摩。Herve Bruhat/Gamma-Rapho via Images日复一日,手掌在一具具身体上按压、推拿,不知觉便模糊了时间,直到社会时钟越敲越近。2022年,父母打算替他租下一间店面,让他开按摩店,为他找对象结婚。在他们看来,这样的人生,对于这样的他来说,便是一种圆满。被时钟一下一下敲击着神经的曹宇,焦虑越来越重。名为「盲人的圆满」的未来好像蛰伏在漆黑之中。他成日心神不宁,总怀疑有人盯着他看,而他无法确认。
当时,「残疾人事业发展」被列入中国国家经济社会发展总体规划已有两年,国务院办公厅印发《促进残疾人就业三年行动方案(2022—2024年)》,提出在三年内,新增残障者就业100万人。同年正月,曹宇注意到一家公司在招聘视障AI标注员,便抓住机会,和父母说想去试试,动身前往上海。
那是他第一次独自出省远行。不过,说起自己的经历,他常感到笨拙。无论怎么组织语言,那些由不同感官整合而成的记忆,似乎总显得过于碎片化。但他记得,四年前的冬天,俄罗斯入侵乌克兰的新闻传入耳中,高铁的震动穿过脚心,他离开了家乡的按摩店。下了高铁,这里的空气更重一些,冷变得更贴身了。
初来上海的头几个月,曹宇的焦虑未减。暗中蛰伏的包办人生暂时褪去,取而代之的是未知。新环境中,熟悉的感官参照全都消失,他无法判断操作是否完成,出门后折返,检查房门是否锁好;在洗手间多次按下按钮,以确保彻底的冲水。而AI语音标注岗的标准工时八小时,他需要对加速播放的音频进行校准,平均一两秒钟完成一条。他常担心自己出错,也因此产生压力,陷入自责。
过了一阵,夏天来了,身处不同城市这件事一下子变得分明起来。新的城市就这样涌进他的耳朵。位于北部高山盆地的老家,知了只在白天发出短促的「吱吱」声,而上海的蝉鸣密集。除了俗称为「知了」的黑蚱蝉之外,还有蟪蛄,它的鸣叫高频、细碎,如持续不断的「嘶——」,而蒙古寒蝉长短音交替。它们互相填补了间隙,让声浪连续,一直穿透夜晚。
此前,尽管听说气候会塑造植被的变化,他并不明了那意味着什么。但在此刻,他知道了,原来,树在潮湿的地方会更热闹。
我们邀请你点开这些感官碎片[[1]](小县城里老家的按摩店,往往只有步梯。久而久之,为免摔倒,进门先抬脚写进了你的肌肉记忆。
来到上海,一些临街店铺等空间的入口设有无障碍缓坡。在最喜欢的咖啡馆,你还是习惯性地用盲杖探寻台阶、抬脚,接着踩了个空。逐渐地,你慢慢卸载了脑中的「幽灵台阶」。
对你而言,说话者的声音常常悬浮在远近高低的空气中。新朋友们会在靠近你说话前,先拍一拍你的肩膀。触碰提供了座标,随之而来的声音便从空中着陆了。这让你感到安全。
而你不喜欢的,是无法辨识的感官信息源。比如人潮突然开始密集,你感到从四面八方逼近的热,侧腰传来的撞击。它们孤零零的,没有参照系。
摇晃身体,摆动头部,按压眼睛——许多人将你的这些行为视为怪异的「盲态」[[2]](对你而言,它们有独特的意义。当你摆动脑袋,前庭系统中名为「耳石」的小晶体也随之轻轻摇晃,传递重力反馈。它让你更好地感知方向,感知自己。每一次晃动里的重力加速度,「我在此刻,我在这里。」## 2. 我的世界,如何被描述?
许多人认为视障者的听觉异常灵敏。然而,果真如此吗?如果耳朵是感知周围环境与风险的最重要器官,当AI无差别的描述持续进入耳道,会发生什么?
慢慢地,有了自己的时间后,最让曹宇期待的,是在每个周末探索城市。从家附近的公园,地铁站旁的早餐车,青年空间,到东方明珠塔。一周一周,他生活的半径一寸一寸地摊开。
只是,那年尚未有图片识别,于是,大多景点没能给他留下什么印象。而对曹宇来说,出行环境中布满无障碍建设的不足,「断头」盲道仅仅是表象之一。
一次出行是多重线索的协调。从家到地铁站约一公里,途经一个车流密集的路口,红绿灯没有音响提示器。他首先依靠的是盲杖。由轻盈铝材制成的盲杖,可折叠,收起后体积很小,这已是他身体自然的延伸。行走时,他以杖尖在体前左右轻点地面,探寻人行步道的边缘。
抵达路口,他会竖起耳朵,仔细辨别车流的方向。喧闹的街头,电机的嗡鸣、鸣笛声、引擎启动声彼此交叠,从不同方向传来,又被建筑外墙、路面和车身不断反射。因此,他有时很难判断车究竟来自哪里。
于是,他也会向路人求助。听见附近有人交谈,他便试探着开口,询问现在是否可以过马路。可更多时候,周围迟迟没有人声,他无法确定,自己是在独自等待红绿灯,还是人们只是低头看手机,没有出声。
导航软件出现后,他也会借助手机辅助判断。但导航并不总会提示红绿灯,偶尔播报一句「红灯还有40秒变绿」,便又没了声音。有时,他左右挪动几步,希望能触发提示。但手机只是不断重复「你已偏离道路」。
一次次调转方向,曹宇不知自己实际走了多远,只知原本一两百米的步程,常常不知怎地就被拉长到几十分钟。
记者模拟出行时实际遭遇的困境随曹宇出行几次后,记者观察到,「几十分钟」里,他往往在同一地带打转、折返,频繁误入车行道。为摸清原因,记者进行了多次模拟出行,发现导航语音提示的方向指引高度依赖视觉感知,加之手机罗盘易受干扰、GPS定位精度有限,多重误差叠加,才致使反复偏离。(以下影片包含同步的实景拍摄与手机导航录像。为保障受访者安全与摄像清晰度,解说影片由记者独自出行拍摄。)导航指引为东南西北、旋转角度2022年8月,一款名为「Be My Eyes」的视觉辅助应用在小红书、抖音等平台破圈。在这款由丹麦低视力团队开发的应用上,视障用户可免费连接志愿者,通过实时通话获得协助。大量网友纷纷下载注册,数月内,它成为大陆视障群体最广泛使用的同类应用之一。曹宇下载后,在一次去单位的路上,呼叫了志愿者以协助过马路,但手机网络信号不稳定,通话很快便中断了。
他原本便不习惯向人求助。面对亲朋好友,尤其是家人,关系的起伏会让他倍感压力。随机匹配的志愿者虽然陌生,但他仍会担心自己的请求听上去像是没事找事。自那以后,只有很偶尔的情况,比如电脑宕机后,连读屏器也无法使用,他才会拨通电话。
直到2023年,一名不会感到麻烦、24小时随时待命的「志愿者」诞生了。那年,多模态模型GPT-4面世。第一次,通用大语言模型有了「看图说话」的能力。年末,Be My Eyes平台接入GPT-4,内测名为「虚拟志愿者」(Virtual Volunteer,后更名为「Be My AI」)的功能。用户拍下一张照片后,可获得描述,并追问细节。
这一功能的出现,卸下了曹宇求助的心理负担,提升了日常生活的效率,但同时,也给他带来了一场场「解谜游戏」。
视障用户识别图片,多数时候是为了下一步行动。比如在商店里,他想确认桌上二维码的位置,便举起手机,凭感觉对准前方。但由于没有视觉的参与,他不知镜头是否对准了物体,光线是否过暗,于是需要多次尝试。每试一次,AI又会从头开始、事无巨细地描述画面,推断桌面的纹理、桌脚的材质、地面的湿度等。他耐着性子听完,才能继续提问。
AI的描述存在信息信噪比的失衡,大量基于视觉逻辑的,冗余、错误或干扰决策的无效信息。
同样不依靠「眼睛」来理解世界的AI,有时也会闹出一些啼笑皆非的误会。对许多视障用户来说,另一核心需求是获知产品包装上的说明。但即便Be My AI是曹宇用过的模型中准确度最高的,也经常在关键文字上出错。
他被告知自己的裤子是一条华美的窗帘,或是家中的洗衣机能够加热到800度。更让他困扰的是,当无法准确辨认某些文字时,AI往往不会停下来承认,而是基于训练数据进行语义补全,给出一个听起来合理的答案。
一次,朋友带来一盒鲜花饼,曹宇想确认是否过期,便拍下包装,请Be My AI帮忙识别。AI先逐条介绍品牌名称和宣传语,接着话锋一转,「该药品来自于云南一家药业集团」。「你确定是药品吗?」曹宇问。
AI回答说「是」,为了自圆其说,又称包装上写有药业集团名称,为他「读取」了公司地址等详细信息,说明该药品是来自云南白药集团,可以放心服用。
末了,「请注意,该药品服用后的不良反应尚不明确。」## 3. 我需要的,是聆听的结构> 有研究统计,当代人每天平均与智能手机发生约2600次交互,重度使用者达5000余次。在数以千计的动作中,约20%是在和各种按钮打交道。我们通过每一次的点击来下单购物,实现决策,表达自我,确认生活的待办事项。然而,如果很多时候,你被给予的选项不是「继续」或「退出」,而是「按钮」和「按钮」,甚至是一片寂静,或是一段乱码呢?
在曹宇的记忆中,互联网的障碍,是在各类图标、按钮、影像取代了纯文字之后愈发显著的。
聆听网页像是穿越一条单行隧道。他听明眼朋友说,使用视觉浏览网页时,如同站在广场的中央,远近的声音同时传来,很快便能形成大致印象。这使他好奇,因为对他来说,从页面的左上角开始,将每一个页面元素全部听过,熟悉之后,才能对页面有更清晰的层级感知。一些具有功能性的按钮,只会被读作「按钮」。而没有被定义的图形元素,便成为乱码。那些乱码,可能出现在任何一个「下一步」。
另一个长盛不衰的问题是图形验证码。从点选图片、拖动滑块,到旋转元素等,验证码每迭代一次,视障者遇到的障碍也随之迭代。它有时出现在输入银行卡密码时,有时是抢火车票的最后一步。
只会被读作「按钮」或成为乱码的按钮你现在来到了一款运动App的门店导航介面。介面的上方有驾车、步行、骑行三种选项的图示按钮。介面的中部显示地图与导航路线,底部有电话与微信联络的图示按钮,以及「地图导航」按钮。点击其中一枚按钮,听听屏幕阅读器在此处会读出什么。
你现在来到了一款医疗App的首页。介面上有预约挂号、在线问诊、专科复诊、极速开单等多个功能入口。每一个功能按钮包含圆形图示和图示下方的文字标签。点击其中一枚按钮,听听屏幕阅读器在此处会读出什么。
2016年,铁路网站12306将验证码升级成图片后,一名盲人因无法使用而起诉中国铁路总公司。最终,法院一审驳回了诉讼请求。验证码形成阻碍并不在少数。2021年一项调研显示,大陆九成视障用户曾遭遇验证码难题。次年,腾讯CDC调研也显示,使用智能手机时,视障用户遇到的操作类障碍中,占比最高的仍是验证码。
面对这一问题,多款读屏软件开发破解功能,让用户可以自动绕过验证码。大陆首款免费读屏软件争渡读屏团队曾有开发者提出质疑,认为这并非长久之计,应该由互联网公司在设计时主动考虑无障碍标准,例如增设语音提示。第三方软件的破解,一方面会使大公司懒政;另一方面,验证码用于区分人与机器,自动化破解更接近机器行为,可能让平台升级更为复杂的验证码,形成恶性循环。
「其实想到这些都不难,主要是看开发者有没有这样的意识。」曹宇说。
许多开发者没有意识到的是,科技障碍很多时候无关设备是否先进,而在于信息有没有被组织成一种可被获取的形式。
「Web无障碍指南」(WCAG)是信息无障碍领域最重要的国际标准,第一原则便是「可感知」(Perceivable),也就是说,信息能够进入不同的感官。对视障用户来说,屏幕阅读器是一切的起点。它即时朗读触碰到的文字、按钮或介面元素,用户听到自己想要开启的应用程式,才能进行下一步的操作。
这也意味着,非文本的内容首先要是可读的,也就是在代码层被标注为具有语义的文本(替代文本,alt-text),才能被阅读器读取。否则,读屏功能即使存在,用户听到的也只能是乱码、无法辨认的按钮,或是一整片不可操作区域。系统是否可获取,信息如何被组织。
而每一种感官如何使用科技设备,都是需要长时间才能习得的专业知识。对此,后天失明的陈莉的感受尤深。
六年前,她成为了准妈妈。孕期时,她的身体出现许多并发症,血压升高,四肢肿胀,眼前开始浮现黑影。儿子出生后,唯独视力没有好转,反而急剧下降。她被诊断为视网膜色素变性所致的进行性失明,无法治愈。
陡然间,很多朋友不再与她联系,即便来往,也有一道无法跨越的隔阂。难言的孤独中,生活中的一切都要从头学起,包括用电脑。教程很复杂,充满大量组合键和专有名词,她很挫败,反复练习也学不会。
自此,使用电脑成为了陌生而混乱的体验。结构消失了,过去被自动忽略的广告等边角信息无法跳过,想读一篇文章,也常常要在「标题」「横杠」「登入」「推荐」等之间摸索许久。
摸索中,她发现,不同读屏软件背后大多有活跃的交流社区和互助群组。大家热烈地讨论着这些她此前从未想过的日常难题。而最核心的效率痛点之一,便是找回聆听的结构。
在代码层,页面如果缺乏清晰的语义框架,聆听便会被进一步拉长,增加视障用户的时间劳动。因此,无障碍设计的重点并不只是「让内容被读出来」,而是借由标题等级、跳转地标等标记,为狭长的听觉输入搭建有细粒度的结构。比如,那些大模型的回答里,有时让部分明眼用户吐槽「AI感太重」的 # 号和 * 号,在阅读器的浏览模式下,配合跳转键,便可成为目录,使聆听有了全景「扫听」的可能。
一直以来,视障群体内部讨论的重点往往聚焦在交互设计的基础层面,因为真正的障碍往往体现在这些极小的日常细节之中。然而,不断迭代技术的智能产品却忙着「给视障者一双眼睛」。
4. 要给视障者「一双眼睛」的科技乌托邦> 自公元前的文明之初,「使盲者复明」的叙事母体便被赋予彰显神权、脱离黑暗的隐喻,在神话与典籍中运行千年。而今,它正在成为算法时代的神迹吗?这个神迹,是为谁而存在的?
近年来,多模态技术快速发展并向可穿戴设备迁移,让「AI助盲」等科技向善议题进一步升温。其中,AI眼镜集成微型摄像头、扬声器、麦克风等传感器,嵌入多模态模型后,实时视觉理解、自然交互的能力升级。一时间,「让盲人『重见光明』」、「助视障者『看见』世界」等表述频繁见于报道与宣传中。
2025年被认为是AI眼镜的「爆发元年」,中国大陆智能眼镜市场销量同比增长211%,覆盖了全球超过80%的智能眼镜供应链制造。《中国日报》援引预测,由AI驱动的智能眼镜将在今年迎来进一步爆发式增长。
曹宇注意到,自去年起,AI眼镜在视障论坛中的讨论热度显著增加。部分视障者充满期待,认为眼镜的摄像头解放了双手,捕捉的画面也更接近第一视角的空间关系。
然而,目前尚无针对AI眼镜在视障群体中实际使用的系统性评估。去年年底,盲人AI社群组织者、调音师张振宇测评了市面上大部分厂家的眼镜,得出的结论是都不太好用。他指出,除了动态捕捉延迟、上下文记忆不足等问题,主要原因也在于交互模式——视障者正是因为无法察觉环境变化而需要即时信息。然而,所有的AI眼镜皆需被动唤起,用户发出明确的指令后,才能进行人机交互。仅依靠旁白,是无法独立完成蓝牙配对的。
在视障群体内部,最大的反对声来自于眼镜这一形态。对此,吴少玫从产品研发端给出了同样的判断。今天的她是科技无障碍非盈利组织AImpower.org的创始人兼CEO,此前的八年多里,她是Meta集团的资深研究科学家。13年前,她偶然发现Facebook的介面上有上百个按钮缺失替代文本,自此深耕科技无障碍领域。
她指出,一旦默认视障者缺少的是眼睛,科技的目标便聚焦于修补,于是产品与视障者已有的完整感知体系往往不相容。例如,实际使用中,佩戴在耳道附近的设备可能遮蔽环境声音,而环境音本身是空间定位与安全判断的重要来源。
微软包容性手册提出「残障是不适配的交互」,即现有设计并未充分适配残障人群。
视障产品中的另一典例是智能盲杖。她举例,作为一种经过上百年使用与检验的工具,盲杖的形态已非常成熟。它轻便、价格低廉,几乎没有使用门槛,高度契合视障者的身体经验。而大多智能盲杖或笨重、不易收纳,或不防水、带来额外的充电焦虑,难以为视障者带来实际便利。
曹宇曾在淘宝上听到一款语音导盲杖,按一下即可发出警报声,播放「我是盲人!请求帮助!」的语音。且不论功能易被误触,视障者本身面临歧视、同情、被围观的压力,将求助和警报声高声公放,高调宣称自己是「需要被照顾的『残疾人』」,无疑是万分尴尬的。更让他好奇的是,盲人并非没有语言能力,为何会需要语音公放呢?
不仅是视障群体,许多辅助设备的设计,往往将「残障」视为需要且可以被科技修补的丧失状态,导致产品或与残障者的真实需求相去甚远。
盲杖。Joe Raedle/ Images吴少玫观察到,近年来,残障者不需要的东西,被反复地发明。这些产品将科技视作义肢,每隔一阵,又有人重新「发明」智能盲杖、智能手语手套、爬楼轮椅等各类「助残」设计。
在无障碍领域,这类发明也被称为「残障饰品」(Disability Dongles)。该概念的提出者、残障设计师莉兹·杰克森(Liz Jackson)认为,「残障饰品」是一个当代童话故事,它提供了一种技术乌托邦式的无障碍解决方案,以迎合健全人的想象。尽管残障群体对许多「为」(for)其设计的产品持有持续的合理疑虑,但这些发明依然获得了主流关注和赞誉。
吴少玫指出,除了不实用外,问题也在于这些发明背后的责任错置,将无障碍这一复杂的社会问题完全转嫁给了个人。「它默认你是残缺的,那你多花点钱,买更酷的装备,变得跟非残障者一样,问题就都能解决了。于是,这些花销和努力又全部落到了残障者本身。与此同时,社会好像就可以不用做任何事。」她解释道。
原有的障碍、技术乌托邦式的发明,共同影响着视障群体的自我感受。「这些无时无刻、无处不在的隐形障碍,单独来看,每一项似乎都不算致命,但日积月累,就会让人产生『我不属于这里,我的存在并不重要』的感受。」吴少玫说。
5. 作为合规成本的无障碍,与脆弱的补丁> 真正的需求,为何进不了技术想象的中心?
《2023年信息无障碍调研报告》显示,超九成视障人群在独立使用智能手机时遇到障碍[[3]](「这些都是很基本的问题,要是研发阶段有视障用户参与,就不会出现。」针对科技中的种种障碍,吴少玫说。
上文提及的AI眼镜,据盲人AI社群组织者张振宇了解,目前仅有一款眼镜的开发团队与视障用户有过专门对接。
为了响应无障碍号召,有的品牌方会邀请残障者参加活动,但受邀参加后,他们的意见并未被采纳。多名残障受访者提到,即便曾受邀参加无障碍产品研发活动,也常有一种走过场的感觉。
2023年9月,《中华人民共和国无障碍环境建设法》正式施行,为大陆首次就无障碍环境建设制定专门性法律,发布信息无障碍相关标准近30项。去年,在该法实施两周年之际,中国盲文图书馆信息无障碍部软件工程师张军军认可了其对信息无障碍的重要奠基作用,同时提出建议,法案作为新生事物,部分条款操作性较弱,对政府部门服务的约束标准与对企业的要求之间存在一定差异,对企业的强制力相对不足,导致部分责任主体缺乏整改动力。
中国信息无障碍建设历程「无障碍设计」概念传入中国,开始指引国内残障群体设施建设工业和信息化部(原信息产业部)首次制定并发布《信息无障碍标准体系框架》,首次界定信息无障碍的服务内容和服务人群《中华人民共和国残疾人保障法》实施,在第七章无障碍环境有关条文中,明确提出推进信息交流无障碍中国首部专门的无障碍法律法规《无障碍环境建设条例》颁布第一部无障碍网站建设的专项政策《关于加强网站无障碍服务能力建设的指导意见》印发工业和信息化部、中国残疾人联合会联合发布《关于推进信息无障碍的指导意见》国家标准《GB/T 46070-2025移动智能终端信息无障碍通用规范》正式实施目前,多个国家已将无障碍法规纳入监管机制,并强调残障者在人工智能发展中的具体参与,以落实通用设计的原则。《欧洲无障碍法案》(European Accessibility Act, EAA)于去年6月生效,规定进入欧盟市场的产品与服务须符合无障碍要求。德国、瑞典、爱尔兰等各国皆采取相关强制性措施以确保该法的落地。美国的《残障者法案》(Americans with Disabilities Act of 1990, ADA)和《508法案》(Rehabilitation Act Section 508)等,从立法层面明确数字产品的合规。
然而,落实到产业层面,在多数国家,从研发环节便与残障群体充分对接是罕见的情况。因为受到种种限制,残障用户平均消费力更低。吴少玫提到,除了法规外,企业常常追求利润最大化,残障用户则往往被视为合规成本,而非市场对象。
从业十余年里,吴少玫观察到,大部分产品在研发时,受众画像并不包括残障主体。无障碍需求更多被作为满足法律底线的避险成本,力图成本最小化,也因此缺乏与残障群体对接的动力。甚至有时,哪怕存在风险,违规成本足够低,也可能会因利润大于成本而选择推进。
与此同时,尽管视障群体主导的团队,研发了开源、免费的无障碍产品,但难以与大型企业合作。后者倾向于一种榨取式的数据和知识产权,确保拥有完全的权利,面临最小的监管与责任。它们希望尽可能少对「如何使用这些资源」作出承诺,因为承诺同样是风险成本。而残障社群及其开源团队要求最基本的自主权,对自身产出的语料、代码和数据拥有知情权,以免成果被用于歧途。两者在根本上并不匹配。
隧道。Noam Galai/ Images于是,很多无障碍设计便错过了最初的研发阶段,最终以打补丁的形式出现。然而,要去改良已广泛推广的产品或服务,成本会变得很高。补丁需要的是长期维护,开发、测试、不同部门之间的协作等都需要持续投入人力、资源和时间。多名视障者皆提及,在使用智能设备时,系统升级后,支付按钮无法再点击,输入法找不到无障碍设置;或是高调宣传的无障碍开发,不知怎么地无疾而终。
另一方面,实际效果也会大打折扣,甚至可能是不太成立的。任何的二元制度在面对无法涵融的人群时,往往选择增加一个临时的例外选项,而非重新思考整套制度如何容纳差异。吴少玫将之类比性别系统。比如,美国护照系统曾试图修补其对于性别的二元限制,并在2022年为非二元性别护照持有者引入「X」性别标记,但这一修补机制于去年特朗普政府上台后被叫停。
「大家花了好多力气去打的补丁,可能很容易就会弄丢了。」吴少玫说。
但有补丁总比没有好。更令吴少玫忧虑的,是技术的范式本身。法规与产业都还有漫长的路要走,但我们好像过快走进了一个越来越依赖视觉,或者说,更「先进」模态的时代。
如同媒介理论家马歇尔·麦克卢汉(Marshall 「我们塑造了工具,接着工具也塑造了我们。」多模态技术本身为人机交互提供了更多元的可能,但与之相反,越来越多的交互被设计为仅通过某一更「先进」的模态完成。不仅是视觉,许多家用电器默认设计为语音声控,传统的按键式交互正在减少,购买成本也在提高。
与多模态并驱的,是形塑科技的巨头们正在向「效率」高歌猛进。2023年是多模态AI从实验室研究走向广泛运用的关键一年,也是以Meta首席执行官马克·扎克伯格(Mark Zuckerberg)为代表的巨头们所定义的「效率年」。她提到,自此以来,实际分配给DEI(多元、平等与包容)的资源也在减少。
访问(access)并非中立,而是取决于哪一种认知方式被纳入考量或被排除在外。
无障碍(accessibility)指向的是可访问 / 可及(accessible),问题在于,访问的有效性由谁定义。2023年,腾讯云开发者社区专栏发布《多模态AI浪潮来袭,或造福数亿视障人群》一文,提及「在人类获取的外界信息中,来自视觉的占比高达70%-80%,因此直接基于AI构建机器视觉系统,帮助视障患者拥有对外界环境的视觉感知与视觉理解能力,无疑是更为有效的解决方案。」「视觉占八成」的说法多见于视障辅助设计的说明之中,然而,多项研究表明,尽管广泛流传,该说法从未有可确证的具体数据来源。感官人类学者与设计师莎拉·平克(Sarah Pink)提出,视觉并非是最重要的理解模式,与之相反,理解是情境化的多感官整合过程。
诸如此类「更有效」的价值判断让吴少玫困惑。她认为,当一种说法未经充分审视,便被当作是客观的常识而传播,便也在建立着一种等级制度,预设了某种信息获取或交流的方式优于另一种,让人们潜移默化地接受了不合理的逻辑。
十多年里,她越来越感到,最初让自己偶然进入该领域的替代文本缺失,都只是很小的问题。很想要使用某个按钮,背后是视障用户更深层的需求——如果可以走进那个不被描述的世界,就能和自己的环境,和朋友们互动了。
和不同视障者的访谈中,她常常听到,人们最大的遗憾是体验的缺失,是在视觉时代里,越来越难以参与到社交与生活之中。
6. 我们正在共同走向的未来> 技术是在帮我们更好地生活,还是在替我们决定,什么是值得被体验的生活?
离家四年,随行走的半径一同在曹宇的生活中摊开的,是一个又一个问题。
听的故事多了,他发现,从被动到主动,几乎是每一个残障个体的心声。而主动需要的是勇气,更是深刻的看见——「障碍的问题在于环境,而不在于我」。而这也是主体性生长的开始,如果错不在我,不必努力做一个低配版的「正常人」,作为一个感知的主体,我真正的需求是什么?我想创造怎样的体验?
残障理论将残障视为反对「强制性健全」和「健全民族主义」的地界,一种具有生成性和创造性的关系实践。
这两年,他去到更多的地方旅行,才注意到,视障者虽然被认为需要一双眼睛,「看风景」却从来被略过了。导航软件会给他提供功能性的指引,但只有低视力团队研发的读屏软件,内置的向导才会补充风景的细节。对曹宇来说,风景常常是公园、博物馆,或是其它充满了人或人的痕迹之地。
而在陈莉耳中,颜色是重要的风景。《残疾人残疾分类和分级》及相关标准主要将视力障碍分为「盲」和「低视力」两类,而实际生活中的视力是一条更为多元的光谱。光谱关于视野、光感、色觉的不同,也关于一个人的具身记忆和生命经验。一年一年,陈莉的记忆正在缓慢地褪色,她听说,失明后,在她脑中、梦中淡去的颜色,有一天也许会完全消失,再也抓不住。所以,她想趁现在多「体验」——从每一段关于光是如何落在河流、树林,或建筑外墙的描述之中。
街上的行人。林振东/端传媒微信朋友圈的发布键默认是「拍摄」或「选择照片」,纯文字是隐藏功能。打开微信,曹宇可以听到朋友们热闹的评论,关于照片中的喜怒哀乐与美,而当他打开手机旁白的「影像描述」功能,想知道照片的内容,传入他耳中的是「图片,一斜线四,人,黑发,靠近屏幕顶部边缘,二斜线四,图片……」有时,AI的残言片语让他不禁想,我们正在走向一个怎样的未来?以语言在听者的脑中重建世界的模型,每一次都包含选择与立场。
机器的描述是一个个被动唤起的段落,在曹宇的日常生活中,发出不连续的响声,复又归于寂。更多时候,他在不同的感官之间穿行。许多声音成为时间的容器,他的记忆之锚。
他提到,最近,三个来自过去的回声在他的耳畔交错——人生来到第四个会有复合蝉鸣的年头,他便第一时间想到,这也意味着俄罗斯入侵乌克兰已有四年。近日,他聆听的文章里写道,战争使乌克兰数十年来的无障碍改革近乎停滞,甚至在多个领域出现系统性倒退。
iOS 18更新后,熟悉的Eloquence又回来了,这让他欣喜。老式、冷冰冰的合成音的回归,来自视障用户持续超过十年的无障碍需求反馈[[4]](今年,出于怀旧,他买来童年时最喜爱的玩具——语音计算器。
这款2023年上市的计算器,增设了三门方言,功能键微微隆起,运算键略略内陷,指腹落下去,便刚好贴合那弧面。他不禁反复触摸。对他而言,很多触觉是美的。当他在光滑的、起伏的、阻力绵密的,或是熟悉的物件表面摩挲,莫名的安心感便从指腹传来。
每按下一个计算按键,语音播报声是如此熟悉。接着,待他摸索一阵后,《蓝精灵之歌》、《数鸭子》、《致爱丽丝》……儿时的歌谣便以低保真音质逐一播放。再到调时间处,嘀嘀声一如既往。
不变的歌与沉默将他带往童年。当科技更深地介入我们的感官,AI像人类一样整合视觉、听觉与语言信息,曹宇越来越感到,「描述」的本质,从来不只是翻译画面,什么值得被说出来?抚过键盘的凹凸面,听着持续的嘀嘀声,他常常沉思。
注1. 文中盲文为大陆现行盲文,采用了《中国盲文GBT 15720-2008》国家标准。
注2. 为避免过长的文字打断阅读,未在导航播报的插画中详列背景文字的全部内容。以下是播报内容的全德地图已打开我的位置按钮路线按钮向上翻页返回搜索框输入文字文字栏位点两下来编辑使用转轮来取用单字订附近看球酒店景点门票加油充电休闲玩乐扫街榜充电站家公司旅游攻略历史记录清空管理公园高新竹园打车路线路线路线向上翻页24分钟4.7公里时推荐方案骑行按钮驾车按钮步行按钮刷新我的位置按钮大于号小于号斜线蚂蚁森林完成开通每天导航领10G51分钟3.4公里8推荐方案荧幕变暗7元起特价打车古寺祈福之旅3.5公里洪家营天子庙太乙古寺高新竹园蚂蚁森林大于号小于号底线底线大于号开通低碳出行小于号大于号小于号底线大于号领28G蚂蚁森林能量小于号斜线大于号小于号斜线大于号小于号斜线大于号完成开通每天导航领10G28G开始步行导航」注3. 受访者曹宇、陈莉为化名。返回内文
-
近年研究表明,被刻板印象者称为「盲态」的重复动作(如摇晃身体、头部摆动、按压眼睛),可能承担自我调节与情绪稳定功能。 ↩️ 返回内文
-
出自《视听有障,交流无碍——2023年信息无障碍调研报告》,由腾讯用户研究与体验设计中心(Tencent CDC)联合中国信息通信研究院、中国盲人协会、中国聋人协会等机构发布。 ↩️ 返回内文
-
「Eloquence」并非在iOS 18首次回归。这一曾用于早期Mac VoiceOver的经典合成音,在缺席iPhone系统多年后,于iOS 16被重新引入,但在iOS 17部分版本中无法正常使用,至iOS 18中恢复稳定。苹果公司在官方说明中并未提及该声效的回归与视障用户长期反馈之间的关联。此前十余年间,视障社群持续在无障碍讨论或论坛反馈中表达对该声效的需求与偏好,因其高辨识度、可理解性,对许多屏幕阅读器使用者而言是关键的。 ↩️ 返回内文本互动页面是端传媒「专题记者成长计划」的成果。2024年,端传媒推出「专题记者成长计划」,为青年记者提供专业支持,共同维系深度报道的行业生态。其他文章可点此进一步了解。©2026 Initium Media.