字号 ·· | 护眼
加美财经

研究:200多种AI视觉模型都没学会像人一样“看形状”

人工智能已经能够生成逼真的图像、解决复杂数学问题,并在大量视觉识别测试中达到甚至超过人类水平,但一项最新研究显示,在一个看似非常基础的能力上,机器仍没有真正学会像人一样“看东西”。

AI图像识别
计算机视觉系统识别真实物体与屏幕图像的示意。图/Max Gruber、Better Images of AI,CC BY 4.0

纽约大学研究人员在《iScience》发表研究,对超过200种深度神经网络视觉模型进行测试,结果发现,没有一种模型能够完整复制人类识别物体时使用不同视觉线索的方式。

人类看到一只猫、一辆汽车或一根玉米时,并不只依赖某一个局部特征。

大脑会综合物体的整体轮廓、内部结构和表面纹理。即使猫的毛色发生改变,身体的一部分被遮住,或者图像中的局部细节与平时不同,人通常仍能利用整体形状迅速判断它是什么。

AI视觉模型的工作方式却有所不同。

研究人员选取猫、蝴蝶、汽车、玉米等48类日常物体,制作了240张经过系统修改的测试图像,并分别改变物体的整体形状、内部组成部分和表面纹理。

例如,一些图像只保留物体的黑色轮廓,把所有内部细节去掉;另一些保留毛发等纹理,却破坏物体原来的外形;还有一些把大量局部物体碎片重新排列,使局部特征仍然存在,但正常的整体轮廓消失。

研究人员随后让人类参与者和超过200种深度神经网络识别这些图像。

这些AI模型涵盖不同架构、不同训练数据和不同训练方法,包括卷积神经网络、视觉Transformer、带循环连接的模型,以及经过专门训练、试图减少传统AI“纹理偏好”的模型。

结果显示,当图像保持正常结构时,许多AI模型的识别能力非常强。

为海外华人提供可靠的信息和分析。更多内容与即时更新,可以在 Bluesky、Telegram、X 、reddit搜索「causmoney」;深度分析和评论也可以直接搜索「caus.com」。

真正的差异出现在研究人员人为拆开不同视觉线索之后。

人类特别善于利用整体形状判断一个物体是什么。即使内部细节和纹理已经发生很大变化,只要总体轮廓仍然存在,人类往往依然能够认出来。

AI则明显更加依赖局部细节和纹理。

当正确答案主要依靠整体轮廓才能判断时,研究中测试的所有深度神经网络都明显落后于人类。

研究负责人、纽约大学神经科学家何碧玉表示,研究团队测试了超过200种深度神经网络,没有一种能够完整重现人类识别物体时对不同视觉线索的依赖模式。

她指出,人类利用整体形状识别物体的能力,目前仍是机器视觉无法达到的。

研究还发现,单纯增加模型规模或换一种神经网络架构,并没有自动解决这个问题。

表现最接近人类的是经过微调、同时利用图像和文字进行对比学习的模型。这类模型通过图片和文字描述之间的关系学习“什么东西是什么”,整体表现比传统只学习图像标签的模型更加接近人类。

但它们仍然没有真正解决整体形状问题。一旦研究人员破坏物体的正常整体结构,这些模型与人类的行为模式又迅速出现明显差异。

另一个值得注意的结果是,一个AI模型在正常图像识别测试中的准确率高,并不意味着它看东西的方式更像人。

甚至一个模型的内部活动与人类大脑腹侧视觉通路的神经活动更加相似,也不能可靠预测它在实际物体识别任务中的行为是否更加接近人类。

这意味着,目前衡量AI视觉模型是否“像人”的一些常用指标可能并不充分。

研究人员强调,这项研究并不是说AI已经无法可靠识别物体。

为海外华人提供可靠的信息和分析。更多内容与即时更新,可以在 Bluesky、Telegram、X 、reddit搜索「causmoney」;深度分析和评论也可以直接搜索「caus.com」。

在普通、清晰、没有经过人为扰动的照片中,现代视觉模型通常表现很好。这项实验测试的是一个更加具体的问题:当熟悉的视觉线索发生冲突或部分消失时,机器是否仍然能够采用与人类相似的方式判断物体。

结果显示,两者仍存在明显差距。

这一差距在现实应用中可能具有实际意义。自动驾驶汽车、机器人和辅助视觉设备面对的并不总是完整清晰的标准照片。行人可能被车辆遮住,道路标志可能被树枝挡住,物体也可能因为光线、视角或损坏而只剩部分轮廓。

在这些情况下,人类往往可以利用整体结构“补全”缺失的信息,而AI视觉系统可能更加容易受到局部变化干扰。

研究人员表示,他们下一步将继续比较人工智能与人脑处理视觉信息的方式,希望找出造成这种差异的机制,并开发在真实复杂环境中更加接近人类视觉判断方式的AI系统。