转载 | 经典心理学测试暴露AI致命弱点:复杂任务中准确率从90%暴跌至接近零

研究人员最近开展了一项富有启发性的实验:他们让当前最先进的大语言模型(如ChatGPT、Claude和Gemini)完成心理学经典的斯特鲁普任务(Stroop task),结果暴露了AI系统在”注意力”方面的根本性缺陷。

斯特鲁普任务是心理学中研究注意力和执行控制的经典测试。测试中,颜色词(如”红””蓝””绿”)以不同颜色的墨水显示——有时词义与墨水颜色一致,有时冲突。参与者需要说出墨水的颜色而非读词。对大多数人来说,这并不容易,因为阅读是自动化习惯,大脑需要抑制读词的冲动。

研究人员发现,在短列表测试中,AI模型能够正确命名颜色,准确率可达90%以上。但当任务变长、冲突增加时,它们的表现急剧下降,部分顶尖系统的准确率几乎跌至零。这与人类的表现模式截然不同——人类在训练后能够稳定地完成任务,而AI似乎在遇到认知冲突时缺乏真正的”注意力调节”机制。

这一发现揭示了大语言模型的一个关键局限性:它们能处理明确的信息,但在需要抑制干扰、进行选择性注意的复杂情境中暴露了深层缺陷。研究提示我们,当前AI与人类认知之间的鸿沟远比想象中更深,特别是在需要真正的”理解”而非模式匹配的任务中。

来源:ScienceDaily原文链接

— 分享本文 —

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注