一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
还记得那个经典的“斯特鲁普效应”测试吗?当“红色”这个词用蓝色墨水书写时,人类需要额外的时间才能正确说出墨水的颜色。这个心理学经典测试,如今成了AI模型的“照妖镜”。

来自顶尖研究机构的一个团队,给当前最先进的大语言模型做了一次“灵魂拷问”:让它们在越来越长的列表中,找出特定颜色的词汇。结果令人震惊——当列表从10项扩展到30项时,那些在各类基准测试中“封神”的模型,准确率从90%以上断崖式下跌,有些甚至跌到了接近随机猜测的水平。
一个简单的颜色识别任务,为何会成为AI的“滑铁卢”?研究人员设计了一个看似简单的实验:向AI模型展示一个颜色词汇列表,然后询问某个特定颜色是否出现。比如,在“红色、蓝色、绿色、黄色”中,问“红色出现了吗?”
这个任务对人类来说几乎毫无难度,即使是儿童也能轻松完成。但当列表长度增加,任务复杂度上升时,AI模型的“大脑”——那些经过千亿参数训练的神经网络——开始出现系统性崩溃。
“我们最初只是想测试模型的注意力机制,”研究团队表示,“但结果远超预期。这不是简单的性能下降,而是灾难性的失效。”
实验数据显示,在10项列表上,顶尖模型的表现接近完美,准确率超过90%。但当列表扩展到30项时,一些模型的准确率暴跌至接近0%——这意味着它们不仅无法正确回答问题,甚至可能完全失去了处理信息的能力。
这个发现之所以重要,是因为它揭示了AI模型与人类认知之间的根本差异。
人类在面对这类任务时,会使用一种称为“选择性注意”的机制——我们会主动忽略不相关的信息,专注于目标。而AI模型,尽管在无数任务上表现出色,却缺乏这种真正的选择性注意能力。它们更像是在进行一种“统计匹配”,而不是真正的“理解”。
更令人担忧的是,这种缺陷并非仅限于颜色识别。研究人员发现,随着任务复杂度的增加,AI模型在各类信息检索和模式识别任务上都表现出类似的退化趋势。
“这就像给一个天才学生做一份超长试卷,前10题他全对,但做到第30题时,他突然连题目都读不懂了,”一位参与研究的科学家如此比喻。
最令人意外的发现是,模型规模与性能退化之间的关系并非简单的线性关系。一些参数更大的模型,在某些复杂场景下反而表现得更差。
这挑战了业界“更大即更好”的主流观念。过去几年,AI行业一直在追求更大的模型、更多的参数、更长的上下文窗口。但这项研究表明,这种“暴力美学”可能正在掩盖更深层的问题——模型可能并未真正理解信息,而是在利用统计规律“作弊”。
这也解释了为什么在实际应用中,AI系统经常在看似简单的任务上出现匪夷所思的失误。比如,在处理长文档时突然“失忆”,或者在多轮对话中逻辑混乱。
这项研究给火热的大模型发展泼了一盆冷水。它提醒我们,当前AI技术的核心——Transformer架构和注意力机制——可能存在着根本性的局限。
“我们需要重新思考AI系统的设计理念,”研究团队警告,“单纯增加模型规模和数据量,可能无法解决这些基础性的认知缺陷。”
这不禁让人想起图灵测试的初衷:真正的智能应该能够处理无限变化的任务,而不是在特定条件下“超神”,在其他条件下“崩溃”。
对于AI行业来说,这项研究既是一个警示,也是一个机遇。它指明了一个重要的研究方向:如何让AI模型具备真正的、可持续的注意力机制,而不是仅仅依赖统计相关性。
或许,下一代AI的革命,就潜藏在这些“失败”的实验中。正如人类从错误中学习,AI的发展也需要正视这些短板,才能真正迈向通用人工智能。
毕竟,如果连“在一串词语中找颜色”这样的任务都无法稳定完成,我们又如何能放心让AI去处理更复杂的现实世界问题呢?
ScienceDaily - “A classic brain test exposed AI's biggest weakness”
标签:AI局限, #, 大模型, #, 注意力机制, #, 认知科学, #, 技术反思一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
还记得那个经典的“斯特鲁普效应”测试吗?当“红色”这个词用蓝色墨水书写时,人类需要额外的时间才能正确说出墨水的颜色。这个心理学经典测试,如今成了AI模型的“照妖镜”。

来自顶尖研究机构的一个团队,给当前最先进的大语言模型做了一次“灵魂拷问”:让它们在越来越长的列表中,找出特定颜色的词汇。结果令人震惊——当列表从10项扩展到30项时,那些在各类基准测试中“封神”的模型,准确率从90%以上断崖式下跌,有些甚至跌到了接近随机猜测的水平。
一个简单的颜色识别任务,为何会成为AI的“滑铁卢”?研究人员设计了一个看似简单的实验:向AI模型展示一个颜色词汇列表,然后询问某个特定颜色是否出现。比如,在“红色、蓝色、绿色、黄色”中,问“红色出现了吗?”
这个任务对人类来说几乎毫无难度,即使是儿童也能轻松完成。但当列表长度增加,任务复杂度上升时,AI模型的“大脑”——那些经过千亿参数训练的神经网络——开始出现系统性崩溃。
“我们最初只是想测试模型的注意力机制,”研究团队表示,“但结果远超预期。这不是简单的性能下降,而是灾难性的失效。”
实验数据显示,在10项列表上,顶尖模型的表现接近完美,准确率超过90%。但当列表扩展到30项时,一些模型的准确率暴跌至接近0%——这意味着它们不仅无法正确回答问题,甚至可能完全失去了处理信息的能力。
这个发现之所以重要,是因为它揭示了AI模型与人类认知之间的根本差异。
人类在面对这类任务时,会使用一种称为“选择性注意”的机制——我们会主动忽略不相关的信息,专注于目标。而AI模型,尽管在无数任务上表现出色,却缺乏这种真正的选择性注意能力。它们更像是在进行一种“统计匹配”,而不是真正的“理解”。
更令人担忧的是,这种缺陷并非仅限于颜色识别。研究人员发现,随着任务复杂度的增加,AI模型在各类信息检索和模式识别任务上都表现出类似的退化趋势。
“这就像给一个天才学生做一份超长试卷,前10题他全对,但做到第30题时,他突然连题目都读不懂了,”一位参与研究的科学家如此比喻。
最令人意外的发现是,模型规模与性能退化之间的关系并非简单的线性关系。一些参数更大的模型,在某些复杂场景下反而表现得更差。
这挑战了业界“更大即更好”的主流观念。过去几年,AI行业一直在追求更大的模型、更多的参数、更长的上下文窗口。但这项研究表明,这种“暴力美学”可能正在掩盖更深层的问题——模型可能并未真正理解信息,而是在利用统计规律“作弊”。
这也解释了为什么在实际应用中,AI系统经常在看似简单的任务上出现匪夷所思的失误。比如,在处理长文档时突然“失忆”,或者在多轮对话中逻辑混乱。
这项研究给火热的大模型发展泼了一盆冷水。它提醒我们,当前AI技术的核心——Transformer架构和注意力机制——可能存在着根本性的局限。
“我们需要重新思考AI系统的设计理念,”研究团队警告,“单纯增加模型规模和数据量,可能无法解决这些基础性的认知缺陷。”
这不禁让人想起图灵测试的初衷:真正的智能应该能够处理无限变化的任务,而不是在特定条件下“超神”,在其他条件下“崩溃”。
对于AI行业来说,这项研究既是一个警示,也是一个机遇。它指明了一个重要的研究方向:如何让AI模型具备真正的、可持续的注意力机制,而不是仅仅依赖统计相关性。
或许,下一代AI的革命,就潜藏在这些“失败”的实验中。正如人类从错误中学习,AI的发展也需要正视这些短板,才能真正迈向通用人工智能。
毕竟,如果连“在一串词语中找颜色”这样的任务都无法稳定完成,我们又如何能放心让AI去处理更复杂的现实世界问题呢?
这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。
ScienceDaily - “A classic brain test exposed AI's biggest weakness”
原文链接:https://www.sciencedaily.com/releases/2026/06/260610003049.htm【开场 Hook(0-5秒)】
一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
【核心内容(5-45秒)】
90%准确率瞬间崩塌!经典心理学测试揭示AI的致命缺陷,大模型为何栽在“找颜色”上?
(根据文章正文提炼 3-5 个关键点,口语化表达)【结尾引导(45-60秒)】
如果你觉得有用,点赞收藏,评论区告诉我你的看法!
90%准确率瞬间崩塌!经典心理学测试揭示AI的致命缺陷,大模型为何栽在“找颜色”上? 🔥
一个看似简单的注意力测试,却让GPT-4、Claude等顶级AI模型集体“翻车”。当任务从10项增加到30项,它们的准确率从90%以上暴跌至接近零。这个发现,或许将重新定义我们对AI能力的认知。
💡 关键信息:
#AI局限 ## #大模型 ## #注意力机制
#科技资讯 #前沿技术
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 公众号 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 小红书 | 📋 手动复制 |