ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Large Language Models Show Signs of Alignment with Human Neurocognition During Abstract Reasoning

Large Language Models Show Signs of Alignment with Human Neurocognition During Abstract Reasoning 文章总结与翻译一、文章主要内容该研究聚焦大型语言模型(LLMs)在抽象推理过程中是否与人类神经认知存在一致性,通过对比人类参与者与8个开源LLMs在抽象模式补全任务中的表现及神经表征展开研究,具体内容如下:任务设计与数据采集:25名人类参与者在完成抽象模式补全任务时,同步记录其脑电图(EEG)信号和眼动数据;LLMs则通过文本形式接收相同任务,用对应单词标签替代图标,同时提取各层隐藏层激活信息。任务包含8种不同抽象模式,共400个独特试次,要求参与者从4个选项中选出正确图标补全序列。性能对比结果:人类整体准确率为82.47%,大部分LLMs准确率低于40%,仅参数规模约700亿的大型模型(Qwen2.5-72B、DeepSeek-R1-70B、Llama-3.3-70B)准确率接近人类(75.00%-81.75%)。其中Qwen2.5-72B和DeepSeek-R1-70B不仅准确率高,且与人类在不同模式下的难度分布相关性较强(Pearson相关系数分别为0.71和0.70);而Llama-3.3-70B虽准确率最高(81.75%),但与人类难度分布相关性低(r=0.27)。此外,闭源模型(如google/gemini-2.5-pro-preview-06-05等)准确率极高(99%-100%),但因非开源无法用于神经认知对比。表征相似性分析(RSA):通过构建任务最优参考表征差异矩阵(RDM),发现所有LLM的层激活与参考RDM的相关性呈倒“U”型,在中间层(平均约为层深度的47.52%)
返回列表