
文章总结与翻译一、文章主要内容该研究聚焦大型语言模型(LLMs)在抽象推理过程中是否与人类神经认知存在一致性,通过对比人类参与者与8个开源LLMs在抽象模式补全任务中的表现及神经表征展开研究,具体内容如下:任务设计与数据采集:25名人类参与者在完成抽象模式补全任务时,同步记录其脑电图(EEG)信号和眼动数据;LLMs则通过文本形式接收相同任务,用对应单词标签替代图标,同时提取各层隐藏层激活信息。任务包含8种不同抽象模式,共400个独特试次,要求参与者从4个选项中选出正确图标补全序列。性能对比结果:人类整体准确率为82.47%,大部分LLMs准确率低于40%,仅参数规模约700亿的大型模型(Qwen2.5-72B、DeepSeek-R1-70B、Llama-3.3-70B)准确率接近人类(75.00%-81.75%)。其中Qwen2.5-72B和DeepSeek-R1-70B不仅准确率高,且与人类在不同模式下的难度分布相关性较强(Pearson相关系数分别为0.71和0.70);而Llama-3.3-70B虽准确率最高(81.75%),但与人类难度分布相关性低(r=0.27)。此外,闭源模型(如google/gemini-2.5-pro-preview-06-05等)准确率极高(99%-100%),但因非开源无法用于神经认知对比。表征相似性分析(RSA):通过构建任务最优参考表征差异矩阵(RDM),发现所有LLM的层激活与参考RDM的相关性呈倒“U”型,在中间层(平均约为层深度的47.52%)