ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

The Art of Scaling Test-Time Compute for Large Language Models

The Art of Scaling Test-Time Compute for Large Language Models 一、文章主要内容总结本文聚焦大语言模型(LLMs)的测试时缩放(TTS)技术,旨在解决现有研究中缺乏统一条件下TTS策略系统对比、模型类型与问题难度对性能影响不明确的问题。通过对8个开源LLM(参数规模7B-235B)在4个推理数据集上生成的超300亿tokens进行大规模研究,得出三大核心发现:无单一TTS策略能全局最优,不同策略的效果依赖模型类型、问题难度和计算预算;推理模型按轨迹质量模式可分为短视域(如R1、DAPO-32B)和长视域(如Qwen3-32B、GPT-OSS-120B)两类,短视域模型偏好简洁推理轨迹,长视域模型在难题上更受益于长轨迹;对特定模型类型,最优TTS性能随计算预算单调递增。基于这些发现,作者提出实用选择指南:低计算预算时短视域和非推理模型优先FFS-k@N(k=1,N尽可能大),长视域模型采用简单解码;高计算预算时所有模型均优先MV@N(N尽可能大)。同时验证了beam search在推理任务中存在逆缩放效应,LFS策略始终不如MV策略最优,DAPO算法与GRPO算法诱导的长度偏差程度相近。二、文章创新点首次开展大规模TTS系统研究:覆盖多模型、多数据集、多策略,生成超300亿tokens,填补了不同TTS策略在统一条件下对比的空白;提出模型视域分类框架:基于后训练算法差异(如GRPO/GSPO)将推理模型分为短视域和长视域,揭示了不同模型的轨迹长度-质量关联规律;发现关键性能规律:明确beam search的逆缩放效应、LFS策略的次优性、计算预算与最
返回列表