ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

字节:揭示LLM代理技能静默过时难题

字节:揭示LLM代理技能静默过时难题 标题Repo2Skill-Evo: Repository Skills Go Stale in Silence来源arXiv, 2608.21964v1️文章简介研究问题随着软件仓库版本迭代外部化的代理技能Skills是否会因缺乏显式信号而静默过时且当前最先进的LLM代理能否可靠地维护这些技能以保持其有效性主要贡献论文提出了Repo2Skill-Evo基准量化了技能维护的难度揭示了即使是最先进的代理也无法可靠地解决技能静默过时问题并指出了定位与编辑选择两大瓶颈。重点思路定义静默过时现象将仓库特定程序知识外部化为技能后当仓库发布新版本时旧技能虽仍可加载但内容已失效且无明确错误信号导致代理被误导。构建Repo2Skill-Evo基准涵盖57个真实仓库和105个版本过渡。首先通过Repo2Skill流程从V1版本蒸馏出可追溯的固定技能集然后结合官方V1到V2的补丁要求代理更新技能即删除过时内容并保留有效指导。设计严格评估指标采用基于补丁的移除度量标准平衡过时内容的召回率与过度编辑的精确率。同时引入NL Judge对最终技能集的API正确性、文件一致性等五个维度进行综合评分。诊断失败原因通过分析执行轨迹将维护失败归因于两个互补瓶颈一是受影响技能文件的定位覆盖不全导致遗漏过时内容二是编辑选择不完美要么编辑不足要么范围过宽导致精度下降。分析总结技能具有显著实用价值实验显示在基线效用较低的仓库中使用技能带来的性能提升最大且相比直接访问源码技能能以更低成本提供相当的知识支持证明了维护技能的必要性。现有代理维护能力不足在105个过渡任务中所有评估的过渡均使部分V1技能失效。六个前沿代理的平均宏F1分数仅在29.9%至69.7%之间表明即使是顶级模型也无法可靠地维护技能。存在召回与精度的权衡困境不同模型表现出不同的错误模式。例如GPT-5.4召回率高但精度低倾向于过度编辑而其他一些模型精度高但召回率低倾向于遗漏修改。多次运行结果显示性能不稳定。定位是关键但非唯一瓶颈Oracle实验表明若直接提供受影响的文件路径性能虽有提升但仍存在大量残余错误说明仅解决文件级定位不够代理仍难以在文件内准确追踪证据并选择恰当编辑。个人观点论文将LLM代理技能视为“版本化知识资产”并指出了其生命周期中容易被忽视的“静默过时”风险。
返回列表