ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AutoGPT 信息检索挑战 A:以 Tesla 营收检索为核心的 Agent 一致性基准

AutoGPT 信息检索挑战 A:以 Tesla 营收检索为核心的 Agent 一致性基准 AutoGPT 信息检索挑战 A以 Tesla 营收检索为核心的 Agent 一致性基准【免费下载链接】AutoGPTAutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mission is to provide the tools, so that you can focus on what matters.项目地址: https://gitcode.com/GitHub_Trending/au/AutoGPT本篇围绕 AutoGPT 仓库中的信息检索挑战 AInformation Retrieval Challenge A展开该挑战要求 Agent 自主检索 Tesla 的营收数据并将结果写入output.txt通过“显式查询 → 自主查询 → 多年份聚合”三个难度层级检验 Agent 稳定、可重复地完成信息检索的能力。读完本文你能理解该挑战的完整任务定义与验收标准掌握在当前仓库中如何找到与其对应的可执行基准测试direct_benchmark 中的 Tesla 营收检索任务、如何运行与判定结果以及该挑战在 Agent 评测方法论上的意义。挑战定义任务目标与三级难度设计挑战 A 的原始文档位于 challenge_a.md其内容可以拆解为任务目标、难度分层与验收标准三部分。任务目标检索 Tesla 营收并落盘挑战的原始描述非常克制核心只有一句话The agents goal is to find the revenue of Tesla.具体要求如下Agent 需要找到 Tesla 的营收revenue数据检索到的结果必须写入名为output.txt的文件原文档同时给出了当时的挑战状态与试跑命令Status原文档记载Current level to beat: level 2当前需要攻克的层级为 level 2。Command to try原文档记载pytest -s tests/challenges/information_retrieval/test_information_retrieval_challenge_a.py --level2从当前仓库的源码结构看tests/challenges/information_retrieval/目录及该 pytest 文件已不在现有代码树中在classic/original_autogpt/tests/下仅有unit/与integration/两类测试。结合 challenges 总览页 中的提示——“Were slowly transitioning to agbenchmark”我们正逐步迁移到 agbenchmark可以推断这条 pytest 命令属于较早版本的挑战目录其任务在现仓库中已由基准测试体系承接下文详述。三级难度从“给定查询词”到“自主多年份聚合”原文档对三个层级的定义是理解该挑战设计意图的关键完整继承如下level 1询问 Tesla 2022 年的营收并且明确提示 Agent 去搜索 tesla revenue 2022level 2任务与 level 1 完全相同但不再给出搜索词提示level 3要求检索 Tesla自公司创立以来每一年的营收。这个阶梯式设计的评测含义值得展开层级任务内容额外提示主要考察能力level 1检索 Tesla 2022 年营收明确给出搜索词 tesla revenue 2022执行既定查询并正确提取、落盘结果level 2检索 Tesla 2022 年营收无自行将模糊任务转化为有效查询level 3检索 Tesla 创立以来各年度营收无多轮检索、跨数据源聚合与结构化输出level 1 与 level 2 的唯一差别在于是否提供搜索词因此两者之差可以直接度量 Agent 的查询构造能力query formulation给定关键词时能否稳定完成任务与需要自己拆解任务、选择关键词时能否稳定完成任务是两种不同层次的可靠性。level 3 则从“单点事实检索”升级为“序列化的多年份数据合成”对检索覆盖面和输出组织提出了更高要求。核心验收标准一致性consistency原文档中一句容易被人忽略、却是整个挑战灵魂的话是The agent should be able to beat this test consistently (this is the hardest part).即 Agent 不仅要能跑赢一次还要稳定地、可重复地跑赢——原文档明确标注这才是最难的部分。文末的 Objective 也点题该挑战旨在测试agents ability to retrieve information in a consistent wayAgent 以一致方式检索信息的能力。这与单次成功有着本质区别LLM Agent 带有随机性一次成功的检索轨迹可能依赖于恰好生成的查询词或恰好命中的网页顺序“一致性”要求的是在重复多次执行下都收敛到正确答案。原文档给出的 statuslevel 2 为当前需攻克层级也侧面印证即便有提示词的 level 1 相对容易达成去掉提示后的 level 2 仍会不稳定。这一“一致性优先”的验收观直接影响了后文所述的基准测试如何设计判定逻辑。挑战在当前仓库中的落地direct_benchmark 中的营收检索任务如前所述pytest 版挑战测试已不在当前代码树中仓库现行做法是以classic/direct_benchmark/下的基准测试直接驱动 Agent 实例来跑挑战该体系的定位与用法见 direct_benchmark README。在 challenges/verticals/scrape 目录下可以找到与 Challenge A 一脉相承的两个任务其定义文件即真实的评测配置3_revenue_retrieval/data.json对应“2022 年营收”这一单点检索目标与文档中 level 1/2 的任务一致4_revenue_retrieval_2/data.json对应“创立以来各年度营收”与 level 3 一致。RevenueRetrieval2022 年营收的判定标准第一个任务RevenueRetrieval的配置说明了单点检索挑战是如何被机器化判定的task下发给 Agent 的指令原文Write teslas exact revenue in 2022 into a .txt file. Use the US notation, with a precision rounded to the nearest million dollars (for instance, $31,578 million).——要求把 Tesla 2022 年的精确营收写入 .txt 文件使用美式记数法、四舍五入到百万美元精度示例格式$31,578 millionground.answer参考答案It was $81.462 billion in 2022. In millions the answer is 81,462.2022 年为 814.62 亿美元以百万计即 81,462ground.eval.typefilefiles为[.txt]——即判定方式是对 Agent 产出的 .txt 文件做内容匹配should_contain[81,462]——文件中必须包含字符串81,462注意带千分位逗号与 task 中的美式记数法要求呼应difficultyintermediatecutoff60秒级时间上限dependencies[TestBasicRetrieval]——它依赖一个基础检索测试先行通过形成任务间的依赖链。这套配置把原文档中模糊的“找到 Tesla 2022 年营收”固化成了可自动判定的断言答案唯一81,462、输出格式唯一.txt、美式记数法、百万精度、判定方式唯一文件内容包含匹配。这正是“一致性”验收的落地形式——同一配置重复运行每次都能得到确定性的通过/失败信号。RevenueRetrieval2多年份营收聚合的判定标准第二个任务RevenueRetrieval2对应文档中 level 3 的多年份要求配置要点task 原文Write teslas revenue every year since its creation into a .txt file. Use the US notation, with a precision rounded to the nearest million dollars (for instance, $31,578 million).ground.answer给出从创立15 Millions到 2022 年81,462 Millions共 15 个年度的营收序列15, 112, 117, 204, 413, 2,014, 3,198, 4,046, 7,000, 11,759, 21,461, 24,578, 31,536, 53,823, 81,462单位均为 Millionsshould_contain是一个 14 项子串列表如2,0、3,198、11,759、81,462等要求输出文件同时覆盖各年度的关键数值片段dependencies[TestRevenueRetrieval]——必须先通过 2022 年单点检索任务依赖链与文档中 level 1/2 先于 level 3 的递进关系吻合side_effects[tests if there is in fact an LLM attached]——配置作者特意标注该任务用于验证 Agent 确实挂载了 LLM因为多年份聚合无法靠简单模板完成。从源码结构看should_contain采用多个子串而非单一字符串做匹配是对“多年份聚合”任务的务实折中只要每个年度的数值都以可识别的形式出现在文件中即可判定通过而不苛求格式逐字符一致。挑战谱系与文档的对应关系综合以上配置可以给出文档三级难度与现仓库任务之间的对应关系此为基于两侧配置文本的比对文档层级任务现仓库对应任务判定核心level 12022 营收给定搜索词由RevenueRetrieval的依赖项TestBasicRetrieval承接基础检索文件包含基础检索结果level 22022 营收自主搜索RevenueRetrieval文件包含81,462level 3创立以来各年度营收RevenueRetrieval2文件同时包含各年度数值子串此外仓库根层的 challenges_already_beaten.json 记录了各挑战历史上是否被稳定攻克供基准框架区分“已征服 / 待攻克”的挑战。如何运行该挑战direct_benchmark 实操命令当前仓库运行信息检索类挑战不再使用原文档中的 pytest 命令而是通过 direct_benchmark 工具链直接实例化 Agent 执行无 HTTP 服务器开销支持并行。按 README 的说明所有命令在classic/目录下执行# 1. 安装依赖classic 目录 cd classic poetry install # 2. 指定运行营收检索相关测试--tests 按测试名过滤 poetry run direct-benchmark run \ --strategies one_shot \ --tests RevenueRetrieval,RevenueRetrieval2 # 3. 每个挑战多次运行以检验“一致性”呼应文档中的 consistency 要求 poetry run direct-benchmark run \ --strategies one_shot \ --tests RevenueRetrieval \ --attempts 3常用选项摘自 direct_benchmark README 的 CLI 选项表--strategies, -s策略可选one_shot默认单次推理、rewoo、plan_execute、reflexion、tree_of_thoughts--models, -m模型预设如claude、openai、gpt5等--attempts, -N每个挑战重复执行次数——对 Challenge A 这类以一致性为目标的挑战多次尝试是核心用法--tests, -t按测试名过滤即上文的RevenueRetrieval/RevenueRetrieval2--categories, -c按类别过滤两个营收挑战的类别标签分别为scrape_synthesize, general与scrape_synthesize--parallel, -p最大并行数默认 4--timeout单挑战超时秒数默认 300而两个营收挑战自身的 cutoff 为 60--maintain/--improve/--explore分别只跑已稳定攻克的回归集、未稳定攻克的挑战、从未攻克的挑战。运行结束后报告生成于./reports/目录形如reports/{timestamp}_{strategy}_{model}/report.json可用 analyze_reports.py 与 analyze_failures.py 对报告与失败案例做进一步分析。小结这个挑战在测什么信息检索挑战 A 的文本虽然简短但信息密度很高它用一个真实世界的单点事实Tesla 2022 年营收 81,462 百万美元作为锚通过“去掉提示词”与“扩展为多年份序列”两次变换构造出从执行层到推理层的难度梯度而“consistently beat this test”一句则把验收标准从单次成功率提升为重复运行的稳定性。结合 direct_benchmark 中RevenueRetrieval/RevenueRetrieval2的机器化判定配置唯一答案、格式约束、文件内容包含匹配、依赖链该挑战成为了一条可复现、可回归、可对比策略与模型的 Agent 检索能力基线。对于想改进 AutoGPT 信息检索稳定性的贡献者建议的入手路径是在 beat a challenge 指南 的流程下先以--attempts 3复现不稳定现象再针对查询构造与结果聚合两个环节定位失败原因——这也正是文档中“hardest part”所指向的工程问题。【免费下载链接】AutoGPTAutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mission is to provide the tools, so that you can focus on what matters.项目地址: https://gitcode.com/GitHub_Trending/au/AutoGPT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表