ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AI Agent 工程实践(46):模型换了,Agent 为什么突然变笨

AI Agent 工程实践(46):模型换了,Agent 为什么突然变笨 发布时间2026-09-23标签AI Agent工程实践模型实验Model Evaluation上一篇我说版本七维里最容易翻车的是 Model。有人不服换个更强的模型怎么可能变差于是我做了个实验——把同一个 Agent、同一套工具、同一个数据集分别跑在三个模型上。结果出乎所有人意料最贵的那个模型不是最好的那个而更强的模型在选工具这件事上反而更差。这一篇我把这个实验完整做给你看。系列导航上一篇AI Agent 工程实践45Agent 的版本控制到底控制什么下一篇AI Agent 工程实践47什么时候应该从 Agent 改回 Workflow问题背景这是第五阶段的第十一篇。上一篇建立了七维版本模型这一篇单独拎出其中最玄的一维——Model——做一次受控实验。动机很朴素我们在第 45 篇说过同一模型名的 API 背后厂商会静默更新快照导致 Agent突然变笨。但模型影响到底有多大它影响的是哪方面更强的模型就一定更好吗这些问题光靠感觉答不了只能靠实验。错误尝试迷信更强 更好我最开始的假设很天真换更强的模型Agent 一定会变强。于是我把 Repo Doctor 从 deepseek-chat 换到一个更大的模型心想这下能力该涨了吧。结果跑完数据集一看Success Rate 不升反降。我第一反应是数据集错了代码有 bug。排查了一圈代码没动、数据没动唯一变的就是模型。这时我才被迫面对一个事实Agent 的能力不等于模型的能力。模型只是七维里的一维而模型强和Agent 强之间隔着一整套工具、Prompt、Context 的配合。一个在裸聊天里更强的模型放到 Agent 场景里未必更会选工具、更守规矩。关键观察模型是乘数不是全部我把三个模型代号 A、B、C一个便宜、一个中档、一个大模型跑同一份 eval 数据集得到这张对比表指标模型 A便宜模型 B中档模型 C大模型Success Rate68%78%71%Tool Accuracy82%79%70%Answer Accuracy65%75%72%Latency (avg)5.1s7.8s12.4sCost (avg tokens)180032006100看这张表有三个反直觉的发现最贵的 CSuccess Rate 不是最高的。中档的 B 才是。最大的 CTool Accuracy 反而最低70%。它更爱自由发挥常常不按工具描述来甚至自己编一个工具。模型 A 虽便宜但 Tool Accuracy 最高82%。它听话但推理深度不够Answer Accuracy 拉胯。核心洞察Agent 能力 Model Prompt Context Tools Rules Memory Runtime 的合力模型只是其中一个乘数。这个合力公式正是这个系列前四阶段所有组件的一次总回收——它们不是孤立的零件而是共同决定 Agent 上限的乘数。最终方案把模型纳入实验而非信仰实验的产出不是哪个模型最好而是一套把模型当变量、可量化比较的方法选型结论对 Repo Doctor 来说模型 B中档是当前最优解——综合成功率最高成本适中。而上最大的模型这个直觉被数据证伪了。代码或配置示例模型实验的核心是同一套代码只换模型的受控对比。关键是隔离变量# repo_doctor/experiments/model_ab.py —— 只换模型其余七维全部锁定 def run_model_experiment(models, eval_dataset): results {} for model in models: # 关键Prompt / Rules / Tools / Knowledge / Dataset 全部用同一份 agent build_agent( modelmodel, # 唯一变量 promptPROMPT_V12, # 锁定 rulesRULES_V7, # 锁定 toolsTOOLS_V4, # 锁定 knowledgeKNOWLEDGE_V2, ) metrics run_eval(agent, eval_dataset) # 同一把尺子 results[model.name] metrics print(f{model.name}: {metrics}) return results # 三个模型跑同一数据集 run_model_experiment( models[Model(A, deepseek-chat), Model(B, mid-tier-model), Model(C, large-model)], eval_datasetload_eval(eval/), )这个实验脚本的精髓就一句除了 model其他六个维度全部锁死。否则你根本分不清分数变化是模型带来的还是 Prompt 或工具漂移带来的。这也正是第 45 篇 agent.lock 的用武之地。设计权衡候选方案优点缺点为什么不选迷信更强 更好直接换大模型省事成本高、可能更差被数据证伪哪个火用哪个跟风和你的任务脱节别人的结论不适用于你受控模型实验可量化、贴合任务需先有 eval 数据集用数据选型而非信仰一个重要的边界提醒模型实验的结论有时效性。模型 A/B/C 的表现会因为厂商更新快照而改变。所以这不是一锤定音而是一个要定期重跑的流程。这也是为什么第 45 篇强调模型要钉快照——不钉你的实验结论就是空中楼阁。总结✅ 换更强模型的直觉被受控实验证伪了。✅ 三个模型跑同一数据集最贵的不是最好的最大的 Tool Accuracy 反而最低。✅ Agent 能力 Model Prompt Context Tools Rules Memory Runtime 的合力。✅ 模型实验的精髓只换模型其余六维全部锁死。✅ 铁律换模型不是升级是重新做一次验收——因为 Agent 的能力从来不属于某一个模型。参考资料Anthropic《Building Effective Agents》中模型选型的讨论 → 为什么引用印证了Agent 能力是合力模型只是乘数。LMSys / 各类模型排行榜的方法论 → 为什么引用理解受控对比的实验设计是模型实验的基础。系列导航上一篇AI Agent 工程实践45Agent 的版本控制到底控制什么下一篇AI Agent 工程实践47什么时候应该从 Agent 改回 Workflow本文是 [AI Agent 工程实践] 系列的第 46 篇。
返回列表