ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

百度LLM二面:Agent Skill怎么写?

百度LLM二面:Agent Skill怎么写? Anthropic 内部认为这是一个成熟 Skill 里最有价值的部分——记录模型在真实使用中踩过的坑。“扫描版 PDF 会静默返回空数组要先检查页面类型”“这个命令在 macOS 正常但 Linux 会失败”。前两天一个学员面完百度智能体平台组回来跟我说面试官最后追了一个问题“假设你现在要给 Agent 系统写一套 Skill你会怎么保证这些 Skill 的质量”他说当时脑子里全是 Prompt 技巧答完自己都觉得浅了。确实这题的坑就在这儿——它表面问的是“怎么写”实际考的是你能不能把 Skill 当成一个有生命周期的工程制品来对待而不是一次性的提示词。我们来看怎么把这题答出层次感。首先你得让面试官知道你理解 Skill 在 Agent 系统里的定位。Skill 不是一段随便写的 Prompt它是 Agent 可以按需调用的、标准化的、可复用的能力模块。你可以把它理解为 Agent 的“函数”——有明确的输入输出契约有单一职责有异常处理能被不同的 Agent 在不同场景下反复调用。这个定位一旦说清楚面试官就知道你不是在聊 Prompt Engineering 的皮毛而是在聊系统工程。好接下来我们进入核心怎么写好一个 Skill。我把它归纳为五个关键维度1.第一个维度叫“描述即选择信号”这是很多人忽略的点。Agent 在运行时面对几十个 Skill它怎么决定调用哪一个靠的就是 Skill 的 description 字段。这个字段不是给人看的摘要而是给模型看的触发条件。Anthropic 内部的经验是description 要写得“稍微 pushy 一点”因为模型天然有 under-trigger 的倾向。你不仅要写这个 Skill 做什么还要写什么场景下必须触发它甚至要加排除条件——“不要用于博客文章、邮件、长文写作”。正向触发加反向排除两者缺一不可。这就像你写一个 API 的路由匹配规则匹配条件和排除条件都得精确。2.第二个维度叫“自由度梯度控制”这是 Anthropic 官方最佳实践里反复强调的核心概念。不同任务对指令的约束程度应该不同。开放性任务比如代码审查多条路径都能走通你给高自由度用自然语言描述方向就行。中等自由度的场景比如部署流程你给伪代码级别的步骤指引。而高风险操作比如数据库迁移你必须给精确的脚本一个字都不能改。很多人写 Skill 犯的错误是一刀切——要么全是 MUST/NEVER 的大写命令把模型锁死要么全是模糊的“请酌情处理”。高质量 Skill 一定是根据每个步骤的脆弱程度来动态调节约束力度的。3.第三个维度叫“渐进式上下文加载”Skill 和对话历史、系统提示词共享同一个上下文窗口每一个 token 都是稀缺资源。成熟的做法是把 SKILL.md 当作目录核心内容控制在五百行以内详细的 API 参考、示例、边界 case 放在子文件里模型需要时再按需读取。这就是 Progressive Disclosure——不要一次性把所有信息塞进去而是建立一个浅层的引用图让模型自己判断什么时候需要深入。Anthropic 工程师的原话是如果你的 SKILL.md 超过三百行就该拆了。4.第四个维度叫“解释 Why 而非堆砌 Rule”这一点特别重要。写“MUST use constructor injection, NEVER use field injection”不如写“Use constructor injection. Field injection breaks testability because we cannot mock the field without Spring context.”当你给了原因模型就能泛化到你没预料到的边界情况。纯规则只能覆盖你想到的场景而带推理依据的指令能让模型在未知场景下做出合理判断。当然对于真正高危的操作步骤裸命令式指令仍然是对的这里的关键是区分“需要判断力的步骤”和“零容错的步骤”。5.第五个维度叫“可验证的工作流控制”高质量 Skill 不是写完指令就完事了它要内建质量闭环。具体来说有两个模式值得提一是 Self-Correcting Loop生成输出后跑一个验证脚本不通过就修正重来直到通过为止当然要设重试上限。二是 Plan-Validate-Execute对于批量或破坏性操作先让模型生成一个 JSON 计划用脚本验证计划的合法性验证通过了再真正执行。这两个模式的核心思想是一样的把确定性的校验逻辑从模型的推理中剥离出来交给代码去做。6.最后补一个加分点Skill 的 Gotchas SectionAnthropic 内部认为这是一个成熟 Skill 里最有价值的部分——记录模型在真实使用中踩过的坑。“扫描版 PDF 会静默返回空数组要先检查页面类型”“这个命令在 macOS 正常但 Linux 会失败”。这些都是迭代出来的经验不是一次性能设计好的。所以高质量 Skill 一定是活的它有版本管理有持续的观察-修正-测试循环。总结一下答题框架先定位 Skill 是什么再从描述字段的触发设计、自由度梯度控制、渐进式上下文管理、解释 Why 的指令风格、可验证的工作流闭环这五个维度展开最后用 Gotchas 的持续迭代收尾。这样答下来既有架构视角又有工程细节面试官会觉得你是真干过这事的人。最后我们整理出这套 AI 大模型 突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2025 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要 《 AI大模型 入门进阶学习资源包》下方扫码获取~资料展示下面是我整理的AI大模型学习资料和工具包预览适合收藏后按主题逐步学习。需要这份AI大模型资料清单的话在评论区回复「清单」即可我会根据大家的问题继续补充对应的实战内容。
返回列表