ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

给Codex外挂Jev判断模型,Agent从此学会先请示再干活

给Codex外挂Jev判断模型,Agent从此学会先请示再干活 文章目录1. Jev 是个啥2. 装进 Codex三步走2.1 第一步把提示词甩给 Codex2.2 第二步注册拿 API Key2.3 第三步设置环境变量3. 实战让 Codex 学会请示3.1 这段提示词干了三件事3.2 Jev 到底怎么回的4. 灵魂拷问这活大模型也能干啊5. Jev 的三种决策方式5.1 Noul是还是不是5.2 Choice选一个5.3 Score打个分6. 名字的由来和一群复刻怪7. 最后说点掏心窝子的P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。最近干了一件特别像给自行车装火箭的事给 Codex 装了个叫Jev的判断模型。装完就一个感受——这玩意儿早该出了。1. Jev 是个啥先用人话解释。你玩过那种选择题吗给你四个选项让你选一个。Jev 干的就是这事你把当前状态 几个候选答案喂给它它告诉你选哪个还附送一个置信度比如选 B我有 99% 的把握。对就这么简单。简单到我一度怀疑它是来骗我 API Key 的。结果不是它是真干活。打个比方。以前让大模型做判断就像让米其林主厨来给你剥蒜——能剥剥得还挺好就是结账的时候你想报警。Jev 就是那个专门剥蒜的便宜、飞快、还不跟你废话。2. 装进 Codex三步走装它不需要写代码需要的是说代码。2.1 第一步把提示词甩给 Codex复制下面这段发给 Codex 就行Claude Code 和 PI 也都这么装命令都在提示词里了安装 TypeSafe 技能。如果你在 Claude Code 中请运行 claude plugin marketplace add typesafe-ai/skills然后运行 claude plugin install typesafetypesafe-ai。如果你在其他 Coding Agent 中请运行 npx skills add typesafe-ai/skills --skill typesafe-ai 并选择你的 Coding Agent。请使用其中一种安装方式。你可以直接阅读该技能的说明文档https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md。之后在开发此项目时即可使用 TypeSafe 技能。对就这么一段话Codex 自己跑去装了35 秒搞定。你让它装个依赖它能磨叽十分钟让它装技能它倒是挺积极。我怀疑它上辈子是装宽带师傅。装完之后从下一轮对话开始Codex 只要遇到判断、分类、路由、抽取、排序、验证这类活就会自动用上 TypeSafe Skill。比某些同事记性都好至少不用你在群里艾特它三遍。2.2 第二步注册拿 API Key去 TypeSafe AI 官网注册就行我花了大概两分钟。两分钟。比我注册健身卡还快而且注册完不会有人天天打电话让我去体验私教课。2.3 第三步设置环境变量在终端里跑一行export TYPESAFE_API_KEY你的 API Key想持久化的话把这一行加到.zshrc或者.bashrc里。不然你重启终端Key 就没了。比你对象生气时说的没事消失得还快。3. 实战让 Codex 学会请示光装不用是耍流氓。上真家伙。我设计了个场景用户问帮我分析今天英伟达股价为什么上涨但 Codex 不能自己拍脑袋决定干啥必须请示 Jev。3.1 这段提示词干了三件事使用 typesafe-ai Skill。这次任务的下一步动作必须由 Jev 决定。请实际调用 Jev API不要只进行文字分析。 state { userRequest: 帮我分析今天英伟达股价为什么上涨, knownFacts: [], availableTools: [直接回答, 联网搜索, 检查本地代码, 询问用户] } 问题为了可靠完成用户请求下一步应该采取哪个动作 候选项 - answer_directly已有稳定信息可以直接回答 - web_search依赖最新外部信息需要联网检索 - inspect_code需要检查本地项目文件 - ask_user缺少完成任务所必需的信息 - human_review风险较高或没有合适选项 执行规则 - 实际调用 Jev Choice。 - confidence ≥ 0.8 时Codex 执行 Jev 选择的动作。 - confidence lt; 0.8 时改为 human_review。 - 输出实际模型、Token 用量、完整概率和最终动作。 - 如果 Jev 调用失败停止并报告不允许 Codex 自行补充判断。第一把当前状态传给 Jev用户问了啥、已知啥、手里有哪些工具。第二给出 5 个候选动作每个都有明确定义。第三定规矩置信度到 0.8 才执行不到 0.8 就转人工。阈值自己调对准确性要求高的场景可以拉到 0.9 甚至 0.95。你品品这个设计。以前让 Agent 干活它是一边想一边干现在好了先问 Jev我该干啥Jev 说联网搜它才去搜。像一个怕老婆的程序员出门前先请示老婆我今晚能打游戏吗能置信度 0.99。那还等什么上号。对应的代码长这样官方 SDK 里的调用方式const client new TypeSafeClient(); const response await client.systemOne({ state: { userRequest: 帮我分析今天英伟达股价为什么上涨, knownFacts: [], availableTools: [直接回答, 联网搜索, 检查本地代码, 询问用户], }, questions: { nextAction: choice( 为了可靠完成用户请求下一步应该采取哪个动作, { answer_directly: 已有稳定信息可以直接回答, web_search: 依赖最新外部信息需要联网检索, inspect_code: 需要检查本地项目文件, ask_user: 缺少完成任务所必需的信息, human_review: 风险较高或没有合适选项, }, ), }, }); const answer response.answers.nextAction; const finalAction answer.confidence gt; 0.8 ? answer.choice : human_review;3.2 Jev 到底怎么回的我点开 Codex 的运行日志它真的发了个 HTTP 请求真调了 Jev 的 Choice API。Jev 回了这么个东西{ model: jev-1.13.0, usage: { input_tokens: 495, output_tokens: 63 }, choice: web_search, confidence: 0.99, probabilities: { human_review: 0, ask_user: 0.01, inspect_code: 0, web_search: 0.99, answer_directly: 0 }, finalAction: web_search }翻译一下web_search 的概率 0.99ask_user 0.01剩下三个直接归零。Jev 的态度非常明确这题必须联网搜别跟我扯别的。0.99 是个什么概念大概等于你对象说我没生气的可信度再乘个 1.1。然后 Codex 就真的乖乖去搜了搜了为什么今天英伟达股价涨。看到这里我悟了**判断交给 Jev执行交给 Codex各司其职。**以前是一个模型又当裁判又当运动员现在裁判终于专业了。4. 灵魂拷问这活大模型也能干啊肯定有人要问意图识别嘛我让大模型做不就行了干嘛多此一举能做真能做。但账要算清楚。TypeSafe 官方给的数据Jev 比同类 LLM 快 40 到 200 倍便宜 40 到 400 倍。输入价格 0.042 刀每百万 Token输出免费延迟 70 到 500 毫秒。注意最后四个字输出免费。建议全行业大模型公司把输出免费抄进 KPI 里。你让大模型做一个选 A 还是选 B的判断它给你输出三百字小作文最后说综上所述我建议选 A。兄弟我就想让你说个 A不是让你写毕业论文。Jev 的思路是把判断从大模型里单独拆出来做成一个轻量专用模型。它不需要理解整个世界只需要理解你给的 state 和候选项之间的关系。简单说大模型是全能选手Jev 是专项运动员。你让全能选手去跑百米能跑就是出场费太高。5. Jev 的三种决策方式Jev 支持三种决策类型基本覆盖了 Agent 开发里所有拿不定主意的场景。5.1 Noul是还是不是给一个是/否的概率0 到 1 之间。比如判断一条评论有没有恶意。0.95 以上基本实锤0.05 以下基本清白中间地带转人工——也就是把锅甩给真人审核非常合理的甩锅。再比如 Agent 准备调一个工具先让 Noul 过一道安检这次调用有没有风险有就拦没有就放行。5.2 Choice选一个从预定义的选项里选一个附带每个选项的概率。适合意图路由、工具选择、任务分发。比如客服 Agent 收到消息判断转技术支持、账单查询还是投诉处理——比某些大厂客服那个请按 1请按 2人工客服请按 9的智能菜单靠谱一百倍。按完九层菜单人工客服下班了。5.3 Score打个分0 到 1 打分。RAG 召回 20 个文档片段Jev 挨个打分0.9 高度相关0.3 勉强沾边。按分数排序取前几个喂给大模型生成回答。这招我熟当年大学期末划重点我就是这么给复习资料排序的。Score 还能做质量评估Agent 生成一段回答打个分分低的让它重写分高的直接交差。比某些领导再改改的反馈至少带个数值。三种还能组合先用 Choice 选工具再用 Noul 查安全工具返回结果后用 Score 打分分数低就重来。一套组合拳下来Agent 每一步都有据可查。6. 名字的由来和一群复刻怪Jev 这名字取自 19 世纪经济学家 William Stanley Jevons边际效用理论的提出者。意思是每一次判断都要追求最高的边际效用用最小的成本得到最准的结果。翻译成大白话花最少的钱办最准的事。这价值观建议所有乙方公司抄作业。甲方问这个方案多少钱乙方回保证最高边际效用甲方虽然听不懂但觉得很专业。现在社区里已经有人整理了 Jev 的案例库202 个案例原帖总浏览量 1 亿。判断模型这个赛道热得能煎鸡蛋。更离谱的是开源复刻已经卷起来了kevQwen3.5 LoRA最知名知名开发者 Jared Palmer 用 Devin 写的。模型写模型AI 套娃套娃还套得挺好。laya原生非自回归T4 显卡上每道题推理只要 7.2ms。快到什么程度比你手滑点错链接的反应还快。Open-Jev9B 版本一致率 97.54%本地接口中位延迟 85ms 左右对标 Jev 云端的 295ms。Nimble训练思路叫找不同把 Qwen 的决策一致率从 66.36% 拉到 90.12%逼近 Jev 官方的 93.21%。NanoJev0.6B 参数2GB 内存就能跑适配手机。2GB 内存比某些浏览器还省比某些聊天软件还省。Jev 这波属于是一个模型火了全村复刻。7. 最后说点掏心窝子的用认知科学的说法Jev 是 System 1直觉秒出答案大模型是 System 2深度推理。人做决定大部分时候靠直觉只有复杂问题才启动深度思考。Agent 也应该这样简单判断交给 Jev70 到 500 毫秒出结果真要推理、要写内容的复杂任务再让大模型慢慢想。我估计后面的大模型都会快速跟进这一块。毕竟判断模型做起来不难难的是有人先想到判断可以单独拆出来卖。最后吐槽一句现在的 GPT-6 Astra 太费 Token 了。以前一周的额度用不完现在三天就见底。Jev 至少能帮 Codex 省点额度——省下的 Token都是程序员续命的口粮。行今天就到这。我去给 Codex 装下一个外挂了。P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。
返回列表