
文章目录前言一、Jev 是个啥一句话给你整明白二、这名儿谁起的背后有点东西1. 双系统理论快的归它慢的归推理模型1System 1不假思索的秒答2System 2慢慢盘逻辑的深思2. 杰文斯悖论越省用得越多三、跟 ChatGPT、Cursor、Claude Code 有啥不一样四、三大原语Choice / Score / Noul1. Choice从名单里挑一个2. Score按刻度打分3. Noul这句话是真是假五、上代码一次真实调用长这样1. 返回的就是结构化 JSON2. 答案被锁死在你的选项里3. 三个问题一次全答完六、凭啥又快又便宜架构上就不是一路人1. 并行采样不一个字一个字憋2. 压根不生成文本输出白送3. 训练用的是 RLCD不是 RLHF七、大家都在拿它整什么活八、Vercel 官方模板AI 当表单接线员九、社区总结的四个套路1. 每 tick 一个决策2. 置信度当门卫3. 代码先把选择空间砍小4. Jev 拍板LLM 说话十、泼几盆冷水这些坑你得知道1. 只认文本2. 预算有上限3. 不能生成文本4. 太新了5. 校准不等于单次正确十一、我的结论值得围观别急着梭哈P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。前言先跟你说句实话我第一次看到这条新闻时第一反应是哪个营销号又整活了一个 AI 模型不写代码、不写文案只做一件事帮你的程序做判断。我当时就一个念头就这这不就是个 if 语句吗然后我顺手查了下它的背景好家伙4000 万美元种子轮2026 年 9 月 15 日从隐身状态高调亮相旧金山 TypeSafe AI 出品。能把做个判断讲成一个 4000 万美元的故事这背后肯定有事。一、Jev 是个啥一句话给你整明白Jev 说白了就是一个智能版 if 语句。普通 if 长这样if (order.total 100)。条件是个数字计算机说算就算干净利落。可要是条件变成判断呢比如这条客服消息是不是在生气这封邮件是不是账单这一排按钮里用户该点哪个才能顺利付钱以前碰见这种问题路子就三条。手写规则脆得跟薯片似的规则一多就碎。训练分类器先攒一堆标注数据攒过的人都知道那有多痛苦。让大模型返回结构化输出慢、贵还时不时给你幻觉一下让你在生产的边缘反复试探。Jev 给的第四条路你定义好可能的答案它把每个答案的概率分布丢给你你的代码拿到手直接分支。不生成文本、不用解析、不会幻觉。这三个词放一起我仿佛已经听到后端老哥们的欢呼声了。相当于你招了个只会说选这个的下属工资还不到一杯奶茶钱。二、这名儿谁起的背后有点东西一个模型叫 Jev我第一反应是哪位网红的英文名。结果人家致敬的是经济学家威廉·斯坦利·杰文斯逼格瞬间就上来了。1. 双系统理论快的归它慢的归推理模型卡尼曼那套双系统的说法你应该多少听过。1System 1不假思索的秒答凭直觉快不用过脑子。判断这人是敌是友基本就属于这一类。2System 2慢慢盘逻辑的深思慢烧脑得一步一步推理。TypeSafe 的分工很明确Jev 专干 System 1 的活深度推理交给推理模型。翻译成人话Jev 负责这单接不接推理模型负责这单怎么谈。2. 杰文斯悖论越省用得越多杰文斯当年发现一个反直觉的现象蒸汽机效率提高了煤不但没少烧反而越烧越多。为啥因为便宜了新用途全冒出来了大家可劲儿造。TypeSafe 的押注就是智能也吃这一套。当一次决策的成本低到一美分以下你就想把决策塞进那些以前根本不敢碰 AI 的地方。我琢磨了一下这句话翻译过来就是以后连你家的猫粮自动喂食器都敢宣称自己接入了大模型。三、跟 ChatGPT、Cursor、Claude Code 有啥不一样现在市面上的 AI 工具一个比一个话痨。ChatGPT 你问一句它回你三篇小作文Cursor 撸起袖子就给你改文件Claude Code 更狠直接接管你的终端。Jev 完全不是这个路数。它不接受开放式目标不调工具不碰文件不跑什么 agent 循环。你问什么它答什么多一个字都算它输。工具你给它它还你角色ChatGPT提示词、对话生成的回复通用话痨Cursor编程任务加仓库改文件、跑命令、写测试编辑器加编程助理Claude Code指令加本地工具调工具、改代码、终端结果终端编程助理Jev状态加类型化问题选择、评分、概率代码里的决策原语最妙的是它跟这些工具不是竞争关系而是嵌进去的关系。编程 agent 跑命令之前可以先问 Jev这条命令是只读的、可逆的还是破坏性的再决定动不动手agent 路由器也能拿 Jev 决定这单活派给谁。你品品这哪儿是 AI这分明是给 agent 配了个踩刹车的老司机。四、三大原语Choice / Score / NoulTypeSafe 给 Jev 设计了三种问法官方叫原语。什么叫原语就是那种结构固定、可以随便拼装、怎么组合都不打架的积木。1. Choice从名单里挑一个你给一堆选项它告诉你选中了哪个、每个选项的概率、以及它自己的置信度。路由、agent、游戏都靠它吃饭。最爽的是答案空间永远合法。它不可能发明出第四个选项比我见过的某些智能客服强多了人家好歹不会突然回你一句亲我不太明白您的意思呢。2. Score按刻度打分你定义一套等级比如 trivial、normal、critical。它返回打到哪一档、每档的概率和置信度。相当于把这个 bug 严重不严重这种主观题变成了有标准答案的客观题。3. Noul这句话是真是假你抛一个陈述它返回这句话为真的概率0 到 1 之间的一个浮点数。审核、验证、护栏全用得上。比如“这个 diff 真的把 bug 修好了吗”女朋友跟你说我没事的时候你也可以拿它验一下。要是返回 0.02兄弟今晚大概率睡沙发。别问我怎么知道的问就是我朋友的故事。三种问法还能混在同一个请求里互相独立、并行评估。五、上代码一次真实调用长这样官方给了一个特别接地气的例子赞助表单。有人提交了申请你要判断这单是走自动发报价单还是排队等人工。请求长这样{model:jev-latest,state:{opportunity:link,name:Managed Postgres,description:We make a managed PostgreSQL hosting product and would like to sponsor the newsletter in October.},questions:{is_sponsor_inquiry:{type:noul,instructions:Does description ask to sponsor the site or newsletter?},product_category:{type:choice,instructions:What kind of product is described by name and description?,criteria:{dev_tool:Developer tools, hosting, APIs, SaaS for developers,course:Courses, books, or training,unrelated:Anything not aimed at developers}},message_quality:{type:score,instructions:How specific is the request?,criteria:[Generic template, no reference to this site,Mentions the site but no concrete ask,Concrete ask with a timeframe or product named]}}}Jev 的响应长这样{model:jev-1.13.0,answers:{is_sponsor_inquiry:{type:noul,noul:0.99},product_category:{type:choice,choice:dev_tool,probabilities:{dev_tool:0.97,course:0.01,unrelated:0.02},confidence:0.95},message_quality:{type:score,score:1.9,legend:{0:Generic template, no reference to this site,1:Mentions the site but no concrete ask,2:Concrete ask with a timeframe or product named},probabilities:{0:0.0,1:0.1,2:0.9},confidence:0.86}},usage:{input_tokens:210,output_tokens:31}}拿到结果以后你的代码负责干无聊的活const{answers}response;if(answers.is_sponsor_inquiry.noul0.9answers.product_category.choicedev_tool){sendRateCard(email);}else{queueForManualReply(email);}概率超过 0.9、分类又是开发工具直接甩报价单否则排队等人工。整个过程没有一个字需要解析。三个细节值得单独说1. 返回的就是结构化 JSON不用解析散文省得你写正则写到怀疑人生。2. 答案被锁死在你的选项里dev_tool、course、unrelated 三选一它想发明第四类门都没有。3. 三个问题一次全答完你再加第四个问题响应时间几乎不带变的。一次调用把这人是不是想白嫖“他是不是个正常人”这单该不该认真回全问完了。六、凭啥又快又便宜架构上就不是一路人Jev 的快和省不是靠优化挤出来的是架构上就跟大模型不是一路人。1. 并行采样不一个字一个字憋大模型生成答案是一个 token 一个 token 往外蹦的后一个字得等前一个字。Jev 直接并行采样所有答案每个问题独立评估输出就是你给的选项上的一个概率分布。别人是想一句说一句它是一口气把所有可能性的概率全吐出来。最快 70 毫秒什么概念你眨一下眼要 300 毫秒。你还没眨完眼它答案都交卷了。2. 压根不生成文本输出白送就算你逼大模型输出 JSON它本质上还是在生成字符串。Jev 从不生成自由格式的字符串输出就那么一丁点结构化数据几乎没什么可计费的。输出免费是什么概念就是它干活不要钱你只付它听你说话的钱。这收费模式跟我认识的一位朋友请客只付自己那份有异曲同工之妙。3. 训练用的是 RLCD不是 RLHF聊天模型用 RLHF奖励人类喜欢的答案Jev 用 RLCD全称 Reinforcement Learning for Calibrated Decisions直接优化概率跟实际结果对得上。什么叫校准就是它说 90% 的概率你统计下来它大概真有 90% 是对的。指标Jev前沿大模型端到端延迟70 到 500 毫秒3 到 329 秒输入价格0.042 美元/百万 token0.2 到 10 美元/百万 token输出价格免费0.6 到 30 美元/百万 token答案形状错误率0%结构性保证有生成可能中断训练方法RLCD校准决策RLHF人类偏好官方给出的对比数字是快 193.6 倍、便宜 444.6 倍。不过公司自己也承认这是在自己工作流里评估出来的高端天花板不是平均成绩。你看连官方都学会先打预防针了比某些遥遥领先的广告实在多了。七、大家都在拿它整什么活开放早期访问没几天JevMade 社区注册表里已经收了 745 个验证过的实验来自 651 位开发者。这个速度说明程序员们是真的憋坏了。745 个实验那可都是有人真把代码跑起来验证过的不是 PPT 里的饼。方向在干啥浏览器控制让 Claude 通过 Jev 驱动 ChromeJev 决定点哪个按钮游戏 AI五子棋225 个落点先砍到约 40 个Jev 做最终判断无人机控制序列化状态、问一个问题、执行、重复交易机器人每 tick 做一个决策延迟低到循环像开了挂SEO 工具关键词研究、搜索意图分析Git 审计审 git diff判断变更类型和风险表单路由按表单内容自动转给对应团队安全检查pkg-gate查 npm 包安不安全五子棋那个最逗225 个落点先被代码砍到约 40 个Jev 最后拍板。这不就是职场标准流程吗下面的人先筛一轮领导负责点头。交易机器人每 tick 问一次 Jev延迟低到整个循环像开了挂。说实话比我盯盘敬业多了。毕竟我盯盘盯久了容易上头它不会。八、Vercel 官方模板AI 当表单接线员Vercel 直接出了官方模板把 Jev 和 AI SDK 接起来专门做表单路由。三个表单按内容自动分流Lead 表单去初创/增长/企业/销售团队Contact 表单去账单/客服/通用Issue 表单去前端/平台/基础设施/工程团队。你猜猜这活以前谁干是那个被转发进 20 个群、到现在还没人回消息的运维同事。流程长这样先用 Zod 验证提交数据的字段。Jev 用 AI SDK 的 experimental_evaluate 评估整份提交选一个合法的团队加专业组合。置信度达到 95% 及以上应用直接认 Jev 的选择。低于 95%、缺失、无效或者 Jev 自己拉了就交给 openai/gpt-5.6-luna-fast 独立评估同一份提交。结果里带上目的地、决策模型、Jev 统计信息、模型耗时和邮件预览。注意第 4 条AI 也会心虚心虚的时候知道找更贵的模型兜底。这设计太人性了建议写进公司制度拿不准的事上报。# 克隆模板gitclone https://github.com/vercel-labs/jev-ai-sdk-form-router.gitcdjev-ai-sdk-form-router# 安装依赖pnpminstall# 配置环境变量cp.env.example .env.local# 需要设置 AI_GATEWAY_API_KEY# 启动pnpmdev# 打开 localhost:3000技术栈Next.js 16 React 19、AI SDK 7 Vercel AI Gateway、shadcn/ui Tailwind CSS 4、React Email Resend。看完我只想说现在的官方模板比我当年入职第一天的项目还现代。九、社区总结的四个套路JevMade 从 745 个实验里总结出四个反复出现的模式我看完直呼内行。1. 每 tick 一个决策游戏、无人机、交易机器人、浏览器 agent最后都收敛到同一个循环序列化状态问一个决定性问题执行重复。Jev 的延迟低到模型可以直接住在控制循环里头。以前是你问 AIAI 慢慢想现在是 AI 每帧都在帮你做决定相当于给程序装了个条件反射。2. 置信度当门卫答案告诉你做什么置信度告诉你要不要动手。最稳的实验都会用置信度阈值把边缘情况丢给更慢的模型或者人工。翻译成人话AI 也学会了没把握的事先请示领导这是职场成熟的表现。3. 代码先把选择空间砍小开发者很少让 Jev 从所有选项里硬选。五子棋先砍到 40 个落点DOM 过滤器先把页面变成元素表。代码负责缩小范围Jev 负责在剩下的里面做判断。脏活累活归代码拍板归模型各司其职谁也不委屈。4. Jev 拍板LLM 说话反复出现的分工是Jev 让每个决策又便宜又即时小号 LLM 只在需要给人看的字符串时才出场。决策归决策说话归说话两边分开算账谁也不占谁便宜。十、泼几盆冷水这些坑你得知道夸完了该泼冷水了。Jev 的局限一条比一条清醒。以下内容建议先截图免得被零幻觉三个字冲昏头脑。1. 只认文本状态只能是字符串、JSON 对象或者 JSON 数组。图片、音频、视频抱歉暂时不伺候。2. 预算有上限状态和所有问题共享大约 64000 token 的预算状态加最长的问题要控制在约 32000 token 以内。Choice 最多 255 个选项Score 只能在 2 到 10 个等级之间。翻译过来就是它胃口有限你别拿一整本《红楼梦》去问它这人是谁。3. 不能生成文本不能写回复、不能生成代码、不能总结文档、不能解释推理。你要文本还是得请 LLM 出山。说白了它就是个点头摇头的机器你想让它写小作文它只会回你“这不是我的专业。”4. 太新了2026 年 9 月 15 日才开放早期访问生态、最佳实践、长期稳定性都还在验证期。第一批吃螃蟹的人可能正在边吃边吐壳。5. 校准不等于单次正确校准是统计意义上的给 90% 概率的预测多次统计下来大约 90% 对。但任何单次预测都可能错。翻译成人话它说稳了的时候你最好还是自己再看一眼。毕竟它不知道你的生产环境有多爱出幺蛾子。十一、我的结论值得围观别急着梭哈先把它核心的卖点捋一遍新品类不是更好的大模型是另一条赛道决策原语极致便宜0.042 美元/百万输入 token输出免费比大模型便宜 5 到 240 倍极致快70 到 500 毫秒端到端能塞进控制循环零幻觉答案被结构性锁死在你给的选项里想越界都难概率校准RLCD 训出来的分布跟实际结果对得上组合友好Jev 拍板LLM 说话各干各的我的判断就一句值得关注但别急着 all in。一方面决策模型确实踩中了真痛点。大量场景要的压根不是生成能力是一句靠谱的判断。拿大模型做分类又慢又贵还怕幻觉Jev 直接把这道题解了。另一方面它才发布一周。生态、文档、最佳实践都还在襁褓里TypeSafe 自己都承认官方数字是高端天花板不是实际平均值。但有一条趋势是确定的当一次决策的成本趋近于零你会把决策放到那些你以前想都不会想到 AI 的地方。这才是杰文斯悖论真正的意思也是 Jev 这名字想说的。所以我的态度就八个字技术值得研究钱包先按兵不动。毕竟 AI 不一定要当主角它可以是代码里一个 70 毫秒就返回的 if 语句不聊天、不写诗就默默在后台点头摇头。这画面想想还挺像公司里那些只回收到的同事。你觉得他啥也没干但系统真离不开他。P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。