
这个AI一行代码都不会写却让14万程序员上头Jev保姆级实战附API代码你有没有经历过这种绝望——你只想让大模型判断一封邮件“急不急”回个“是”或“否”就完事了。结果它沉吟片刻洋洋洒洒输出三百字小作文“尊敬的用户经过我深思熟虑从邮件措辞、语气、时间戳以及情绪倾向等多个维度综合分析我认为……”等它说完黄花菜都凉了token 账单还挺感人。更要命的是你还得写正则、写解析从这三百字里把“是”或“否”抠出来代码才能继续跑。9 月中旬一个“叛逆”模型把这套流程掀了它不聊天、不写代码、不写文案主打一个闭嘴干活上线 36 小时就有 14 万开发者蜂拥而入。它就是 Jev。这篇文章带你从“它是谁”一路打到“API 怎么调”该泼的冷水也一并泼了。建议先收藏周末慢慢搓。一、Jev 是何方神圣先上户口本2026 年 9 月 15 日旧金山公司 TypeSafe AI 发布 Jev开放早期内测创始人 Diogo Almeida 在 OpenAI 待了四年是 RLHF、InstructGPT、ChatGPT、GPT-4 的核心参与者GPT-4 贡献者名单里他挂在“基础 RLHF 与 InstructGPT 工作”那一栏公司隐身研发两年露面就带着 DCVC 领投的 4000 万美元种子轮约 2.8 亿人民币据 Forbes 报道这一轮估值约 2 亿美元约 14 亿人民币Jev 被定位为 TypeSafe 的第一个 System One Model口号相当拽“Decisions, not strings”——要决策不要文本名字 Jev 取自 19 世纪经济学家杰文斯Jevons暗合著名的“杰文斯悖论”。再看战绩相当离谱36 小时内 14 万开发者涌入内测官方接口直接被挤到无法调用上线 24 小时就拿下 Vercel AI Gateway 近 13% 的付费团队成为该平台史上采用最快的新模型Vercel、Cloudflare、LangChain 几天内全部完成集成9 月 21 日公司干脆撤掉候补名单全面开放注册即送 5 美元额度折合约 1.2 亿 tokenAlmeida 称日调用量已超过万亿 token连深夜都在持续跑——这说明是程序在后台无人值守地用而不是人类点两下尝个鲜。二、为什么它能这么快、这么便宜得先搞清楚传统大模型慢在哪。GPT、Claude 都是自回归模型一个 token 接一个 token 往外蹦前一个 token 没算完后一个就没法开始整条解码链是串行的。哪怕你只要一个“是”字它也得把完整流程跑完。Jev 的思路官方文档、开源复现和社区实验三方口径基本一致就四步答案空间在调用前就枚举好——你给的选项、档位或是非题不生成任何文本而是把每个候选答案拿去“打分”读取模型对这段候选文本的概率所有候选在一次前向计算里并行打分互不等待归一化后概率最高的就是答案。一句话总结它省掉的不是“模型大小”而是“解码步数”。训练侧还有个新方法叫 RLCDReinforcement Learning for Calibrated Decisions校准决策强化学习模型说 0.9现实中就得有约九成命中率奖励的是“概率和实际命中率咬合”。这和 RLHF奖励人类看着爽、RLVR奖励可验证正确性是三个不同的靶子。小提示2023 年有篇同名缩写 RLCD 的论文对比蒸馏方向和这个完全不是一回事写引用时别撞车。至于底层架构官方至今没公开论文和权重。社区逆向更倾向于“双向编码器 并行标签头”TypeSafe 的 GitHub 组织还 fork 过扩散语言模型 LLaDA 的仓库被当成技术谱系线索——但这些都还是推测不是实锤。三、它只会做三种题Choice、Score、Noul类型用来干啥返回内容Choice从最多 255 个选项里选一个choice、probabilities、confidenceScore在 2-10 个有序档位上评分连续 score、probabilities、confidenceNoul是非判断bernoulli 的缩写0-1 概率值不带 confidence1. Choice选择题{ type: choice, instructions: 哪个团队应该处理这张工单, criteria: { billing: 扣款、发票和退款, technical: 故障、宕机和集成, sales: 价格、升级和新账户, other: 以上均不适用 } }返回里 probabilities 是完整概率分布choice 是最高概率项confidence 描述分布有多集中。如果选项不一定覆盖所有情况记得主动加一个 “other”。2. Score评分题{ type: score, instructions: 客户有多沮丧, criteria: [ 平静只是在陈述事实, 沮丧但仍然礼貌, 非常愤怒使用强烈措辞 ] }返回的 score 可能是 1.05 这种小数——它是各档位概率的加权结果不一定是整数。3. Noul判断题{ type: noul, instructions: 客户是否明确要求退款 }返回一个 0-1 的值比如 0.72代表模型对“是”的概率判断。更爽的是多个问题共享同一份 state独立并行评估。官方数据是 13 个问题合成一次调用比拆成 13 次单独调用便宜 11.5 倍、快 9.6 倍加问题几乎不增加延迟只多一点输入 token。四、API 实战从注册到跑通四步上手。第 1 步注册账号。打开官方控制台 console.typesafe.ai 注册。注意官方服务目前暂未向中国大陆地区开放网络环境自行解决。第 2 步创建 API Key。在 console.typesafe.ai/keys 页面创建一个 key妥善保存。第 3 步配置环境变量。$env:TYPESAFE_API_KEY你的API_KEYexport TYPESAFE_API_KEY你的API_KEY第 4 步发请求。核心接口就一个POST /v1/systemone。下面是可直接跑的 Python 版本import os import requests resp requests.post( https://api.typesafe.ai/v1/systemone, headers{Authorization: fBearer {os.environ[TYPESAFE_API_KEY]}}, json{ model: jev-latest, state: 用户连续多次登录失败来源 IP 与历史登录位置不同并伴随大量失败请求, questions: { security_risk: { type: noul, instructions: 这个请求是否存在明显的安全风险 } } } ) print(resp.json())返回的是结构化 JSON示例{ model: jev-1.13.0, answers: { security_risk: { type: noul, noul: 0.96 } }, usage: { input_tokens: 311, output_tokens: 22 } }程序拿到 0.96 后按阈值决定走向整个过程不需要任何人读那段描述risk resp.json()[answers][security_risk][noul] if risk 0.9: trigger_security_flow() # 高风险直接拉安全流程 elif risk 0.6: queue_for_review() # 拿不准进复核 else: log_and_ignore() # 低风险记录后放行五、价格与规格一览项目数值输入价格0.042 美元 / 百万 token即 42 美元 / 10 亿 token输出价格永久免费官方原话便宜到根本不值得计费端到端延迟70ms - 500ms上下文单次请求 64K token其中 state 加最长问题 32K速率25 万 token/秒1200 请求/分钟输入类型仅文本字符串、JSON 对象或文本数组有网友实测百万输入 token 只要 0.042 美分赠送的 1.2 亿 token 根本造不完。这个定价被网友戏称为 AI 界的“蜜雪冰城”。六、大家都在用它干啥模型够不够通用看开发者给它整出的活就知道了打游戏官方演示让 Jev 实时玩初代《毁灭战士》每秒约 10 次决策控制走位、躲避和射击连跑一小时算力成本约 7 美元维基寻路在维基百科几千个超链里锁定目标页面单次候选上限高达 255 个审 PR一次调用约 7 万分之一美元1000 个 PR 才花 7 美分同样的活交给 Opus 5 要烧掉 14.5 美元语音助手有人给 Mac 糊了个语音助手“打开备忘录新建一条”话还没落音App 已经秒开浏览器自动化Browser Use 团队的开源项目 jev-ultrafastMIT12.1k star把网页元素编号成选择题Google 航班苏黎世飞伦敦全程 7.1 秒、花费 0.0039 美元浏览器协议调用中位数从约 1092 次降到 101 次密集决策对比实时通信公司 Ably 实测几分钟内 Jev 做了 47 次决策而 GPT、Claude、Gemini 只做了一两次国内场景有中文开发者把卡牌游戏的决策换成 Jev单次只要 0.7 秒出牌动画还没播完下一回合已经算完。这些场景共同点很明确决策要快、要密集但每个决策本身都不算难。七、国产平替与开源复刻Jev 发布后最戏剧性的一幕是它被“抄作业”的速度48 小时内 GitHub 上就冒出至少 6 个复刻项目Laya基于 ModernBERT-large421M加 PPO5 天拿下 1.8 万 starKev基于 Qwen3.5与 TypeSafe 官方 SDK 完全兼容业务代码不用改换个请求地址就能切到本地Bespoke NimbleQwen3.5-9B 上做 LoRA测试准确率 90.1%接近 Jev 官方自报的 93.2%中国 APUS9 月 19 日交出全球最早一批跨平台开源复现封装成开箱即用的 Agent Skill「fast-browser-use」MIT 协议。它用本地 Qwen3.5-9B 复现了单 token logits 快速决策、KV-Cache 广播与并发批量评估在一台 Apple M2 Pro 笔记本上维基百科检索中位耗时约 18 秒、表单填报和站内导航约 3 秒全程零云端调用、零 API 费用数据不出本机macOS / Linux / Windows 通吃没 GPU 也能跑。有意思的是阿里通义千问在这波复刻潮里意外当了一回“万能底座”。不过复刻也有短板面对任意提问加几十个长选项的场景眼下还得是官方 Jev 更稳。八、该泼的冷水这些数字得打折看先把最唬人的数字放一边。“快 193.6 倍、便宜 444.6 倍”来自官方自家 workflow 测试Jev 0.114 秒 / 0.000081 美元对比 LLM 8.566 秒 / 0.01388 美元没有经过独立实验室验证官方自己也标注这是偏乐观的上限。第三方独立测试Jev 的分类一致率和 DeepSeek V4.1 Flash 差不多中位延迟 0.32 秒约 3100 名用户实测聚合中位提速 7 倍、中位成本下降 30 倍、中位延迟 76 毫秒——比官方宣传低一个数量级但反而更可信在 TypeSafe 自己的评测页上Jev 综合得分 67.8% 排第四前面是 GPT-5.6 Sol 的 74.1% 和 Claude Opus 5 的 73.1%Redis 作者 antirez 在 9 月 21 日公开开炮Jev 或许有些狭窄应用场景但围绕它的炒作恰好说明 AI 泡沫里大多数人分不清什么重要、什么不重要。当然也有给它撑腰的硬数据LangChain 用 5 道天气题、每题 100 次共 500 次判断、以人工打分为真值Jev 的 500 次判断全部与人工一致GPT-5.6 Terra 99.8%、GPT-5.6 Luna 96.4%、Claude Sonnet 4.6 80%单例平均 0.44 秒、0.00035 美元而 Claude 完成同一任务要 28.17 美元CMU 的 JEV-as-a-Judge 论文在普通偏好和事实性任务上它与最强 LLM 裁判差距不超过 3 个百分点费用只有对方的 0.36%RewardBench 92.2% 对 93.5%HaluEval 87.5% 反超 86.7%。但需要检查推导过程的 JudgeBench 上落后 14.6 个百分点。九、“零幻觉”的真相以及那些坑划重点Jev 的“零幻觉”是格式保证不是内容保证。它在结构上不可能输出你选项之外的东西这是构造性的 0% 类型错误但照样能在你给的三个选项里选错。同理confidence 衡量的是概率分布集不集中不等于“这次回答的正确率被保证”。坑清单也给你列好了不能写文本、不能解释理由——金融、医疗、法律这类要求可追溯推理链的场景直接出局暂不支持图像输入需要一步步推导的数学推理顶多 GPT-4 水平步骤一多效果就往下掉非英语准确率参差不齐而且对措辞敏感官方承认它“按字面读指令”问题写得越绕一致率越低闭源 API数据要传到 TypeSafe 的服务器对部分企业客户是道门槛还有先发权争议开发者 Nandha Kishor M 称自己 2025 年 3 月就发过相关论文、模型和数据集。十、正确姿势级联而不是替换CMU 那篇论文给出了一个很实用的“冻结级联”策略高置信度的判断直接采纳、自动执行不确定的判断上抛给大模型或人工论文实测这套打法能保住最强裁判 99% 的准确率成本却只有零头。工程上再送四条铁律一个问题只问一个判断多因素判断拆成多个原子问题在代码里加权合成——以后调优先级改的是系数而不是提示词阈值按风险分层同一个系统里低风险动作 0.6 可放行高风险动作建议 0.85 以上高风险动作永远不能绕过身份认证、权限检查、业务硬规则、用户确认和审计上线前用自己的标注集回放分别测误放行、误拦截和人工队列占比别直接抄官方示例阈值。说白了它和大模型是双核搭档大模型在前面吭哧吭哧干活Jev 在旁边花几十毫秒用概率给活打分合格放行、不合格打回重写而不是谁取代谁。写在最后Jev 最该被抄走的不是那组“快 200 倍”的数字水分确实不小而是一个架构判断别再让按字数计费的生成模型去干那些只需要一个枚举值的活。当一次判断便宜到可以忽略以前“算不过来账”的事忽然就划算了过去系统只抽查 1% 的行为判断足够便宜后就能 100% 全审大公司囤积多年、因为调用太贵从没分析过的“暗数据”也终于翻得起了。这正是它名字里“杰文斯悖论”的野心——成本趋近于零需求反而爆炸。当然48 小时被复刻 6 次也说明模型架构从来不是护城河校准质量、工具链和分发才是。它会不会成为下一个时代的拐弯处我不敢打包票。但作为开发者现在用送的 5 美元额度约 1.2 亿 token亲手搓一搓绝对不亏。互动时间你用 Jev 或它的平替跑过什么有意思的场景、踩过什么坑欢迎评论区交流。觉得有用就点个赞、收个藏关注我下一篇安排 Jev 开源平替的本地部署保姆教程。