ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Jev03:零幻觉需要被重新定义

Jev03:零幻觉需要被重新定义 Jev 的“零幻觉”需要被重新定义RLCD、类型安全与概率校准“Jev 不会幻觉”听起来很厉害但它更像一道填空题的承诺答案只能落在给定选项里不代表一定填对。真正值得关注的是它如何让概率变得可信。一、把“零幻觉”拆开看说法更准确的解释“Jev 不会幻觉”营销化表达重新定义了“幻觉”实际能力不会输出预定义选项之外的内容但选项之内仍可能选错一个只能在 A/B/C 里选答案的人不会选 D但他仍可能把 C 选成 B。Jev 的可靠性来自三个维度类型安全输出结构不可能跑到定义的 schema 之外。概率校准说“90% 概率”的答案实际正确率也应该接近 90%。一致性相同输入给出稳定判断方差小。二、传统 LLM 为什么“不可信”传统大模型做判断有三个典型问题。不懂装懂。LLM 的训练目标往往是生成“让人满意的回答”而不是“诚实地表达不确定”。RLHF 奖励人类爱看的答案结果模型学会了怎么说才像对的而不是怎么说才是对的。概率不可信。模型说“90% 把握”可能只是拍脑袋。工程上想按置信度分流如果 0.9 的实际正确率只有 60%安全阈值形同虚设。输出不稳定。同样的问题换个问法、换个时间答案可能漂移。Agent 一次任务要做几十次判断每个环节一点不稳定累积起来就是系统不可靠。三、底层原理一RLCD 替代 RLHFJev 的训练目标不是“答对”而是“输出与真实结果相符的概率”。这套方法被称为 RLCDReinforcement Learning from Calibrated Decisions校准决策强化学习。训练方法优化目标典型问题RLHF生成让人满意的回答不懂装懂、过度自信RLVR答对可验证的题推理链长又慢又贵RLCD输出校准的概率需要大量标注数据RLHF 像老师改作文夸“写得真好”RLCD 像老师改选择题做对就是对、做错就是错还要学生自己说“这题我有几成把握”。校准的意义可以这样理解一个预言家做了 1000 次预测每次都说“80% 概率发生”。如果确实有 800 次发生它就是校准的。工程代码要依赖这个数字做决策这个数字就必须可信ifdecision.confidence0.88:auto_execute()else:route_to_human()四、底层原理二三种原语的结构保证Noul是非判断在隐空间直接计算“为真的可能性”返回 0~1 概率不需要先组织语言再翻译回判断。resultjev.ask(state用户消息你们服务真垃圾再也不用了,questions[{type:noul,question:用户是否在投诉},{type:noul,question:用户是否提到退款},],)# {用户是否在投诉: {probability: 0.97}, ...}Choice多选一直接在预定义选项集合上输出概率分布最多支持 255 个选项。resultjev.ask(statecustomer_message,questions[{type:choice,question:该分给哪个部门,options:[售前,售后,技术,账务]},],)# {choice: 账务, probabilities: {售前:0.02,售后:0.03,技术:0.01,账务:0.94}}Score打分把连续打分离散化到预设等级输出各等级概率再加权。resultjev.ask(stateticket_content,questions[{type:score,question:客户愤怒程度,scale:[1,2,3,4,5,6,7,8,9,10]},],)# {score: 8.2, probabilities: {7:0.15, 8:0.45, 9:0.30, 10:0.10}}所以“没有幻觉”的本质是输出空间被限制在预定义选项内这是结构保证。但结构正确不等于判断正确。五、底层原理三为什么概率校准有工程价值校准过的概率让你敢写阈值。0.9 可以自动执行0.6 转人工0.5 以下拒绝——前提是模型说的 0.9 真的对应约 90% 的正确率。传统 LLM 的置信度不可迁移它嘴里的“90%”不可信阈值只能靠反复试错。RLCD 的训练目标正是把概率本身变成可依赖的工程信号。六、第三方实测与边界数据表现苹果年报召回判定准确率与 DeepSeek V4.1 Flash 打平92.2%决策一致率 94.7%。LangChain Jev-as-a-Judge500 次评测全对质量评分方差比 LLM 裁判低一两个数量级。工具调用安全分类60 个案例总一致率 91.7%界限清晰案例全部答对伪装陷阱答对 11/12本身含糊的案例答对约 71%。规律很明显边界越清晰越准越含糊越容易错。官方自己承认的失灵场景场景表现数数 / 算术不可靠日期时间比较不可靠双重否定、间接引用准确率下降臃肿的 state上下文腐化准确率下降提示词注入会被操纵性文本带偏Score 不是测量仪1.4 分不能解读为“40% 的愤怒”七、结论准但不等于更聪明Jev 的准来自三个约束用 RLCD 训练出校准概率把输出限制在结构安全范围内把判断做成专门任务。它不是来取代大模型的而是来当大模型的“裁判”大模型负责理解和生成Jev 负责判断和打分。它的核心竞争力不是“更聪明”而是“更快、更便宜、够用并且给你一个敢用的置信度”。
返回列表