
老刘带 6 人小队给省级生态环境厅做污染溯源推演助手。客户口头说日常监测问询走静态查询扩散推演必须按气象和排放滚动更新跨市联防必须先对齐世界状态再给结论。结果 Qwen 把所有工单当百科问答从来不改状态DeepSeek 看见浓度数字就编一套漂亮的扩散轨迹Kimi 窗口一短把上一小时的风向当当前状态交差。群里改三天提示词线上又漂回去。隔壁路过一句别再拿聊天记录当世界状态表把状态契约、观测更新、推演预算和失败回退写进 SPEC。世界模型到底管什么世界模型不是再写一句「请认真推理」。它管的是这一单里模型脑子里那张「现在的世界」从哪来、怎么更新、能推多远、推崩了怎么办。四件套其实很朴素状态契约世界里允许出现哪些实体和字段。风向、风速、排放口、浓度、行政区划枚举写死不允许临时发明第四类污染物通道。观测更新新监测数据进来必须覆盖旧状态而不是和旧状态并行讲两套故事。推演预算日常问询不准开长推演跨市联防才允许滚动 N 步步数、超时、token 都有上限。失败回退状态对不齐、观测缺失、推演超时标 uncertain 并升级人工禁止用上一单的世界交差。值班室比喻最清楚检索管从哪找档案结构化输出管交出去的单子算不算过关世界模型管的是沙盘上的棋子有没有按最新观测摆好。为什么 2026 必须认真对待交付已经从能聊变成能进值班系统。污染溯源、路网调度、库存推演本质都是「先有一个可更新的世界再在上面做决策」。多基座对状态服从度差一个数量级同一套口头规则Qwen 爱静态答DeepSeek 爱编轨迹Kimi 爱截断。规则写在群公告最容易漂。私有化场景更吃这一套——监测数据出不了网你不能把沙盘状态散落在个人聊天里。落地三道坎环境不稳本地脚本 Mock 一套状态云端监测接口又是另一套对齐全靠感觉。模型不灵一套提示词只在某一个基座会按状态走换模型就发明新字段。规则易飘推演步数、超时、升级条件改在群里过两天没人说得清线上到底用哪一版。MonkeyCode 怎么把这一套跑通MonkeyCode 是免费、免安装的在线 AI 开发平台浏览器打开就能干。每任务带真实云端环境编译、测试、预览都在云端。GLM、Kimi、MiniMax、Qwen、DeepSeek 可按任务一键切换方便把被测和对照拆开交叉验证。需求与 SPEC 管理能把角色、红线、状态字段、观测更新、推演步数、失败回退写成可版本化的契约而不是聊天记录。完全开源支持私有化适合有网络隔离的厅局团队。基础版免费专业会员 99 元/月旗舰会员 499 元/月。三步实战第一步新建任务。主实验用 Qwen对照用 DeepSeek短窗口基线用 Kimi。裁判不要和被测同家。第二步把规则写进 SPEC。角色省级生态环境厅污染溯源推演助手不是科普博主也不是应急指挥。红线不编造浓度和风向不确定就升级人工企业名称、信用代码、精确坐标脱敏禁止把监测里不存在的排放口写进结论。状态契约wind_dir / wind_spd / outlet_id / conc_pm / region_code不允许额外状态通道。观测更新新监测覆盖旧状态口述与监测冲突以监测为准监测缺失标 uncertain。推演预算faq_simple 禁止开推演plume_roll 最多 6 步、超时 10 秒cross_city 必须先对齐状态再推演。校验解析失败或缺必填重试一次仍失败升级禁止在状态未对齐前输出结论。输出state_ok / plume_steps / upgrade / reason不对值班员展示思维链。第三步同批 20 条口述加监测对比。编造监测中不存在的排放口 7→0用上一小时风向交差 5→0跨市联防未对齐状态就给结论 4→0。Kimi 短窗口截断状态被回退拦住。四点建议小任务试点先跑 20 条再谈全面替换。规则写进 SPEC不要写在群公告。多模型交叉验证别让被测和裁判同家自评自夸。敏感监测数据走私有化云端跑通的是方法和门禁不是把厅局数据送上公网。世界模型不是科幻名词。它就是那张必须被观测更新、被预算约束、被门禁拦住的沙盘。把沙盘写进 SPEC比再改三天提示词管用。