
全局一致性:每个智能体均局部正确,但团队整体仍然出错多智能体协作的局部到全局语义基础arXiv:2610.02036v1,2026‑10‑01摘要如今AI智能体会协同处理代码、文档、工具调用与科学分析任务,时常和人类共同工作。没有任何参与方能够观测完整全局状态。每一步单独看都是正确的,但组合后的整体结果却是错误的,本文将该现象定义为全局一致性问题。本文论证:该问题本质属于状态问题,并不仅仅是模型智能不足:更强的模型可以做出更优局部决策,但模型无法看到上下文窗口之外的信息;当各个局部合法片段本身无法互相适配时,仅凭模型能力无法让它们拼接出正确全局结果。仅靠提升智能无法保证解决该问题。据本文调研,这是第一篇将该现象独立归纳为AI智能体系统一类失效模式的工作;并把相关理论边界整理为工程实践的两套规范:上下文工程(context engineering)、智能体管控器(agent harness)。分别规定:每个智能体的上下文中必须包含哪些信息;智能体外围管控器需要维护、校验哪些内容。本文第一个核心结论:观测混淆不可行性定理(Observation‑Aliasing Impossibility Theorem),精确刻画信息缺失带来的限制。策略仅当:观测到的所有可能世界下都存在同一个合法动作,才能够基于观测输出保证有效的动作。如果两种世界观测表象完全一致,但要求执行完全不同动作,无论推理、角色拆分、消息通信、随机采样,都无法保证做出正确选择。当存在kkk个不可区分世界,且每个世界合法动作集合互不相交,最优随机化策略的成功率严格等于KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲1/k\);引入bbb比特提示信息后,成功率上限提升至1/⌈k/2b⌉1/\lceil k/2^b \rceil1/⌈k/2b⌉。这是上下文工程的理论依据:它明确规定上下文必须包含的区分信息。但寻找满足条件的最小上下文集合是NP‑Hard。把全部信息塞入上下文窗口几乎不可行,而求解最小充分上下文本身计算难度很高。第二种失效模式:全局不一致可发生在信息完整的场景下。3个智能体两两之间使用局部合法、互逆的转换关系,但三者形成闭环之后整体无法自洽;多个角色各自执行合法的消耗操作,但总开销超出共享预算。这类错误无法被任意局部检查捕获,矛盾产生于片段之间的拼接关系,而不存在于任意单个片段内部。当依赖关系为树结构时,两两校验足够;一旦出现循环依赖,两两校验会失效;在无约束通用语义下,不存在普适的固定局部校验边界。两类失效存在内在关联:不可行性定理规定管控器必须保留的语义区分;而状态被拆分为局部视图、跨参与方转码、动作修改状态的过程中,这些区分会丢失,进而触发第二类失效。本文给出一套原则化综合框架,防护上述三个环节:拓扑结构:记录各组件交互边界;群胚(groupoids):校验不同编码之间语义等价;层(sheaves):判断局部状态能否粘合为统一全局世界;范畴(categories):描述动作随时间的组合关系。以上数学结构不是唯一强制实现方案。在局部视图、无损转码、状态更新的明确假设下,每个结构实现精确验证所必需的属性;当不存在对应映射时,对应结构可以省略。版本校验、依赖引擎、账本、托管配额都是该需求在具体领域的实现。这套框架同样给出问题的复杂度代价:跨表示层的一致性认证可以在线性时间完成;但是寻找代价最小的修复方案属于NP‑Hard;共享预算完全无法通过独立局部检查保护,必须在提交时刻做强制校验,或者拆分为独立配额。该设计方案不同于增设一个管理者智能体:管理者本身也是参与者,同样受不可行性定理约束。模型负责提出候选方案;管控器基于这套框架决定方案是否允许执行。框架定义管控器职责:必须持有哪些语义区分、重叠关系会隐藏全局不一致、哪些转换闭环必须闭合、哪些变更必须等待提交校验。本文完成9组实证研究:前沿大模型在可以看到关键决策事件时,基准40个任务全部答对;隐藏关键事件后,在推理、角色分工、投票、工具调用各类条件下,准确率统计上等价于三选一随机猜测(1/3);仅补充一句话还原缺失事实,又恢复40/40满分。在预注册60轮TeamBench多智能体实验中:普通智能体团队会耗尽共享20次调用预算,5组实验全部超支;即使把实时剩余计数展示给全部智能体,仍然5组中4组超支;在提交层强制校验预算后,全部0次违规,且任务平均完成度没有下降。同任务进一步对照:固定每角色托管配额同样实现0违规;仅提供只读计数器依旧4/5超支。在公开本体对齐网络数据集(2018‑2024共45个网络),在唯一名称诊断规则下,23个网络存在两两校验无法发现的本体内部身份冲突。在分割视图的智能体复现实验中,40次合并任务出现9次隐藏冲突;网络级全局检查可以全部检出清除,但简单广播式修复会使平均(\mathcal{F})1从0.796下降至0.774。在预注册222集τ2\tau^2τ2‑bench Telecom实验:当变更违反策略规则时,普通策略检查和一致性管控器效果持平;当已提交变更被静默撤销时,普通检查的得分仅0.07,一致性管控器得分1.00。如果已有传统工具已经持有对应状态(依赖引擎、耦合求解器),其表现与本文管控器完全对齐,和理论预测一致。全部9项实验均符合理论预测:当决策所需状态缺失或者没有组件负责维护该状态,管控器带来显著收益;当已有传统组件已经持有该状态,管控器效果与之持平。证明完整放在附录;智能体实验只使用单一模型系列,样本规模有限,更大规模复现是未来工作。1 引言:每一步局部正确,但整体结果错误以TeamBench任务举例:规划者写计划,执行者运行命令,验证者校验结果,整个团队总共允许运行20次命令。每个智能体发起调用都具备合理理由,单次调用本身没有错误,但预算属于团队全局约束,没有任何一个智能体负责维护这个全局计数,团队实际调用次数可达预算三倍。即使把实时计数展示全部成员,依旧无法彻底阻止超支;只有管控器本身持有计数器,拒绝第21次调用,违规现象才彻底消失,同时任务平均进度不会下降。该模式具备普适性:τ2\tau^2τ2‑bench:用户和助手在不同权限下修改同一个环境的不同部分;BixBench3:多项科学制品必须源自同一份演进分析。参与者基于各自局部视图执行动作,单步可以局部合法,但合并结果不一定合法:局部有效 ≠ 全局一致两类失效模式观测混淆:不同全局世界,对所有参与者呈现完全一致观测,但要求执行不同动作。例如部分修订历史,删除关键事件之后,日志完全一致,但系统实际状态完全不同。观测混淆不可行性定理:策略能够基于观测保证输出合法动作,当且仅当该观测对应的全部可能世界,存在公共合法动作。当该条件不成立:无论推理深度、角色拆分、消息传递、采样,都无法弥补观测层面信息缺失。kkk个不可区分、合法动作互不相交的世界,随机策略最坏成功率不超过KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲1/k\)。更强模型只能在已观测信息内做更好推理,不能看到上下文窗口之外的信息。Study‑I实证验证:把关键事件隐藏,即便增加推理算力、多角色、投票,性能等价随机猜测;仅仅增加一句缺失事实,恢复全部正确。信息完整但局部拼接失败:所有参与者均拥有信息,但信息被切分成碎片。每个智能体通过自身可执行检查,但碎片拼接不出任何合法全局状态。例子:3个智能体两两转换均自洽可逆,但绕闭环一圈之后数值对不上;多个角色各自开销合法,总和突破全局预算。本文提出四个核心问题观测问题:局部视图是否包含足够信息,保证全局行为合法?可实现问题:局部互相兼容的片段,是否对应某一个真实全局状态?状态转移问题:局部动作组合之后,是否构成合法全局变更?语义状态问题:最少需要保留哪些信息,判断后续动作是否合法?同时伴随代价问题:需要观测多少状态;全局校验计算开销;求解最小充分观测集合难度;修复不一致是否比检测不一致更难。本文提出核心构造:KaTeX parse error: Can't use function '\(' in math mode at position 27: …}=(H, \mathcal{\̲(̲\mathcal{C}\)},…组件名称作用缺失后出现的问题HHH拓扑超图记录组件交互重叠范围、共享状态依赖遗漏,变更无约束传播KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{G}\)}群胚不同编码之间等价转换关系对象重复,转换闭环不自洽KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{F}\)}层条件局部视图能否粘合为单一全局世界两两兼容但不存在合法全局状态KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{C}\)}范畴描述状态变更动作以及动作组合顺序非法操作,结果依赖执行路径DDD历史状态版本、依赖、资源、未完成义务过时推导、遗忘历史约束HHH拓扑:记录谁和谁共享哪些状态;如果是循环结构,两两校验不足以保证全局一致性;树状结构两两校验足够。KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{G}\)}群胚:描述同一对象不同表达形式,转换必须可逆;闭环遍历转换必须回到恒等;单独一处转换因子错误,局部看没问题,闭环后结果出错。KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{F}\)}层条件:局部数据在重叠处全部达成一致,是否存在一个全局世界与之对应;这就是“每个智能体正确,团队错误”可被管控器校验的形式化条件。KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{C}\)}范畴:区分两种操作:仅仅重编码表达对象(单位转换);真正修改对象本身(修改尺寸);只有真正修改的动作,提交阶段需要校验。DDD历史状态:只保留会改变未来动作合法性的历史;已经无关的日志可以丢弃。⚠️这套是满足属性的一类实现,不是唯一实现。版本检查、依赖求解器、账本、托管配额都是领域特化等价实现。误区:直接给所有智能体全部信息并不是万能解法,存在5个本质难点:带宽、隐私、权限、上下文窗口限制,很难全部共享;求解最小充分上下文NP‑Hard;决策只能看到自身视图,不是所有人视图的并集。两两校验只在树型重叠结构有效;循环结构两两校验会失效;通用无约束语义不存在固定大小局部校验万能方案。检测冲突代价低,寻找最小修复方案NP‑Hard。优先提交前检测,不要事后修复。跨角色共享约束不能依靠各组件独立检查;要么提交点统一管控,要么拆分为配额。时间与变更带来额外约束;仅仅重编码不会破坏一致性,但修改状态会;必须保存影响未来合法性的历史;提交时必须校验所有依赖项版本。架构启示:模型负责提案;管控器持有权威语义状态,决定提案是否允许提交生效。模型内部可以随机、生成式;但管控器校验规则需要确定。管控器≠管理者智能体:管理者也是模型,同样受观测混淆定理约束。管控器是状态持有者,不是又一个提案智能体。2 模型与推理能力的边界2.1 参与者观测与允许动作XXX:全部全局状态集合;AA