ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AI 陪读顶会论文(十八):Agentic Workflow 与 Self-Consistency 自洽性采样:大模型复杂推理的思维树(ToT)与自我反思

AI 陪读顶会论文(十八):Agentic Workflow 与 Self-Consistency 自洽性采样:大模型复杂推理的思维树(ToT)与自我反思 AI 陪读顶会论文十八Agentic Workflow 与 Self-Consistency 自洽性采样大模型复杂推理的思维树ToT与自我反思在探讨如何让大语言模型LLM攻克复杂数学竞赛推导、大规模微服务架构设计以及复杂长链路业务决策时过去人们往往单纯寄希望于“把底座模型参数扩大 10 倍Scaling Up Model Parameters”。然而吴恩达Andrew Ng教授与普林斯顿/Google 团队的研究表明一个基于参数较小的中等开源模型如 8B/70B只要配备了先进的“智能体工作流Agentic Workflow”与“反思自洽性采样框架”在复杂推理任务上的综合表现能够轻松碾压未经编排的单次零样本Zero-shot超大模型如 GPT-4o在智能体推理与复杂任务规划演进史上有四篇奠定现代 Agent 认知架构的里程碑论文CoTChain-of-ThoughtNeurIPS 2022Wei et al.思维链单向线性展开Self-ConsistencyICLR 2023Wang et al.多路径自洽性多数投票采样Tree of ThoughtsToTNeurIPS 2023Yao et al.树形探索、前瞻剪枝与回溯评估ReflexionNeurIPS 2023Shinn et al.基于语言反馈的动态口头自我反思。今天我们借助大模型辅助精读把 Agentic Workflow 的四大进阶推理范式、思维树ToT状态搜索与自洽性投票Self-Consistency数学机理彻底讲透。大模型推理范式四阶进化全景图graph LR P1[1. 传统输入-输出 (Standard IO)brPrompt - Output (单次直接蹦出答案, 易幻觉)] -- P2[2. 思维链 (CoT)br逐步线性推导 Step1 - Step2 - Step3] P2 -- P3[3. 自洽性采样 (Self-Consistency)br并发采样 N 条不同 CoT 推理路径 - 多数投票 (Majority Vote)] P3 -- P4[ 4. 思维树与反思智能体 (ToT Agentic Workflow)brBFS/DFS 树形状态搜索 动态前瞻评估 失败自动回溯 Backtracking]一、Self-Consistency自洽性采样基于多数投票消除单次推理偶发错误核心数学直觉对于一个高度复杂的逻辑或数学难题通往正确答案的推理逻辑路径通常具有高度的一致性Self-Consistent而错误的推理路径往往千奇百怪、互不相同Self-Consistency 运作流水线多样化温度采样Temperature Sampling将模型生成温度设为 $T 0.7$使得模型能够探索不同的解题切入点并发生成 $K$ 条独立思维链如 $K 10$提取最终结论并进行多数投票Majority Voting$$\mathbf{\hat{y} \arg\max_y \sum_{i1}^K \mathbb{I}\left( \text{extract_answer}(Path_i) y \right)}$$graph TD Prompt[输入复杂算法难题] -- Sample[并发温度采样 5 条独立推理路径] Sample -- Path1[路径 1 推导: 最终答案 42] Sample -- Path2[路径 2 推导: 最终答案 42] Sample -- Path3[路径 3 推导: 算错边界, 最终答案 38] Sample -- Path4[路径 4 推导: 最终答案 42] Sample -- Path5[路径 5 推导: 最终答案 42] Path1 Path2 Path3 Path4 Path5 -- Vote[ 多数投票聚合器 (Majority Voting)] Vote -- Winner[输出绝对高可靠答案: 42 (置信度 80%!)]实测成效仅凭自洽性多路投票在 GSM8K小学数学应用题与 SVAMP 推理基准上的准确率直接提升了12% ~ 18%二、Tree of ThoughtsToT 思维树将大模型转化为广度优先树搜索求解器在解决“24 点游戏Game of 24”、填字游戏Crosswords或复杂分布式架构决策时单向思维链CoT一旦在第 1 步走错后续所有推导将全盘皆输缺乏人类走一步看三步与下棋悔棋的能力。普林斯顿团队提出的ToTTree of Thoughts将问题求解建模为树形状态空间搜索Tree Search Problemgraph TD Root[初始输入状态 s_0: [4, 1, 8, 7]] -- Branch1[步骤 1 分支 A: 4 * 1 4 - 状态 [4, 8, 7]] Root -- Branch2[步骤 1 分支 B: 8 - 7 1 - 状态 [4, 1, 1]] Root -- Branch3[步骤 1 分支 C: 8 / (1 - 7/?) - 评估不可能] Branch1 -- Eval1[大模型前瞻自我评估: 给出得分 0.8 (有望成功!)] Branch2 -- Eval2[大模型前瞻自我评估: 给出得分 0.2 (死胡同!)] Branch3 -- Eval3[直接剪枝 Prune!] Eval1 -- NextSearch[继续展开分支 A: 深度探索 - 最终得出 (8 - 4) * (7 - 1) 24 !]ToT 四大核心模块思维分解Thought Decomposition将复杂大任务切分为有意义的中间步骤中间状态 $s$思维生成器Thought Generator基于当前状态大模型生成 3~5 个候选的下一步行动分支状态评估器State Evaluator大模型对每一个候选状态进行价值评估Sure / Likely / Impossible或输出 $0 \sim 1$ 分值搜索算法Search Algorithm采用BFS广度优先搜索或DFS深度优先搜索 回溯 Backtracking遍历整棵思维树。三、Reflexion带有短期记忆与语言反思的自我进化闭环在执行代码生成或运维操作时如果执行器Executor / 单元测试返回了报错信息如AssertionErrorgraph LR Task[业务任务] -- Actor[Agent 编写代码] Actor -- Sandbox[沙箱执行单测] Sandbox --|单测报错 RE/WA| Evaluator[评估器捕获错误堆栈] Evaluator -- SelfReflect[ 口头自我反思 (Self-Reflection):br我刚才假设了数组非空, 但用例传入了空数组引发 NPE, 下次我必须在入口处加卫语句判空!] SelfReflect -- Memory[将反思结论存入短期记忆 Memory Bank] Memory --|携带前一次反思教训| ActorReflexion 的强大之处它不需要微调模型权重仅仅通过在 Prompt 中注入**“你上一轮尝试失败了这是你的自我反思教训”**使得模型在下一次尝试时成功率飙升 30% 以上极简 Python 模拟 ToT 广度优先思维树搜索核心骨架class TreeOfThoughtsSolver: def __init__(self, llm_client): self.llm llm_client def solve_bfs(self, initial_state: str, max_depth: int 3, beam_width: int 3): current_states [initial_state] for depth in range(max_depth): candidates [] for state in current_states: # 1. 为当前状态生成 3 个候选下一步思考分支 next_thoughts self.llm.generate_thoughts(state, num_samples3) candidates.extend(next_thoughts) # 2. 大模型作为评估器给所有候选状态打分 (0.0 ~ 1.0) evaluated_candidates [] for candidate in candidates: score self.llm.evaluate_state_score(candidate) evaluated_candidates.append((candidate, score)) # 3. 剪枝仅保留得分最高的 Top-K (Beam Width) 状态进入下一轮深度 evaluated_candidates.sort(keylambda x: x[1], reverseTrue) current_states [cand for cand, score in evaluated_candidates[:beam_width]] # 检查是否已达到目标终局解 for state, score in evaluated_candidates[:beam_width]: if score 0.95: return state # 成功找到全局最优解 return current_states[0]实习生的学术与工程总结从单纯的“Prompt 工程”走向“智能体工作流Agentic Workflow”是现代大模型应用研发的一场深刻范式革命。我们通过Self-Consistency 多数投票消灭随机波动通过 ToT 思维树赋予模型前瞻搜索与回溯能力通过 Reflexion 闭环构建自我进化记忆。这套多维推理与自反思架构让大模型真正跨越了简单对话的玩具门槛具备了解决现实世界复杂工程难题的通用推理智能。
返回列表