VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答
VideoTreeSearch基于树形自校正智能体的长视频时序定位问答arXiv:2607.16189v1 [cs.CV] 2026-07-17开源代码仓库https://github.com/CeeZh/VTS摘要带时序定位的长视频问答Grounded LVQA任务要求模型回答问题的同时定位视频中支撑答案的证据片段。现有智能体方案仅提供单一crop_video裁剪动作只能由粗到细收敛缺少回溯纠错能力极易提前收敛、陷入早期错误无法恢复。本文提出VideoTreeSearchVTS框架将长视频问答建模为自适应时序树上的迭代自校正搜索。基于CLIP视觉变化边界构建非均匀时序树每个节点对应语义连贯视频片段设计四类离散导航动作zoom_in下探子段、zoom_out回溯父段、shift切换同级片段、answer输出结果把回溯纠错转为可学习显式原语设计轨迹合成流水线生成包含误入错误分支再回溯修复的多步导航路径采用监督微调强化学习两阶段训练时序交并比IoU、答案准确率双指标联合奖励。在CG-Bench、Haystack-LVBench、Haystack-Ego4D三大时序定位基准上VTS相比最优基线在CG-Bench提升12.5 mIoUHaystack-Ego4D提升7.4 T-F1同时可泛化至通用长视频问答任务在Video-MME、MLVU、LVBench最高提升7.1准确率。消融实验证明分层树形搜索、显式回溯是性能提升核心模块。关键词长视频问答时序定位多模态智能体树形分层搜索自校正回溯强化学习VLM1 引言1.1 任务痛点以一小时烹饪教程视频提问为例“厨师放入烤箱前往碗里加了什么”模型需要先定位放碗的片段再往前追溯加料画面。长视频中有效证据仅占极小片段均匀采样要么漏关键帧、要么超出多模态上下文窗口必须迭代式时序检索。现有裁剪式智能体仅支持连续区间裁剪存在两大结构性缺陷动作空间不对称只有缩小搜索范围的操作没有从细粒度退回粗粒度的回溯手段无分层视频分解模型只能从原始像素回归时间戳搜索空间扁平无先验极易提前收敛、无法修正早期错误。1.2 VTS核心创新将长视频构建为语义自适应时序树智能体通过四类离散动作遍历树结构把定位、纠错变为独立可学习行为自适应分段基于CLIP帧嵌入视觉突变边界划分节点而非固定均匀切分四元离散导航动作解耦探索与纠错轨迹合成数据集构造“误入错分支回溯修复”样本解决现有数据集缺少纠错监督的问题两阶段训练先模仿合成轨迹监督微调再基于定位、答案双奖励强化学习。1.3 核心结论时序树显式回溯大幅提升长视频证据定位精度视频越长增益越明显智能体平均4.8轮搜索60%轨迹会触发回溯动作证明模型主动使用纠错机制仅用时序定位数据训练可零成本泛化到无定位要求的通用长视频问答。2 相关工作2.1 长视频与时序定位问答传统长视频方案超长上下文VLM、帧压缩、关键帧筛选、视频摘要流水线均为单次前向推理无法迭代检索时序片段。时序定位Grounded LVQA要求输出答案对应视频区间代表基准CG-Bench、Haystack系列现有TimeChat、VideoITG等模型采用固定递归流程不支持动态回溯修正。2.2 视频分层树形表示VideoTree、VideoMiner将视频构建树形结构但均为静态一次性编码仅单次前向使用VTS创新点树作为可交互环境智能多轮遍历、支持回溯重访历史节点。3 方法VideoTreeSearch整体框架整体流程输入长视频问题 → 自适应构建时序树 → 智能体多轮树导航zoom_in/zoom_out/shift→ 输出答案与时序证据区间。3.1 自适应时序树构建对任意视频片段均匀1fps采样最多64帧计算CLIP帧间嵌入余弦距离表征视觉变化自适应阈值τmean(δ)k⋅std(δ)\tau\text{mean}(\delta)k\cdot\text{std}(\delta)τmean(δ)k⋅std(δ)在突变位置切分约束每个父节点子片段数量3~8片段短于64秒直接作为叶子节点懒加载机制仅智能体访问节点时才生成子树降低算力开销。3.2 四类离散导航动作zoom_in(c)进入第c个子片段由粗到细缩小检索范围zoom_out()返回父节点完成回溯纠错shift(s)切换至同层级第s个兄弟片段横向排查answer(答案, [起始秒, 结束秒])终止搜索输出答案与时序证据。对比连续crop方案树形分层天然匹配多尺度时序线索回溯是独立动作而非隐式反复裁剪。3.3 多轮导航内存机制内存存储两部分轻量化信息避免上下文溢出已访问树形结构各节点文本摘要全部历史动作时序日志智能体仅读取当前节点原始帧其余节点仅读取文字摘要大幅节省视觉token。3.4 轨迹合成流水线训练数据核心现有数据集只有最优检索路径缺少“犯错再修复”样本本文自动生成带迂回轨迹控制器基于Qwen3-VL打分优先走向含真值子段允许主动误入错误分支连续两轮错分支强制回溯每一步附带DeepSeek-R1生成推理文本数据源CG-Bench、Haystack-Ego4D、自制LongClueQA无标注长YouTube视频集最终过滤得到6537条可用训练轨迹。3.5 两阶段训练方案阶段1监督微调SFT损失仅作用有效纠错动作正确下探、错分支zoom_out、shift切换误入错误分支的步骤仅作为上下文、不参与梯度回传。损失公式LSFT−∑(Ot−1,Mt,Rt,At)logpθ(Rt,At∣Ot−1,Mt,Q)\mathcal{L}_{\text{SFT}}-\sum_{(O_{t-1},M_{t},R_{t},A_{t})}\log p_{\theta}(R_{t},A_{t}\mid O_{t-1},M_{t},Q)LSFT−(Ot−1,Mt,Rt,At)∑logpθ(Rt,At∣Ot−1,Mt,Q)阶段2GR强化学习GRPO复合奖励函数三项加权求和R(τ)λfmtRfmtλIoURIoUλaccRτR(\tau)\lambda_{\text{fmt}}R_{\text{fmt}}\lambda_{\text{IoU}}R_{\text{IoU}}\lambda_{\text{acc}}R_{\tau}R(τ)λfmtRfmtλIoURIoUλaccRτKaTeX parse error: Expected }, got EOF at end of input: R_{\text{fmt}动作格式合法性奖励RIoUR_{\text{IoU}}RIoU预测片段与真值时序交并比RaccR_{\text{acc}}Racc选择题答案正确率采用KL散度约束策略不偏离SFT初始模型防止崩溃。3.6 实现细节基础VLMQwen3-VL-8B分段超参k1.5k1.5k1.5每轮采样64帧1fps训练硬件4张H100模型版本VTS-SFT仅微调、VTS-RL微调强化主实验模型。4 实验设置4.1 评测数据集时序定位Grounded LVQA核心任务CG-Bench mini子集指标mIoU、问答准确率Haystack-LVBench指标T-F1时序F1、准确率Haystack-Ego4D第一视角长视频最难T-F1、准确率。通用长视频问答泛化测试Video-MME、MLVU、LVBench仅评测选择题准确率。4.2 对比基线分类均匀采样VLMQwen3-VL-8B256/384帧、Video-R1摘要LLM流水线SiLVR密集帧描述大模型推理裁剪式智能体LongVT、Video-o3、VideoZoomer、TimeSearch-R。4.3 主实验结果时序定位任务方法CG-Bench(mIoU/Acc)Haystack-LVBench(T-F1/Acc)Haystack-Ego4D(T-F1/Acc)Qwen3-VL 384帧12.1/23.69.2/39.57.0/33.4SiLVR10.1/31.88.5/57.06.3/46.4LongVT4.3/17.45.4/46.23.7/42.1TimeSearch-R-/-8.1/52.111.0/53.5VTS(本文)16.8/36.415.2/58.318.4/66.1结论CG-Bench相比最优基线LongVT mIoU提升12.5Ego4D长视频场景T-F1提升7.4视频越长树形回溯增益越大。4.4 效率对比VTS平均仅处理328帧少于均匀采样384帧、SiLVR 450帧但定位与准确率全面领先。5 消融与性能分析5.1 核心模块消融实验配置CG mIoUHaystack-Ego4D T-F1连续crop动作替代树形15.514.2树形但禁用zoom_out/shift回溯14.415.5树形无分层平铺均分15.318.9完整VTS16.818.4回溯模块移除后所有数据集指标暴跌证明自校正为核心增益分层树形优于平铺均分仅线索极短的Ego4D平铺有微弱时序提升但问答准确率下降。统计VTS 60%轨迹触发回溯裁剪基线仅7%~15%42.7%回溯后能找到正确证据片段。5.2 训练策略消融仅零样本提示12.8 mIoUSFT微调2.1 mIoUSFTGR强化再1.9 mIoU只用最优路径训练仅10.4 mIoU证明带迂回的纠错轨迹是关键训练信号。5.3 主干模型泛化测试替换同等规模Qwen2.5-VL-7B后VTS依旧全面超越所有裁剪智能体证明增益来自框架而非基座模型。5.4 通用长视频问答泛化结果方法Video-MMEMLVULVBenchLongVT67.0-41.3VideoZoomer65.255.841.5VTS67.558.254.7仅针对时序定位训练的导航策略可直接迁移至无片段定位的通用长视频理解任务。6 结论与局限结论本文提出VTS树形自校正长视频检索智能体自适应时序树四类可学习导航动作解决传统裁剪智能体无法回溯纠错的缺陷。在三大时序定位基准大幅领先现有方案且导航策略具备跨任务泛化能力分层时序搜索是长视频推理有效归纳偏置。局限性当前仅支持单段连续证据无法处理分散多段线索问题分段依赖CLIP视觉突变画面高度同质视频边界划分精度下降轨迹合成依赖外部VLM/LLM训练数据质量受外部模型上限约束。未来工作扩展多证据分支聚合问答优化同质视频场景时序边界检测器轻量化树形推理降低长视频推理算力拓展多轮多模态交互长视频智能体。附录A 实现完整细节A1 自适应分段伪代码算法1 自适应视频分段 输入片段S、CLIP编码器E、阈值系数k、最小/最大子段N_min,N_max 1. 均匀1fps采样S内最多64帧F 2. 对所有帧提取CLIP嵌入e_i 3. 计算相邻帧视觉距离 δ_i 1 - cos(e_i, e_{i1}) 4. 计算阈值 τ 均值(δ) k*标准差(δ) 5. 收集所有δ_iτ的分割边界B 6. 若边界过多保留δ最大前N_max-1条 7. 若边界过少补充δ次大边界至N_min-1条 8. 根据边界切分视频返回子片段列表A2 树形导航推理伪代码算法2 分层树搜索推理 输入视频V、问题Q、智能体策略π、摘要模型Φ、最大轮次T_max 1. 当前片段S 完整视频区间 2. 初始化内存M树结构动作历史 3. for t in 1~T_max: 1. 自适应切分S得到子片段集合 2. 采样各子片段帧作为观测O 3. 策略输出推理文本R 动作A 4. 分支处理动作 zoom_in切换至对应子段 zoom_out回到父节点 shift切换同级兄弟片段 answer直接返回答案与时序区间 5. 生成所有子片段文本摘要更新内存M 4. 达到最大轮次强制输出最优结果A3 标准Prompt模板系统提示你是长视频时序检索智能体可分层遍历视频时序树每次执行四类动作之一zoom_in 编号进入细分子片段缩小检索zoom_out回溯上层粗片段修正错误shift 编号切换同层级其他片段answer 选项字母 起始秒 结束秒输出答案与支撑证据区间。用户输入固定结构当前视频片段时间范围xxx子片段帧视觉内容xxx内存记录树形结构历史动作xxx问题xxx选择题选项A/B/C…A4 训练超参SFT阶段2 epochbatch16lr1e-5冻结视觉编码器GR强化LoRA rank32lr5e-5每组提示8条轨迹KL系数0.04推理vLLM加速温度0最大交互轮次10。附录B 评测数据集过滤规则CG-Bench原始数据存在大量无意义样本四层过滤流程多真值片段、覆盖超30%视频、无效时长样本直接删除仅用问题文本即可答对的样本剔除无视频依赖仅真值片段可答对其余帧无法作答才保留去除真值外画面也能答对的模糊样本过滤后剩余1176条高质量时序定位样本。附录C 数据集构建LongClueQAC1 数据采集爬取10~90分钟YouTube创意共享长视频基于CLIP帧相似度过滤视觉单调内容保留教程、叙事、运动等具备时序变化视频。C2 QA生成流水线视频每10秒切分片段Qwen3-VL生成带时间戳画面摘要Qwen3大模型基于摘要生成选择题绑定对应证据时间生成语义相似干扰选项确保仅目标片段可唯一确定答案。C3 轨迹合成数据过滤CG-Bench、Haystack-Ego4D、LongClueQA统一四步过滤仅保留可生成有效纠错路径样本最终6537条训练轨迹。附录D 定性案例富士电视台22楼窗口案例智能体先误入一楼售票大厅分支连续两轮后zoom_out回溯切换同级片段找到高层窗户证据2 厨具案例单次zoom_in直接定位橱柜水果无需回溯体现简单线索快速收敛能力。开源资源完整代码仓库https://github.com/CeeZh/VTS数据集构建脚本、训练推理代码、评测复现脚本全部开源。