ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde... 文章主要内容与创新点总结一、主要内容本文针对大型视觉语言模型(LVLMs)在实例级任务(如目标跟踪)中性能不足的问题,提出了一种统一的行人跟踪框架OmniPT。该框架能够同时完成传统多目标跟踪(MOT)、指代多目标跟踪(RMOT)、跨视角指代多目标跟踪(CRMOT)和语义多目标跟踪(SMOT)四大任务,核心是通过语义理解增强跟踪稳定性,同时实现指令交互下的跟踪与语义分析。为适配LVLMs的能力特性,设计了四阶段训练策略:第一阶段RL:采用GRPO算法,规范模型输出固定格式的边界框(x,y,w,h);中期训练(Mid Training):基于行人相关数据集,通过图像文本对齐、目标检测、位置预测、行人重识别等代理任务,增强模型对行人语义描述的敏感性;监督微调(SFT):将跟踪任务解耦为VQA形式,针对四大核心任务设计训练样本与查询格式;第二阶段RL:进一步提升模型跟踪性能与指令遵循能力。在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等数据集上的实验表明,OmniPT在跟踪精度(HOTA、MOTA等指标)和语义理解(BLEU、CIDEr等指标)上均达到当前最优水平,例如在BenSMOT上HOTA得分75.04,较此前最佳结果提升3.06。二、创新点统一范式设计:首次提出"一体化"行人跟踪框架,兼容传统跟踪与语义导向型跟踪任务,实现跟踪与语义理解的交互式统一;任务转化方案:将实例级跟踪
返回列表