ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Lang...

ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Lang... 文章主要内容总结本文聚焦视频多模态大语言模型(Video MLLMs)的主动交互能力,针对现有评估基准和指标的不足,提出了首个综合基准ProactiveVideoQA和新型评估指标PAUC(Proactive Area Under Curve)。背景:随着视频多模态大语言模型的发展,用户对模型的主动交互能力(如在视频播放中自主决定响应时机)需求增加,但现有基准多基于离线或在线交互(依赖用户触发),且缺乏考虑时间动态的评估指标。ProactiveVideoQA基准:专为评估主动交互设计,包含4类任务(web视频QA、第一视角视频QA、电视剧视频QA、视频异常检测),涵盖多样主题和多模态输入(视频、文本、语音),支持多轮开放式回答,更贴近真实场景。PAUC指标:受用户旅程图启发,通过追踪模型响应质量随时间的变化(时间-分数曲线下面积),综合考虑响应的及时性和内容准确性,解决了传统指标仅关注文本内容的局限。实验结果:在ProactiveVideoQA上对多种基线模型的评估显示,PAUC与人类偏好的一致性优于传统指标;现有主动交互模型性能未超越离线模型,存在响应冗余等问题。创新点多轮开放式基准:不同于现有以选择题为主的视频QA基准,ProactiveVideoQA采用完全开放式问题,要求多轮自由文本
返回列表