ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ParlAI 中的 VisDial 视觉对话任务:数据构建、Teacher 实现与实战使用指南

ParlAI 中的 VisDial 视觉对话任务:数据构建、Teacher 实现与实战使用指南 NLP人工智能深度学习【免费下载链接】ParlAIA framework for training and evaluating AI models on a variety of openly available dialogue datasets.项目地址https://gitcode.com/gh_mirrors/pa/ParlAI点击查看免费下载导读VisDialVisual Dialog是 ParlAI 中一个要求智能体围绕视觉内容展开有意义多轮对话的经典任务源自 Das 等人 2016 年的工作。本文以 parlai/tasks/visdial/README.md 为骨架结合 agents.py 与 build.py 的源码实现深入讲解该任务在 ParlAI 中的数据划分逻辑、Teacher 工作机制、构建流程与标准调用方式。读完本文你将掌握如何在 ParlAI 中加载 VisDial 数据、理解其问答与候选答案的表示结构并能够独立运行数据展示与模型训练评估命令。任务概览什么是 VisDialVisDial 是一个关于视觉内容的多轮对话数据集任务。与单轮视觉问答VQA不同它要求 Agent 不仅能回答关于图片的问题还要能结合对话历史维持一段连贯、有意义的对话。ParlAI 的任务注册表中对该任务的描述是Task which requires agents to hold a meaningful dialog about visual content.要求智能体围绕视觉内容进行有意义对话的任务在 parlai/tasks/task_list.py 中VisDial 被注册为任务 IDvisdial标签Visual关联论文arXiv 1611.08669Das et al.2016在 parlai/tasks/visdial/README.md 中它被标记为#VisDial、#All、#Visual三类标签其中#All意味着它属于 ParlAI 收录的通用任务集合#Visual表明其多模态视觉语言属性。数据划分训练 / 验证 / 测试的构造逻辑VisDial 任务在 ParlAI 中的数据划分并不直接对应官方数据集的原始文件而是由 build.py 在构建阶段重新加工而成。核心划分逻辑在_path()函数中体现agents.pyParlAI datatype数据文件后缀关联的 COCO 图片目录trainvisdial_0.9_train_train.jsontrain2014/COCO_train2014_validvisdial_0.9_train_valid.jsontrain2014/COCO_train2014_testvisdial_0.9_val_test.jsonval2014/COCO_val2014_这种划分有两条值得注意的设计验证集从训练集中采样而来。官方 VisDial 0.9 的visdial_0.9_train.zip解压后是完整的训练数据build()会从中以**恒定步长constant stride**抽出 1000 个对话作为验证集同时将这些样本从训练集中删除得到_train.json与_valid.json两个文件build.py。测试集直接使用官方验证集。官方visdial_0.9_val.zip解压出的验证文件被直接重命名为_test.json充当测试集build.py因此testdatatype 对应的图片来自 COCOval2014。构建逻辑中同样定义了数据文件的下载源与完整性校验训练数据https://computing.ece.vt.edu/~abhshkdz/data/visdial/visdial_0.9_train.zipSHA256 为a778d5d3...071290验证数据https://computing.ece.vt.edu/~abhshkdz/data/visdial/visdial_0.9_val.zipSHA256 为08f5ee1d...d6f3960所有文件统一存放在opt[datapath]/VisDial-v0.9/目录下图片则复用 COCO 2014 数据位于opt[datapath]/COCO-IMG-2014/。_path()首先调用build(opt)和buildImage(opt)后者来自 parlai/tasks/coco_caption/build_2014.py确保数据与图片在首次使用时被自动下载构建。Teacher 实现DefaultTeacher 的数据流解析VisDial 的 Teacher 位于 parlai/tasks/visdial/agents.py名为DefaultTeacher直接继承 ParlAI 核心的DialogTeacher。源码注释说明了继承的动机只需实现setup_data迭代器即可免费获得基础指标metrics、act函数以及基于共享内存的 Hogwild 多进程训练支持。初始化阶段__init__中做三件事调用_path(opt)得到数据文件路径与图片前缀路径将数据文件路径写入opt[datafile]设置self.id visdial作为该 Teacher 在对话与指标中的标识。数据加载与 JSON 结构setup_data使用PathManager.open读取 JSONPathManager来自 parlai/utils/io.py可透明支持本地与远程文件系统。VisDial 0.9 的 JSON 顶层结构为visdial[data]包含三个关键字段questions所有问题文本的列表answers所有答案文本的列表dialogs对话列表每个对话包含image_id、caption图片的人工描述以及dialog一问一答序列。对话中每个 QA 对qa通过下标索引引用问题和答案question问题在questions列表中的索引answer正确答案在answers列表中的索引answer_options若干候选答案在answers列表中的索引用于判别式评估如 Rk、Mean Reciprocal Rank。逐轮数据产出规则setup_data对每个对话逐条yield其核心规则是首轮i 0将图片的caption拼接到问题前caption \n question同时返回answer_options和图片路径img_path并标记episode_doneTrue。图片路径按 COCO 命名规范格式化为%012d.jpg12 位补零的 image_id。后续轮次i 0仅返回(question, answer, None, answer_options)不重复携带图片路径episode_doneFalse。这样的设计确保了图片只在每个 episode 的首轮加载一次而对话历史则由DialogTeacher的 episode 机制天然维护——同一个对话内的所有 QA 对属于同一 episode后续问题自动以上下文形式出现。这种caption 作为首轮引导的处理方式正是 VisDial 任务关于图片的多轮对话语义在 Teacher 层的直接体现。图片本身通过_image_loader以 PIL 打开并统一转为 RGB 三通道agents.py方便下游模型或图像特征提取器消费。构建流程下载、切分与版本管理build(opt)build.py遵循 ParlAI 标准的build_data约定以v0.9作为数据版本标记目标目录为opt[datapath]/VisDial-v0.9若目录尚未标记构建完成则检查是否存在旧版本数据并清理随后创建目录依次下载训练与验证 zip 包DownloadableFile会校验 SHA256解压后执行切分逻辑前文所述的 1000 例验证集 验证集转测试集删除原始合并文件最后调用build_data.mark_done(dpath, version)记录版本避免重复构建。从源码结构可以推断该任务严格绑定VisDial v0.9这一代数据集构建目录与文件命名均以0.9为前缀后续的 v1.0 等版本并未在本仓库中提供对应的构建实现。实战在 ParlAI 中使用 visdial 任务在完成 ParlAI 安装参照仓库根目录 README.md 与 setup.py后即可通过标准的parlai命令行工具使用该任务。首次运行会自动触发build()下载数据需联网访问上述数据源。查看数据样例parlai display_data -t visdial该命令会随机展示若干 episode可以看到每个对话首轮包含 caption 引导的问题与图片路径后续轮次为纯文本问答。指定数据划分通过-dt参数选择train、valid或test例如parlai display_data -t visdial -dt valid训练模型可搭配 ParlAI 任意对话模型训练例如基于 Transformer 的生成式模型parlai train_model -t visdial -m transformer/generator \ --image-mode none --model-file /tmp/visdial_model \ --batchsize 32 --num-epochs 10需要说明的是由于 VisDial 是视觉任务完整训练通常还需要配置图像特征如--image-mode使用预训练视觉特征或使用多模态 Agent如 parlai/agents/image_seq2seq。AbstractImageTeacher中支持no_image_model、raw、ascii以及各类预训练视觉模型作为image_mode取值见 parlai/core/teachers.py纯文本场景下可显式传入--image-mode no_image_model。评估模型parlai eval_model -t visdial -dt test -mf /tmp/visdial_modelVisDial 的answer_options设计使其天然支持判别式评估从候选答案中选优这也是该任务与开放式视觉问答的显著差异。小结VisDial 是 ParlAI 中颇具代表性的多模态多轮对话任务数据侧通过构建脚本完成训练集抽样验证集、验证集转测试集的二次切分Teacher 侧则借助DialogTeacher与 episode 机制以首轮拼接 caption 后续纯问题的方式组织多轮问答并通过下标索引高效复用问题与答案词表。理解DefaultTeacher与build.py的实现细节不仅能让你顺畅地运行-t visdial的展示、训练与评估命令也为在 ParlAI 中接入其他多模态对话任务提供了可参照的实现范式。赞分享NLP人工智能深度学习【免费下载链接】ParlAIA framework for training and evaluating AI models on a variety of openly available dialogue datasets.项目地址https://gitcode.com/gh_mirrors/pa/ParlAI点击查看免费下载相关推荐Kilo Code 快速上手2 分钟装好用内置角色跑通第一个任务Kilo Code 快速上手2 分钟装好用内置角色跑通第一个任务 你正盯着五个要联动的文件改不动这正是 Kilo Code 这款开源 AI 编码代理要接住NLP人工智能深度学习NVIDIA显卡色彩校准指南5分钟解决广色域显示器色彩失真问题NVIDIA显卡色彩校准指南5分钟解决广色域显示器色彩失真问题 你是否曾经遇到过这样的困扰精心设计的图片在不同显示器上呈现完全不同的色彩游戏中的夕阳看起来NLP人工智能深度学习ParlAI 中的 WikiQA 任务从数据构建到 Teacher 实现的开放域问答实战指南ParlAI 中的 WikiQA 任务从数据构建到 Teacher 实现的开放域问答实战指南 WikiQA 是一个基于 Wikipedia 构建的开放域问答NLP人工智能深度学习上一篇5个提升效率的macOS鼠标优化工具开源方案让指针操控如丝般顺滑下一篇SumatraPDF新手攻略3步掌握高效阅读技巧附配置技巧创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表