ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

初识InternVideo:上海AI实验室五代视频基础模型系列的完整入门指南

初识InternVideo:上海AI实验室五代视频基础模型系列的完整入门指南 初识InternVideo上海AI实验室五代视频基础模型系列的完整入门指南【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo 是上海AI实验室OpenGVLab开源的视频基础模型Video Foundation Models系列面向多模态视频理解场景一个仓库里完整收录了从 InternVideo1 到 InternVideo-Next 五代模型的代码、脚本与配套数据集 InternVid。无论你是想学习视频理解的前沿方法还是想快速上手视频动作识别、视频检索、长视频问答等任务这份入门指南都能帮你在最短时间内摸清整个系列的来龙去脉。5 代视频基础模型一个仓库全都有InternVideo 系列的核心演进路线可以概括为从视频自监督预训练到视频-文本对比学习再到视频多模态大模型MLLM最终走向长时程智能体推理。每一代都独立成包自带模型、配置和训练脚本互不干扰。代号发布时间一句话定位代码目录InternVideo12023.01生成式 判别式学习的通用视频基础模型InternVideo1/InternVideo22024.04规模化Scaling多模态视频理解InternVideo2/InternVideo2.52025.01长视频 丰富上下文建模的视频 MLLMInternVideo2.5/InternVideo32026.06多模态情境推理 长时程视频智能体InternVideo3/InternVideo-Next2025.12无视频-文本监督的通用视频基础模型InternVideo-Next/各代的详细说明见根目录 README.md完整时间线Updates也记录在其中。InternVideo1视频基础模型的开山之作初代 InternVideoECCV 2024首次系统性地证明了生成式掩码视频建模 判别式视频-语言对比学习两条路线协同能显著提升下游视频任务表现。发布时即在 39 个视频基准上取得 SOTAKinetics-400 Top-1 达 91.1%。目录组织非常清晰详见 InternVideo1/README.mdPretrain/预训练模型全家桶包括 VideoMAE掩码视频自编码器、ViCLIP可迁移的视频-文本对比学习和 UniFormerV2时空学习Downstream/下游任务实现涵盖视频-文本检索、开放集动作识别、时空动作定位、时间动作定位、视觉语言导航等UniFormerV2 的框架设计如下图所示展示了如何用时空注意力武装图像 ViTInternVideo2规模化之后的性能飞跃InternVideo2 是系列的分水岭采用双分支架构单模态分支single_modality/纯视频编码器Kinetics-400 达 92.1%发布时刷新 60 视频/音频任务 SOTA多模态分支multi_modality/视频编码器 文本编码器 音频分支的 CLIP 式对比学习对新手友好的几个特点模型谱系完整S14 / B14 / L14 / 1B / 6B 多种规格小模型由 1B 蒸馏而来消费级显卡也能微调详见 MODEL_ZOO.md提供现成评估脚本如 scripts/evaluation/clip/ 下的零样本检索评测配套自标注音频-视觉-语音数据支撑音视频多模态任务InternVideo2.5让视频 MLLM 看得更长、更细InternVideo2.5 构建于 InternVL2.5 之上核心贡献是长且丰富上下文LRC建模通过密集视觉任务标注 直接偏好优化TPO让模型感知视频细节通过自适应层次化 token 压缩HiCo把视频时空表示压缩得更紧凑结果是模型可以记忆的视频长度提升 6 倍以上在 MVBench、MLVU、VideoMME 等长视频基准上大幅领先数据见 InternVideo2.5/README.md。InternVideo3从一问一答到智能体式长视频理解最新的 InternVideo3 把视频理解重新定义为证据积累 → 信念更新 → 工具交互 → 验证的闭环过程两个核心创新值得关注多模态情境推理MCR把观察、指令、中间推理、工具动作、反馈和记忆放在同一个演化的上下文中多模态多头潜空间注意力M²LA压缩 KV-Cache 的同时保留完整多模态 token 流让超长视频推理变得可行架构总览如下来自 InternVideo3/README.md已开源 8B 指令模型覆盖长视频、短视频、时间定位和空间推理基准与主流开源 8B 模型的对比见下图InternVideo-Next告别视频-文本监督2025 年底发布的 InternVideo-Next 探索了一条新路线不用视频-文本配对数据仅靠纯视频信号训练通用视频基础模型目标是获得更本质的世界理解能力。代码极为精简核心架构在 InternVideo_next.py两阶段预训练入口分别是 main_stage1.py 和 main_stage2.py训练脚本在 exp/base/pretrain/。数据基石InternVid 230M 视频-文本数据集好的模型离不开好的数据。Data/InternVid/ 是配套的大规模视频-文本数据集ICLR 2024 Spotlight完整版本包含2.3 亿视频-文本对视频来自 16 个热门类别覆盖英、美、日、韩、中、法等多个语言地区保证多样性85% 为 720P 高清内容切分后 85% 的片段时长在 0–10 秒提供 ViCLIP 模型训练示例还有 demo.ipynb 手把手教你推理此外Data/instruction_data/ 还发布了 11K 条视频指令微调数据用于训练 VideoChat 这类端到端视频多模态对话系统其详细视频描述指令格式如上图所示。新手快速上手仓库结构与第一条命令整个仓库的结构在 CLAUDE.md 中有清晰说明每个子项目都自带独立的 README、依赖文件和脚本你只需要关注自己要用的一代即可。以 InternVideo2 为例上手三步走第一步克隆仓库git clone https://gitcode.com/OpenGVLab/InternVideo第二步安装依赖cd InternVideo2/single_modality pip install -r requirements.txt第三步找到你需要的脚本目标入口文件预训练run_pretraining.py微调run_finetuning.py线性探测run_linear_probing.py蒸馏run_distill.py 提示训练脚本默认面向 SLURM 集群单机使用时需自行调整scripts/下的启动方式数据路径通过环境变量INTERNVIDEO2_DATA_PATH和INTERNVIDEO2_MODEL_PATH指定。如果你只想做评测而不是训练InternVideo3 提供了开箱即用的评测脚本集合 InternVideo3_eval/scripts/覆盖 MVBench、LongVideoBench、VideoMME、MMMU 等主流视频理解基准每个基准都有独立的eval_*.sh入口。新手常见问题Q我该从哪一代模型开始看想学原理看 InternVideo1结构最经典想拿现成能力用 InternVideo2生态最成熟想做视频问答/长视频直接用 InternVideo2.5 或 InternVideo3 的开源权重。Q没有大显卡能玩吗可以。InternVideo2 提供由 1B 蒸馏的 S/B/L 小模型多模态分支还有基于 MobileCLIP 的小型 VideoCLIP规格列表见 multi_modality/MODEL_ZOO.md。Q想参与讨论或提建议项目团队维护了微信交流群入口在根 README.md 的 Contact 部分欢迎加入交流部署与训练中的问题。总结InternVideo 系列用五年时间走出了一条清晰的路径自监督视频建模 → 规模化多模态对比学习 → 视频 MLLM 长上下文 → 智能体式长视频推理。五个目录、一条演进主线、一个 230M 数据集构成了视频基础模型领域少见的完整开源全家桶。建议按本文顺序通读各代 README配合 Data/InternVid/ 的数据文档你很快就能建立起对整个视频理解技术栈的系统认知 【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表