Vit和VideoMAE
Vit Vision Transformer 视觉TransformerVideoMAE Video Masked Autoencoders 视频掩码自编码器是对Vit在视频上的进化。传统工业视觉单独使用 ViT / VideoMAE大模型时代作为 LLM 的视觉 Encoder两者用途完全不同是两种模型的神经架构。一、单独使用 ViT在工业上最常见业务是什么先说结论ViT 单独使用最多的不是普通图片分类而是需要“高级视觉理解”的任务。普通分类猫/狗/汽车CNN已经很好。ViT真正发挥优势的是大规模视觉理解图像检索医疗影像遥感自动驾驶工业检测1. 图像分类早期主要用途最早 ViT 就是为了 ImageNet 分类提出的。流程图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别例如ImageNet狗 猫 汽车 飞机代表模型ViTGoogle原始版本ViT-B/16ViT-L/16ViT-H/14但是现在工业分类很多仍然用ResNetEfficientNetConvNeXt原因CNN更快更省算力小数据效果好2. 工业视觉检测非常重要例如工厂检测PCB缺陷芯片缺陷产品瑕疵以前CNN图片 | ResNet | 分类现在ViT图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断优势可以捕获长距离关系。例如PCB一个地方的小缺陷可能和远处线路有关。常用模型Swin Transformer工业视觉非常常见。原因纯ViT Attention计算量大。Swin窗口Attention更适合高分辨率图片。3. 图像检索非常重要例如淘宝搜同款。输入鞋子图片图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品常用CLIP ViTDINOv2EVA4. 医疗影像例如CTCT切片 ↓ ViT ↓ 疾病判断MRI脑部影像 ↓ Transformer ↓ 病灶分析因为医疗图像需要全局关系。5. 自动驾驶例如摄像头Camera ↓ ViT/Swin ↓ 环境理解识别车辆行人道路Tesla、Waymo路线大量使用Transformer视觉。二、单独使用 VideoMAE在工业上最常见业务是什么VideoMAE定位视频理解Video Understanding不是生成视频。1. 视频行为识别最直接你的 UCF101 就属于这个。例如监控检测打架摔倒奔跑入侵流程视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警代表模型VideoMAEMCG-NJU经典。2. 视频搜索例如视频网站搜索“一个人在滑雪的视频”系统视频↓VideoMAE↓视频Embedding↓向量数据库↓搜索。3. 视频监控分析工业非常大。例如智慧城市摄像头人流 车辆 异常事件VideoMAE理解时间变化。4. 体育分析例如足球球员动作战术分析篮球投篮动作防守动作5. 机器人机器人需要理解环境变化。例如机器人看到人拿杯子。Video Encoder提取动作变化。三、单独 VideoMAE 工业常用模型有哪些目前主要① VideoMAE最经典。特点自监督预训练。模型VideoMAE BaseVideoMAE LargeVideoMAE Huge② VideoMAE V2更大规模。适合大数据训练。③ Video Swin Transformer工业应用很多。结构视频版Swin。④ MViTMultiscale Vision Transformer。Meta提出。特点多尺度视频理解。⑤ SlowFast虽然不是Transformer但是工业仍大量使用。Meta提出。视频行为识别经典。四、现在进入大模型时代LLM里面最常用的Vision Encoder是什么这个和单独视觉完全不同。现在LLM需要的不是分类器而是“视觉Token生成器”。1. 图片LLM最常用Vision Encoder第一梯队CLIP ViT目前最经典。例如LLaVA结构CLIP ViT-L/14 ↓ Projector ↓ LLaMA用途图片问答。SigLIPGoogle提出。现在很多新模型使用。例如Gemini相关路线。优势比CLIP训练方式改进。EVA-CLIP国内外很多视觉大模型使用。特点更强视觉能力。InternViT商汤/InternVL路线。例如InternVLInternViT LLM2. 视频LLM最常用Video Encoder这里目前比图片复杂。因为视频成本巨大。常见InternVideo非常热门。结构Video Encoder ↓ LLMVideoMAE很多研究使用。例如VideoMAE ↓ LLMVideo Swin Transformer也是常见。CLIP逐帧 时间模型工业也很多Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM原因计算便宜。五、单独模型 vs LLM视觉Encoder 对比单独ViTLLM视觉Encoder目标完成视觉任务给LLM提供视觉理解输出分类/特征视觉Token后面有没有LLM没有有训练目标分类/自监督视觉语言对齐例子ImageNetGPT-4V、LLaVA六、你作为音视频工程师最相关路线结合你的方向视频分析例如摄像头异常检测推荐RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警AI数字人/视频生成不是VideoMAE。路线语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频视频大模型未来路线视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频最后总结一句单独使用ViT图片理解、检索、工业检测、医疗、自动驾驶。最常见模型ViTSwin TransformerDINOv2CLIP ViTVideoMAE视频理解、行为识别、监控分析、视频搜索。最常见模型VideoMAEVideoMAE V2Video Swin TransformerMViT在LLM里面图片CLIP ViT、SigLIP、EVA-CLIP、InternViT视频InternVideo、VideoMAE、Video Swin、CLIPTemporal Transformer