ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

LLaVA-v1.5-13B训练数据揭秘:558K图文对+158K GPT指令数据如何塑造多模态指令跟随能力

LLaVA-v1.5-13B训练数据揭秘:558K图文对+158K GPT指令数据如何塑造多模态指令跟随能力 LLaVA-v1.5-13B训练数据揭秘558K图文对158K GPT指令数据如何塑造多模态指令跟随能力【免费下载链接】llava-v1.5-13b项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/llava-v1.5-13bLLaVA-v1.5-13B是 2023 年 9 月训练完成的一款开源多模态大语言模型通过 558K 图文对与 158K GPT 生成的多模态指令跟随数据对 LLaMA 213B大语言模型进行微调让模型能够看懂图片、听懂指令、输出文字。本文完整拆解它的训练数据配方、模型文件构成与核心架构参数帮助新手快速理解这套多模态指令跟随能力是如何炼成的。一、LLaVA-v1.5-13B 是什么图文对话模型一句话速览简单说LLaVALarge Language and Vision Assistant是一个开源的多模态聊天机器人底子基于 Transformer 架构的自回归语言模型LLaMA/Vicuna眼睛CLIP 视觉编码器负责把图片变成视觉特征翻译官MLP 投影器mm_projector把视觉特征翻译成大模型能理解的词向量大脑130 亿参数13B的语言模型负责理解指令并生成回答它的定位是研究与爱好者用途适合计算机视觉、NLP、机器学习方向的研究者和极客用来探索多模态大模型LMM的指令跟随能力。二、训练数据大揭秘4 大数据源、110 万样本配方官方在README.md中披露了 LLaVA-v1.5-13B 的完整训练数据构成这是理解其能力的钥匙 ️数据源规模核心作用过滤后的 LAION/CC/SBU 图文对BLIP 生成描述558K图文对齐的地基让模型认识图片内容GPT 生成的多模态指令跟随数据158K能力核心学会看图执行指令学术任务导向的 VQA 数据混合集450K任务能力视觉问答、定位、理解ShareGPT 数据40K对话风格让回复更像真实人类交流四类数据合计约110 万条各有分工1. 558K 图文对多模态指令跟随的地基这批数据来自 LAION、Common Crawl、SBU 等公开图像集并经过筛选过滤配文由BLIP模型自动生成的描述。它的价值在于覆盖面广、场景多样让模型建立像素 → 语义的基础映射——看懂图是一切指令跟随能力的前提。2. 158K GPT 指令数据指令跟随能力的关键这是 LLaVA 区别于普通图文模型的核心配方直接用 GPT 为图片批量生成指令—回答对。相比人工标注成本低无需海量人工标注多样性强指令覆盖描述、推理、改写、问答等多种任务类型格式统一模型学到的指令跟随模式更一致这就是标题中158K GPT 指令数据如何塑造多模态指令跟随能力的答案所在——用大模型的能力去喂多模态模型让其学会按指令处理图像3. 450K 学术 VQA 40K ShareGPT补短板450K 学术任务 VQA 数据提升视觉问答、目标定位等考试型任务表现40K ShareGPT 纯文本对话数据则防止模型偏科保持流畅自然的语言风格三、模型文件结构速览下载后能看到什么拉取仓库后你会看到以下核心文件pytorch_model.bin.index.json显示权重总量约26.1 GB文件说明config.json模型架构配置40 层 Transformer、隐藏维度 5120、词表 32000、最大序列 4096generation_config.json生成参数配置最大生成长度 4096pytorch_model-00001-of-00003.bin~00003-of-00003.bin13B 大语言模型权重分 3 个分片存储float16 精度pytorch_model.bin.index.json权重索引记录每个参数所在的分片文件mm_projector.bin多模态投影器权重视觉特征到语言空间的翻译官tokenizer.model/tokenizer_config.jsonLlama 分词器及其配置BOS 为s、EOS 为/sspecial_tokens_map.json特殊 token 映射表README.md模型卡片训练数据、评测基准、许可信息从config.json还能读出几个关键架构细节视觉塔openai/clip-vit-large-patch14-336视觉隐藏维度 1024投影器mlp2x_gelu两层 MLP GELU 激活语言模型40 层、40 个注意力头、FFN 中间维度 13824RMSNorm SiLU四、能力验证12 个评测基准官方对 LLaVA-v1.5-13B 进行了系统性评测覆盖12 个基准5 个学术 VQA 基准考察经典视觉问答能力7 个面向指令跟随多模态大模型LMM的新基准考察看图办事的真实水平这也解释了数据配方的逻辑558K 图文对打基础 → 158K 指令数据练核心 → 450K VQA 冲任务分 → 40K ShareGPT 保对话体验。五、如何获取并开始使用1. 获取模型git clone https://gitcode.com/hf_mirrors/ai-gitcode/llava-v1.5-13b2. 部署前须知显存需求float16 权重约 26 GB单卡部署建议 24GB 以上显存或采用量化如 4bit/8bit降低门槛许可证底层 LLaMA 2 采用 LLAMA 2 Community License商用前请确认许可条款适用人群多模态大模型与聊天机器人方向的研究者、爱好者3. 上手路径建议先读README.md了解模型定位与数据构成检查config.json确认硬件与显存匹配下载 3 个权重分片 mm_projector.bin后加载模型从描述这张图片类指令开始测试再逐步尝试复杂指令跟随任务六、常见问题 FAQQ1LLaVA-v1.5-13B 和纯文本大模型有什么区别它多了视觉输入通道图片经 CLIP 编码后由 MLP 投影器转换与文本 token 一起送入语言模型因此能完成看图回答、按指令处理图像等多模态任务。Q2为什么训练数据里只有 158K 指令数据效果却这么好因为指令数据由 GPT 批量生成覆盖了描述、推理、改写等多种任务类型且模型先通过 558K 图文对完成了图文对齐指令数据事半功倍。Q3这套模型适合本地部署吗适合有 24GB 显存如 4090或愿意量化部署的用户若显存有限可优先考虑更小的 LLaVA 版本或量化方案。一句话总结LLaVA-v1.5-13B 的多模态指令跟随能力 558K 图文对打底 158K GPT 指令数据点睛 490K VQA/对话数据补强。理解这份数据配方你就理解了 2023 年那波开源多模态大模型浪潮中最经典的设计思路之一。【免费下载链接】llava-v1.5-13b项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/llava-v1.5-13b创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表