ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

深度解析从RAG到多模态RAG,收藏这一篇就够了!!!

深度解析从RAG到多模态RAG,收藏这一篇就够了!!! 前言如果说2023年见证了大语言模型的“寒武纪大爆发”那么2024年则是多模态大模型“元年”。GPT-4o的出现让大家见识到多模态能力引入给下游应用生态带来的巨大改变。随之而来的RAG技术也将逐渐从单语言模态的RAG进化到多模态RAG。本文将带大家速览多模态RAG技术的原理及实现。什么是RAG什么是RAGRetrieval Augmented Generation检索增强生成。是一种结合了信息检索技术和大型语言模型提示功能的框架。它通过从数据源检索信息来辅助LLM生成答案提高了模型在知识密集型任务中的准确性和可信度。我们为什么需要RAG大型语言模型通常基于固定的历史数据集进行训练这意味着它们的知识是过时的无法涵盖最新的信息或特定领域的专业知识。RAG的目的是通过引入额外知识库检索其中的相关信息并根据检索结果给予用户回答。这也可以显著减少大模型因为并不具备相关知识而出现的“幻觉”现象。当然我们也可以直接把整个数据库作为LLM的prompt输入但由于transformer架构O(N2)复杂度的限制LLM支持的最长输入长度通常有限多数支持到128k token已经是极限使得在面临更长知识库输入时RAG依然是当下唯一可行的解决方案。如何实现RAG在实际应用时我们常需要给定一系列文档并使用RAG方法让LLM针对这些文档进行检索与交互。RAG的实现主要包含以下几个步骤数据准备阶段包括数据提取、分块chunking、向量化embedding、数据入库等环节。数据提取涉及将不同格式的数据如PDF、Word、数据库等处理为统一的格式。分块是将大文档分割成较小的、语义完整的单元以便于后续处理和检索。检索阶段系统根据输入查询检索相关文档或信息。这个阶段依赖于搜索算法和索引方法来快速识别大量集合中最相关的数据。增强阶段将用户查询和检索到的额外上下文放入一个提示模板中以增强提示。生成阶段使用大型语言模型来针对检索结果生成对用户的回复。走向多模态RAG从RAG的应用可以看出多数时候我们需要把一些文档作为RAG的输入用于检索和生成。而现实应用中文档通常是以图文交错的形式存在的比如网页、PDF、PPT文件等等。通常的做法是只保留文档中的文本信息。对于PDF文档则进行OCR文字识别读取其中的文本。但这样会导致大量图片中至关重要的信息被丢失以及很多结构化内容的错乱比如标题、表格、页眉页脚等格式错乱。改进的做法是把所有模态信息都转换为纯文本再进行RAG。我们可以使用多种计算机视觉模型比如检测模型对文档结构进行识别然后对文档中不同的模块使用不同的“广义OCR模型”进行解析。比如对于文本段落使用OCR模型进行文本识别对于表格可以用表格模型进行识别转换为Markdown或LaTeX文本对于公式则套用公式识别转换为LaTeX对于图片则可使用多模态大模型如GPT-4o进行文本解读caption保存为文本描述。有很多开源的工具可以完成这些事情比如MinerU等。通过解析算法多模态数据就被完全转换为纯文本的格式了也就可以照葫芦画瓢套用纯文本的RAG方法了。我们注意到使用上述的方法信息不可避免会存在丢失而且依赖过多的解析模型。而时间来到2024年多模态大模型实现了爆发式的技术突破高分辨率的视觉输入已经取得了巨大突破使用单一的多模态大模型做广义OCR也变得非常容易。比如QWen2-VL以及InternVL-2等开源多模态大模型在文档的广义OCR上都有非常好的效果。多模态大模型成功让端到端end-to-end的算法已经成为了主流。原生多模态的RAG算法也成为了可能既然多模态大模型有能力理解文本那我们其实即无需再把图像转换为文本而可以直接使用图像提取embedding去做RAG。即从图(a)转变为图(b)的模式DSEhttps://arxiv.org/abs/2406.11251DSE即Document Screenshot Embedding是一个不使用广义OCR的多模态RAG方法直接把原始文档的扫描图片切片后使用视觉语言模型的编码器编码。其对query和docunment使用了双编码的架构。验证了这一想法的可行性。ColPalihttps://arxiv.org/abs/2407.01449ColPali架构也是利用视觉语言模型来从文档页面的图像中产生高质量的上下文化嵌入。ColPali使用了延迟交互late interaction技术大大提高了检索效率同时在检索性能上超越了现有的文档检索系统并且具有更快的处理速度和可端到端训练的特点。上图对比了传统的文档RAG与多模态RAG的区别。因为减少了广义OCR的解析过程使得处理速度也有了质的提升。CoPali其实从名字上看就知道灵感来源于两个工作PaliGemma和CoBERT。PaliGemma 是 Google 开发的一款具有多模态功能的视觉语言模型它结合了视觉模型 SigLIP 和大型语言模型 Gemma。“Col” 则来自于ColBERT 的延迟交互编码器。ColPali 算是延迟交互编码器在多模态 RAG 检索的应用并且极大提高了检索召回的精度。延迟交互编码结合了双编码器和交叉编码器的优点。在这种架构中query和文档被分别编码成独立的embedding集合然后通过一个高效的交互机制来计算它们之间的相似度。延迟交互编码的核心思想是将查询和文档的编码过程分开这样文档的编码可以离线完成而查询的编码则在在线阶段进行。这种方法的优点是可以在查询时仅对查询进行编码从而大大提高了处理速度。此外由于文档的编码是预先完成的可以将其存储在数据库中这样就可以对更多的文档进行排序从而提高查询的精度。在延迟交互编码中一个关键的计算是最大相似性MaxSim函数它计算每个查询Token向量与所有文档Token向量之间的相似度并跟踪每个查询Token的最大得分。查询和文档的总相似度分数是这些最大余弦相似度分数的总和。这种方法允许模型在保持较高排序质量的同时也具备较高的性能。随着多模态大语言模型能力的增强以它为基础的多模态RAG也早已突破了传统的图像检索的应用方式而是真正具备大规模非结构化多模态数据深度理解的能力将会有更多toB的商业应用价值。最后唠两句为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200% 远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。那0基础普通人如何学习大模型 深耕科技一线十二载亲历技术浪潮变迁。我见证那些率先拥抱AI的同行如何建立起效率与薪资的代际优势。如今我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理分享于此为你扫清学习困惑共赴AI时代新程。我整理出这套 AI 大模型突围资料包【允许白嫖】✅从入门到精通的全套视频教程✅AI大模型学习路线图0基础到项目实战仅需90天✅大模型书籍与技术文档PDF✅各大厂大模型面试题目详解✅640套AI大模型报告合集✅大模型入门实战训练这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图0基础到项目实战仅需90天全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤640套AI大模型报告合集⑥大模型入门实战训练如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】
返回列表