ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

MLPerf 发布端到端 RAG 推理基准

MLPerf 发布端到端 RAG 推理基准 MLCommons MLPerf Inference 工作组推出首个端到端检索增强生成RAG推理基准。通过在查询时从检索文档而非仅模型权重中生成答案RAG 显著降低幻觉同时利用最新私有知识已成为语言模型最常见的部署方式之一。RAG 生产系统通常由多个模型组成形成检索文档并推理生成答案的完整管道。该基准完整测量这一流程包含两个工作负载。端到端 RAG 的意义RAG 因能从查询时检索的文档中获取答案而日益流行。它减少幻觉、保持答案时效性并让通用模型利用训练时未见过的专有知识。由于 RAG 是多组件系统其性能源于各组件的协同而非单一模型。单模型 LLM 基准无法捕捉管道级行为也无法暴露多模型联合优化的机会。该基准还为智能体 AI 基准铺路其多模型服务挑战正是未来基准的起点。优化空间包括模型放置将不同规模模型映射到不同加速器共驻通过内存分区共享设备多阶段调度跨异构加速器实现宏微批处理前缀缓存复用多跳共享前缀以降低计算数据集与任务基准基于 FRAMES 多跳查询数据集包含 824 个查询、2515 篇维基百科文章和约 107000 个 768 字符段落。示例多跳查询需要跨三篇文章链式推理才能得出答案。图 1多跳 E2E RAG 示例摄取与问答管道基准包含两个独立管道摄取管道e2e-rag-db一次性构建向量数据库问答管道e2e-rag-qna执行端到端评分。图 2E2E RAG 摄取与问答管道摄取流程包括解析、切分、嵌入与 FAISS HNSW 索引。问答流程则通过查询重写器、嵌入器、检索器、重排序器、文档评分器与充分性检查器迭代完成多跳推理。本文首发于赢政天下(https://www.winzheng.com/article/barret-zoph-joins-google)获取更多深度技术内容与资源欢迎访问官网。
返回列表