ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

DeepEval 快速上手指南:5 分钟跑通 30+ 项 LLM 评测指标

DeepEval 快速上手指南:5 分钟跑通 30+ 项 LLM 评测指标 DeepEval 快速上手指南5 分钟跑通 30 项 LLM 评测指标【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval你在调 LLM 应用时有没有遇到过这种困境换了一版 Prompt客服机器人的回答是变好了还是变差了只能靠人肉抽几条对话凭感觉判断。这种凭感觉上线的状态在金融、医疗等对准确性有硬性要求的场景里尤其危险。DeepEval 是一个开源的 LLM 评测框架当前版本 4.2.0支持 Python 3.9定位类似专门给 LLM 应用写的 Pytest你定义测试用例和评测指标它用 LLM-as-a-judge用一个大模型当裁判来打分等本地运行的方法给你的回答质量打出 0–1 的分数。所有评测流程都在你机器上执行敏感数据不用出内网也省去了为每次裁判调用额外付费的成本。它是什么一个给 AI 应用做单元测试的框架传统软件测试验证程序有没有按预期运行而 LLM 应用的输出天然是非确定性的——同一个问题模型每次回答的措辞都不同。DeepEval 解决的核心问题就是如何把回答得好不好变成一个可量化、可回归、可进 CI 的标准流程。几个关键定位本地化评测评测指标依赖的裁判模型和 NLP 模型在本地运行数据零出境满足合规要求端到端 组件级既可以把整个应用当黑盒测也可以只测其中一次 LLM 调用、一次工具调用、一次检索指标体系覆盖广从 RAG 忠实度到 Agent 任务完成度再到多模态与语音deepeval/metrics/ 下有 50 个开箱即用的指标框架无关不管你的应用是 OpenAI SDK、LangChain 还是 CrewAI 写的都能接入5 分钟先跑起来安装 DeepEval 并写出第一个测试安装只需一条命令DeepEval 本身就是个 pytest 插件pip install -U deepeval export OPENAI_API_KEY你的API Key deepeval test run test_chatbot.py最小可运行示例假设你有一个 RAG 客服机器人新建test_chatbot.pyimport pytest from deepeval import assert_test from deepeval.metrics import GEval from deepeval.test_case import LLMTestCase, SingleTurnParams def test_case(): correctness_metric GEval( nameCorrectness, criteria判断 actual output 是否符合 expected output, evaluation_params[SingleTurnParams.ACTUAL_OUTPUT, SingleTurnParams.EXPECTED_OUTPUT], threshold0.5, ) test_case LLMTestCase( input鞋子不合脚怎么办, actual_output30 天内可无理由全额退款。, expected_output30 天内可免费全额退款。, retrieval_context[所有客户享有 30 天免费全额退款。], ) assert_test(test_case, [correctness_metric])运行deepeval test run test_chatbot.py测试通过即代表得分超过阈值0.5。这里GEval是一个万能裁判你给一段自然语言评分标准criteria它就能按这个标准打分不需要为每种业务指标单独开发。更多起步细节可参考 官方入门文档 和 示例文件。核心能力拆解30 指标按场景分组速查所有指标得分都在 0–1 之间配合threshold决定测试通过与否。按下表选型指标组代表指标评测什么典型场景自定义标准GEval、DAGMetric任意你描述的标准DAG 用有向无环图拆解判定步骤更确定通用回归测试RAG 检索问答Faithfulness、AnswerRelevancy、ContextualRecall / Precision / Relevancy、RAGAS回答是否忠实于检索上下文、是否与问题相关、检索质量如何知识库问答、客服Agent / 工具调用TaskCompletion、ToolCorrectness、GoalAccuracy、StepEfficiency、PlanAdherence任务是否完成、工具与参数是否正确、有没有绕弯路智能体应用多轮对话TurnRelevancy、KnowledgeRetention、ConversationCompleteness、RoleAdherence跨轮次的一致性、角色是否跑偏聊天机器人安全与合规Toxicity、Bias、PIILeakage、NonAdvice、Misuse、RoleViolation有害内容、偏见、隐私泄露、越界建议内容审核、合规审计格式与结构JsonCorrectness、ExactMatch、PatternMatch结构化输出是否符合 schemaAPI 接口、抽取任务多模态与语音TextToImageMetric、ImageCoherence、VoiceNaturalness 等图像生成质量、图文一致性、语音自然度文生图、语音助手除了指标框架还自带三类生产力能力合成数据集生成deepeval/synthesizer/支持从文档自动生成单轮/多轮评测数据解决没有足够测试集的问题基准测试10 行代码以内即可让任意 LLM 跑 MMLU、HumanEval、GSM8K 等公开基准见 基准测试文档方便横向对比模型Prompt 自动优化deepeval/optimizer/能基于评测结果自动改写 Prompt 并迭代接入你的工作流本地模型、框架集成与 CI/CD裁判模型可自选也支持纯本地。每个指标都接受model参数deepeval/models/下内置了 OllamaModel、LocalModel指向任意 OpenAI 兼容端点、OpenAIModel、AnthropicModel、GeminiModel、AmazonBedrockModel、LiteLLMModel、DeepSeekModel 等 13 种适配器。用 Ollama 跑本地裁判数据全程不出机器例如构造一个OllamaModel(modelllama3.2:3b)传给AnswerRelevancyMetric(modellocal_model)即可主流框架都有现成集成。deepeval/integrations/ 覆盖 LangChain / LangGraph回调处理器、Pydantic AI、CrewAI多智能体、OpenAI 与 OpenAI Agents客户端封装、LlamaIndexRAG、Anthropic、Google ADK、AWS AgentCore 等。接入后调用链会被自动追踪可以直接对完整轨迹做评测。进 CI/CD 只需 pytest 命令。DeepEval 以 pytest 插件形式注册测试写成标准的test_*.py在流水线里跑deepeval test run就能出结果失败项会阻塞发布——评测从此成为和单元测试同级的质量门禁。落到具体业务三个典型场景的问题→做法场景一金融客服的幻觉与合规风险问题模型回答流畅但利率、费率是编的还可能在回答里带出用户手机号等隐私信息。做法用忠实度 相关性 隐私三指标组合卡关from deepeval import assert_test from deepeval.metrics import FaithfulnessMetric, AnswerRelevancyMetric, PIILeakageMetric from deepeval.test_case import LLMTestCase case LLMTestCase( input这款理财产品的年利率是多少, actual_output当前年利率为 3.2%。, retrieval_context[产品 A 年利率 3.2%起购 1 万元。], ) assert_test( case, [FaithfulnessMetric(threshold0.8), AnswerRelevancyMetric(threshold0.7), PIILeakageMetric()], )Faithfulness 会逐句核对回答能否被retrieval_context支撑编造的数字直接扣分。场景二Agent 应用失败了但不知道哪一步坏的问题智能体最终没完成任务但中间经历了十几步工具调用人工排查成本极高。做法给应用函数加上observe()装饰器来自 deepeval/tracing/DeepEval 会记录完整的模型决策与工具调用轨迹然后叠加TaskCompletionMetric是否达成目标、ToolCorrectnessMetric是否调对了工具、传对了参数、StepEfficiencyMetric有没有多余步骤把黑盒失败拆成可定位的具体环节。场景三多轮聊天机器人的失忆与角色漂移问题对话进行到第 5 轮机器人忘了前文约定的约束语气也从专业顾问变成了闲聊搭子。做法用多轮指标KnowledgeRetentionMetric事实信息跨轮次保留RoleAdherenceMetric全程角色一致性TurnRelevancyMetric每轮回答的相关性对整段会话打分而不只是看单轮输出。从能用用到好用四个进阶方向轨迹级评测trajectory-based evals不只评最终答案而是对 Agent 的完整路径打分。用dataset.evals_iterator(metrics[...])把同一数据集反复灌入应用每次运行自动采集轨迹并评测适合持续回归详见 轨迹评测文档自定义指标继承BaseMetric位于deepeval/metrics/base_metric.py实现打分逻辑后即可与整个评测生态无缝集成——业务特有的合规话术检查这类需求都能自己写并行与规模依赖 pytest-xdist加-n auto即可多进程并行跑大规模测试集指标本身支持异步执行Prompt 自动调优闭环把评测得分反馈给deepeval/optimizer/的 Prompt 优化器让它基于结果自动改写 Prompt形成评测→优化→再评测的闭环周边生态与路线TypeScript 同构实现仓库内typescript/目录提供了 JS/TS 版本的核心能力前端或 Node 侧也能接平台与 MCP配套的 Confident AI 平台提供数据集管理、实验对比、生产环境监控等 UI 能力也可通过 MCP 服务把评测当作标准层调用持续演进方向多模态指标图像/语音与 MCP 评测MCP Task Completion、MCP Use是近几个版本的重点新增说明框架正从评文本走向评一切 LLM 产物落地路线图你接下来要做的 5 步装框架、跑通样例pip install -U deepeval照着 examples/getting_started/test_example.py 跑一次deepeval test run确认环境没问题选 2–3 个指标按前面能力拆解表格结合你的业务场景RAG 选 Faithfulness 系Agent 选 TaskCompletion 系攒评测集手工整理 30–50 条真实用户问题不够就用合成数据生成器从你的文档批量造接入现有流程把评测脚本放进 CI设定阈值作为发布门禁让Prompt 漂移在合并前就被拦下建立迭代节奏每次改 Prompt、换模型后重跑同一数据集对比得分变化把评测报告作为决策依据而不是感觉评测不是一次性的项目而是和你应用同寿命的质量基础设施。今天花 5 分钟跑通第一个测试就是这条路上最划算的一步 【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表