
3个步骤打通DeepEval 与 LangChain 集成教程上线前不漏掉工具调用错误【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval机器人答非所问时你很难说清是模型本身不行还是工具选错、检索没跟上。把 DeepEval 挂到 LangChain 上就能把每次调用拆成可打分的 span问题定位到具体一步。不接评估上线前会漏掉什么工具选错、参数传歪测试阶段发现不了。回答编造事实人工抽检才暴露。多轮对话中途跑偏回归时没有基线可比。一条命令装好依赖pip install deepeval langchain-core langchain-community装完即可在 LangChain 运行期挂回调、离线跑评估无需改写应用结构。挂上回调跑一次最小评估from deepeval.integrations.langchain import CallbackHandler from deepeval.metrics import ToolCorrectnessMetric from deepeval.test_case import LLMTestCase from deepeval import evaluate handler CallbackHandler() # 追踪 LangChain 的每次运行 test_case LLMTestCase( input什么是糖尿病, actual_outputagent.invoke(什么是糖尿病), # 走带回调的流程 expected_tools[retrieve_knowledge], # 期望被调用的工具 ) result evaluate([test_case], metrics[ToolCorrectnessMetric()]) print(result)这段代码做了三件事回调把每次模型、工具、检索调用记成 spanLLMTestCase声明了输入、实际输出和期望工具evaluate按指标打分。你不需要手工拼评估逻辑。四类核心指标各管一摊下表列出常用能力对应的指标供你按问题选型。能力解决的问题对应指标/入口工具正确性智能体是否选对、调对工具ToolCorrectnessMetric上下文相关性回答是否紧扣给定上下文ContextualRelevancyMetric幻觉检测输出是否包含编造内容HallucinationMetric对话完整性多轮对话是否连贯完成ConversationCompletenessMetric打分结果会同步到仪表板方便跨版本对比。按三步落地到回归流程先跑通单次evaluate确认指标能打分。用deepeval test把用例纳入本地回归。接入 CI让指标变化阻断合并。参考文档与源码LangChain 集成说明docs/content/integrations/frameworks/langchain.mdx指标模块deepeval/metrics/评估入口deepeval/evaluate/把这套流程跑顺之后每次改 prompt 或换模型都有分数可对照。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考