ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

华为云智果AgentArts金融信贷智能体落地实践:从0到1全记录

华为云智果AgentArts金融信贷智能体落地实践:从0到1全记录 说实话第一次把华为云智果AgentArts用到金融信贷场景的时候我心里是打鼓的。大模型做智能客服、做文案生成这些我见多了但让它直接参与信贷审批流程——资料预审、征信解读、合规初筛——这可不是闹着玩的一出错就是真金白银的损失。我们团队当时接到一个持牌金融机构的项目要把信贷申请处理时效从平均3天压缩到当天同时还要保证合规审查不漏项。纯靠加人肯定不行靠传统规则引擎又处理不了大量非结构化资料。后来我们选了华为云智果AgentArts这套智能体平台来落地。整个过程从调研、搭原型到灰度上线大概花了六周时间。这篇就把我们在金融信贷场景里从0到1搭建AI智能体的完整思路、实操步骤、参数调优和踩坑记录全部摊开讲。如果你正在调研AgentArts或者想在银行、消费金融、融资租赁这类场景里落地大模型应用这篇应该能帮你省下不少试错的时间。1. 金融信贷场景里AI智能体到底解决什么问题1.1 信贷业务线上化的最后一公里卡在哪先聊一个背景。信贷业务前些年已经大规模线上化了用户在App上填个申请、传个身份证、拍个收入流水系统就能进件。但这只是入口线上化真正处理这些资料的审批环节大量还是靠人工。客户经理要逐份核对申请表的必填项有没有漏要对着征信报告看历史逾期记录要把收入证明和流水数据做交叉验证最后还要在信贷系统里录一堆字段。一个人一天能处理的件数是有限的而且标准很难完全统一——同一个资料不同审核员看结论可能不一样。这就引出了几个明显的痛点时效瓶颈人工审核一份申请平均要20到30分钟遇到资料不齐全的还要来回补件一拖就是两三天。标准漂移审核质量依赖个人经验新员工和老员工对同一份资料的判断可能完全不同。合规压力信贷业务对资料完整性、征信查询授权、风险提示告知都有严格要求漏一项就是合规事故。成本刚性业务量波动大高峰期必须养着充足的审核团队淡季又闲着一大批人。大模型智能体能做的不是取代审批决策而是把整个流程里信息处理的部分接过去——资料齐不齐、关键字段有没有、征信有没有明显异常、产品适用规则对不对这些判断交给AI做。人只做两件事订规则、审例外。这正是AgentArts这类智能体平台能发挥价值的地方。1.2 为什么选华为云智果AgentArts而不是自己用Python搭选型的时候团队内部吵过一轮。有人建议直接用LangChain这类框架自己攒一套理由是可控性强不被厂商绑定。这个想法我理解但现实地评估了一下发现自研路线在金融场景里要解决的问题远比写代码多。我自己算了一笔账模型层金融文本里全是专业术语和隐含逻辑通用模型对连三累六、五级分类、征信硬查询这类概念的理解深度不够需要找金融领域微调过的基座模型。华为云那边可以直接调用盘古大模型在金融场景优化过的版本这个我们自建的话基本搞不定。工具层智能体要调用OCR识别证件、调用征信接口、查黑名单库这些工具接入都得自己写适配器。AgentArts的插件中心里已经封装了一批常用工具拖拽配置就能用省掉不少重复劳动。审计层金融监管对AI应用有明确要求全流程要可追溯、可解释、可回放。AgentArts自带完整的工作流运行日志和中间结果留存每一步AI做了什么判断、调用了什么工具、输出了什么内容都有记录。自研系统要做到这个程度得额外开发不少工作量。最终我们定了几个结论不是不能用Python自建而是AgentArts把智能体工程化这一步给做了让团队可以把精力集中在业务规则和提示词调优上而不是跟推理框架、模型部署、日志系统较劲。2. 华为云智果AgentArts核心能力深度拆解2.1 提示词工程让大模型装成一个信贷审核专家AgentArts里最基础、也是最重要的能力模块就是提示词工程。在金融信贷场景里提示词不能像做聊天机器人那样随口写写。我见过太多团队在提示词上翻车核心原因是把大模型当成什么都知道的天才来用实际上它就是一张会联想的嘴你得把边界、格式、语气全部焊死。我们当时设计信贷资料预审助手的提示词遵循了几个原则角色设定要具体到岗位职责你是某消费金融公司的信贷资料审核专员负责个人消费贷款申请资料的完整性预审你的工作结果将被用于后续人工审批决策。这一段直接把模型的行为框定在了审核场景。任务描述要给出明确的输入和输出输入是客户提交的申请资料文本输出是一份结构化的预审结论表包含资料清单、缺失项、疑点提示、初步风险评估。边界声明要写清楚如果你发现资料中存在证件号码不匹配、收入证明与流水明显矛盾等情况不要直接判定为欺诈如实标记异常并转人工复核。这能有效避免AI在信息不全时擅自下结论。输出格式要给到字段级约束我们直接要求模型按JSON格式输出包括document_list、missing_items、risk_flags、summary这些字段方便下游系统直接解析。这里有一个很重要的点提示词不是一次性写好的需要反复迭代。我们在AgentArts的提示词调试台里跑了大量真实脱敏样本每次调整完都要对比输出质量。比如最开始模型会把征信报告显示近6个月有1次逾期归类为存在信用瑕疵但业务侧告诉我们单次逾期且金额小于1000元的在特定产品线下可以不列为否决项。这种业务规则的微调最终都要沉淀进提示词或者知识库里。2.2 工作流编排把人与人之间的协作流程搬到线上如果只有提示词那充其量算个高级问答机器人。信贷审批业务复杂在流程依赖——先看资料齐不齐齐了才做征信解读征信没问题才进入额度测算中间任何一步异常都要转人工。AgentArts的工作流编排模块就是干这个的。我们在平台里搭了一条完整的工作流核心节点包括资料上传触发节点客户在进件系统里提交资料后自动触发智能体任务。资料完整性预审节点让大模型对照产品要求的材料清单逐项核对输出缺失项清单。这个节点可以替代原来人工做的材料合规性检查。OCR识别与信息抽取节点通过插件调用OCR服务把身份证、收入证明、银行流水等图片转成结构化文本再用大模型抽取关键字段比如姓名、证件号、月收入、工作单位。征信报告解读节点解析征信报告提取逾期记录、贷款笔数、担保情况、硬查询次数等指标并给出风险标签。交叉验证节点这里是个条件分支——如果收入证明月收入与流水月均入账差异超过30%进入人工复核队列如果差异在正常范围内自动放行到下一步。人工审批节点对于AI标记为异常的件挂起等待人工处理同时把AI的分析结论作为参考材料一并呈现。工作流编排的好处在于AI不再是一问一答的被动工具而是嵌在业务流程里主动跑起来的执行者。每个节点都有输入、输出和状态出了问题可以单独调试。有一次我们发现交叉验证节点经常误报排查后发现是上游OCR把金额里的6识别成了8导致收入差异计算失真。如果没有工作流的分层日志这种问题根本无从查起。2.3 知识库与插件给智能体装上手和记忆大模型有个天然短板——它的知识是训练时固化的没法实时掌握你公司最新的信贷政策和产品规则。AgentArts的知识库模块解决的就是这个问题。我们把信贷产品说明书、利率表、准入规则、常见问题FAQ全部导入知识库智能体在回答问题时会先检索相关文档再把检索结果作为上下文输入模型这就是标准的RAG检索增强生成落地方式。这块有几个实操细节值得分享知识库要分层我们把知识分成三层——公开产品层利率、期限、额度范围、内部规则层审批权限、风险偏好、动态案例层过往典型案例、常见退补件原因。分层能显著提升检索命中率。切片粒度要调整信贷政策文件经常是一大段文字里混着好几条规则切片太大容易检索到不相关段落太小又丢失上下文。我们经过反复试验把切片大小控制在256个token左右并做了20%的段落重叠效果最稳定。插件调用要有兜底智能体调用OCR时如果遇到不支持的图片格式要设计异常处理路径不要让任务卡死。我们在AgentArts里给插件节点加了超时控制和失败重试默认超时10秒重试2次仍然失败则直接转人工。另外说一句AgentArts的插件机制不只是接入外部API你的团队自己写的内部服务也能封装成插件。我们把行内征信查询接口封装成了一个自定义插件配好了入参和出参的Schema定义智能体在工作流中看到需要查询征信时就会自动组装参数发起调用。这一步把AI理解需求和系统执行动作打通了是智能体真正能干活的关键。3. 信贷审批智能体实操全流程从搭骨架到参数调优3.1 场景选定与数据准备先想清楚让AI干什么我们第一个落到生产环境的场景选的是个人消费贷申请资料预审。为什么选这个因为它边界清晰、容错率高——AI做的只是初审最终决定权还在人工手里业务风险可控。而且这个环节每天的件量最大省下来的工时最明显。数据准备是关键前置工作。我们需要三类数据申请表样本脱敏后的历史申请记录包含客户基本信息、申请金额、期限、用途等大概500条。影像资料样本身份证、银行卡、收入证明、流水的脱敏扫描件用于测试OCR识别效果大概200套。征信报告样本脱敏后的征信报告文本覆盖正常、轻微逾期、严重逾期、多次查询等不同情况用于验证模型的解读能力大概300份。数据脱敏这块多说一句金融数据合规红线碰不得。我们用到了华为云的数据安全服务做字段级脱敏证件号保留前3后4中间用星号替代姓名用假名替换真实的手机号全部抹掉。脱敏后的数据才能放进AgentArts的调试环境里跑。3.2 在AgentArts上搭建预审智能体的逐步操作流程走一遍方便你照着上手。登录华为云控制台进入智果AgentArts的管理界面之后按下面步骤操作第一步创建应用。在智能体应用里新建一个应用命名信贷资料预审助手运行方式选择工作流模式因为我们有明确的流程依赖。第二步选择模型。基座模型我们选了盘古大模型在金融领域优化过的那个版本。对比过通用版本金融版在隐含语义理解比如连三累六这类行话、结构化输出规范性上都要好一截。第三步配置提示词。参考上面2.1节的原则把角色设定、任务描述、边界声明、输出格式全部填进去。建议先在调试台里贴几条样本数据验证效果再正式发布到工作流里引用。第四步导入知识库。在知识中心里创建知识库命名信贷政策库把产品说明书、准入规则、常见退补件原因文档传上去。系统会自动做切片和向量化配置好检索的Top K参数——我们设置的是检索3个相关片段作为上下文。第五步编排工作流。按2.2节提到的节点顺序在画布上拖拽编排。注意条件分支的判定逻辑要写清楚比如收入验证差异比例的计算公式平台支持可视化配置阈值。第六步集成插件。在插件中心先测试OCR插件的单次调用效果确保能正确识别证件上的姓名和证件号。再配置自定义征信查询插件的参数映射把知识库检索结果里的客户编号传给征信API。第七步发布与接入。完成测试后把应用发布为API接口配置好访问鉴权。信贷进件系统在提交新件时调用这个接口提交资料文本和图片地址接口返回预审结论。每一步都有对应的调试工具。我第一次搭的时候光提示词就迭代了四五个版本每一步改动都用历史脱敏样本跑一遍回归对比确保修复一个问题没有引入新问题。3.3 关键参数调优温度、上下文长度、检索Top K与人审阈值参数调优是整个项目里最磨人、也最有价值的部分。我在AgentArts里重点调了这几个参数分享下调优思路和最终值温度系数Temperature默认值0.8在生成类任务里够用但信贷预审是强语义理解任务需要的是稳定、可复现的输出。我们直接把温度调到0.2最大程度减少随机性。实测下来同样的问题问10次答案一致性从80%出头提升到了接近100%。上下文长度Max Tokens预审任务要处理的输入通常很长——一份征信报告动辄几千字。我们把单次请求的最大Token数设到4096太小的话长文本会被截断导致关键逾期记录被切掉。知识库检索Top K默认值是5但经过测试检索回来的文档太多反而会稀释核心信息。调到3之后模型的判断准确率反而上升了3个百分点。这个不要拍脑袋定最好根据验证集的实际表现来选。人工复核阈值这个参数不设置在模型上而是设在工作流的条件分支里。我们用差异化率超过30%作为触发人工复核的标准。30%这个值是从历史数据里算出来的——正常客户收入证明和流水的差异一般不会超过20%超过30%大概率有隐藏风险。调优的时候一定要有量化指标不能靠感觉。我们内部定义了一个预审结论准确率指标——AI判断资料齐全的件人工抽检确认确实齐全的比例。第一版这个准确率只有78%看着能用但业务侧反馈不放心。后来把温度调到0.2、知识库补充了历史退补件案例之后准确率拉到了93%以上才敢进入灰度阶段。4. 常见问题与排查技巧实录4.1 幻觉问题信贷场景最不能忍的错大模型幻觉在信贷场景不是小概率事件而是必然会发生的事。我们踩过最典型的一个坑是征信报告里明明写的是无逾期记录模型在解读输出里却生成了最近6个月有2次逾期。这个错误要是没拦住直接影响审批结论。排查下来发现根因有两个。一是模型的注意力机制面对长文本时可能过度关注后面的小字备注累计逾期次数那一段是空值但报告尾部有一条历史查询记录中存在2次贷后管理查询模型把这两个概念混淆了。二是提示词里没有明确要求若报告未提及逾期则默认逾期次数为0并标注来自原始文本字样。解决思路分三路提示词层面增加严格遵守原文信息不得推断或补充原文未出现的数据如果原文没有相关字段输出未提及这样的约束。知识库层面把征信报告解读规范做成文档导入知识库让模型在解读前先检索规范要求。输出校验层面写一个简单的校验规则如果模型输出的逾期次数字段非空但原文中确实没有逾期关键词则强制将结论置为待人工复核。这三招组合下来幻觉率从最开始的8%左右降到了1%以下。我建议所有做金融场景的人都要把输出校验当成标配而不是指望模型永远靠谱。4.2 工具调用失败与上下文信息截断工具调用是智能体最容易表演翻车的环节。我们碰到过三次明显问题第一次是OCR插件识别身份证时返回的出生日期字段和证件号里的第七到第十四位不一致原因是供应商的OCR接口更新了版本字段含义变更但文档没及时同步。排查时我们看了工作流日志发现中间的返回报文里有一个新的birthDate字段旧版本的解析代码不认识就直接丢掉了后续节点拿到的是空值。解决方法是给插件调用加了一层字段映射校验拿到结果先做Schema校验字段类型不对就报错并转人工。第二次是征信查询插件超时。征信接口的响应时间本身要2到3秒但AgentArts工作流的默认节点超时时间是3秒经常卡在临界点上。我们把超时调整到10秒并设置了一次重试问题就消失了。这里想提醒一句默认参数未必适合你的业务场景插件网络调用的超时时间一定要按实际上下游接口的响应时间来做压测后确定。第三次是上下文截断。有一起复杂申请客户上传了12张流水截图OCR转出的文本很长加上征信报告单次请求的Token数超过了模型上限的4096系统直接截断了后半段导致最后的风险结论缺少重要信息。我们后来改成分段抽取聚合策略——先把流水文本按月份切段每段单独抽取收入和异常入账最后让模型做汇总分析。这样既避免了长文本截断也提升了抽取精度。4.3 权限控制与全程审计金融场景的底线在金融行业做AI应用合规审计的优先级永远高于模型效果。AgentArts在这方面提供了一些不错的基础能力但你要会用操作留痕所有对话、工作流运行记录、工具调用日志平台默认都有审计日志留存。我们配合行内日志系统做了双写每天导出审计文件归档满足监管对AI决策过程可追溯的要求。最小权限智能体在生产环境使用的API密钥权限范围只限定在读取已脱敏数据和调用审批接口。密钥定期轮换每次发布新版本前都要检查权限是否过大。数据隔离测试环境和生产环境的AgentArts应用是分开的。测试环境用脱敏样本生产环境只走真实业务数据防止模型在调试时无意中记住敏感信息。这条还想多说一句平台自带审计是工具真正的流程还得靠你的团队把它跑起来。我们内部规定每次工作流版本发布都要有业务合规同事参与评审重点审查输出内容是否可能包含歧视性表述、是否可能泄露客户隐私。大模型应用在信贷场景里的红线其实不是技术红线而是业务伦理和合规红线。5. 实测效果与一些经验心得5.1 我们实际跑出来的数据灰度运行四周处理了大约6000件申请资料预审请求核心指标如下指标基准值纯人工AI人工灰度期变化单件平均处理时长约25分钟约6分钟缩短76%资料完整性检出率82%人工抽检口径91.3%提升9.3%预审结论准确率85%93%提升8%漏检转催办率2.1%0.9%降低57%其中最让我满意的是91.3%的资料完整性检出率。这个指标指的是AI能准确发现申请材料中缺失或不规范的项目以前纯靠人工翻资料漏检率很高。现在AI先扫一遍人工再把精力放在复杂件的判断上效率和准确率都上去了。当然也不能只看光鲜的数字。6000件里大概有120件被AI错误标记为资料缺失实际是复印件模糊导致OCR没识别出来。这类误差暴露出的问题是OCR质量会直接影响下游智能体的判断。后续我们把OCR的增强型识别功能开了模糊影像自动增强后再做识别误报率降了一半。5.2 平台选型与团队协作的一些体会最后聊几点个人感受给正在做同类项目的同行参考。第一平台型智能体工具和自研Python框架不是非此即彼的关系。AgentArts适合快速验证业务场景、需要完整的审计和权限能力的团队如果你的团队有充足的AI工程化能力需要极致定制化自研也是合理选择。我们是用AgentArts做了完整验证之后把其中一部分逻辑用Python重写进了内部信创环境两条腿走路。第二做金融场景的AI智能体业务团队必须深度参与而不是技术团队闭门造车。我们的业务同事在提示词设计、知识库搭建、人工复核阈值设定上投入了大量精力这也是这个项目能在六周内落地的关键。没有他们的行业经验单纯靠算法专家猜业务规则做出来的东西大概率是废的。第三别害怕试错但每一次试错都要留下记录。AgentArts的工作流日志天然提供了实验记录本我们在调优阶段养成了一个习惯每次改参数都保存一份快照同时记录改了什么、为什么改、验证集上的表现变化。这个习惯在灰度期帮了大忙——有一次效果回退半小时就定位到是知识库里导入了一份过期规则文档回滚掉就恢复了。这个项目目前的阶段是预审智能体已经稳定运行团队还在规划下一个智能体——贷后客户异常行为预警。有了第一套的底子和踩坑经验后续的路明显好走了。如果你也在琢磨金融场景的智能体落地建议先从业务流程里找一个边界清晰、容错率高、件量大的场景切入用AgentArts这样的平台快速跑通一个闭环再逐步扩大范围。别人总结的经验再好都不如自己亲手跑一遍来得真实。
返回列表