ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

[论文学习]MIND:面向LLM智能体的轻量级高效记忆注入防御框架-基于意图感知信息瓶颈

[论文学习]MIND:面向LLM智能体的轻量级高效记忆注入防御框架-基于意图感知信息瓶颈 MIND面向LLM智能体的轻量级高效记忆注入防御框架-基于意图感知信息瓶颈论文重點本文提出了MINDMemory Intent-Aware Neural Denoising一个针对记忆增强型LLM智能体的轻量级记忆注入攻击防御框架。其核心洞察在于良性轨迹与中毒轨迹在初始用户意图与后续行为之间的关系上存在可区分的差异。基于这一观察MIND利用意图感知信息瓶颈Intent-Aware Information Bottleneck, IB提取紧凑的“意图-行为”表示在过滤任务无关冗余信息的同时保留跨轮次的攻击信号最后由轻量级检测器识别恶意记忆。核心研究内容問題定義记忆增强型LLM智能体通过外部检索式记忆系统存储历史交互记录并在后续轮次中检索使用。然而这一机制带来了严重的安全隐患——记忆注入攻击攻击者可以通过间接注入通过多轮交互逐步植入或直接注入利用有限的写入权限将恶意记录植入记忆库。当智能体检索到这些中毒记忆时其行为会被逐渐偏离初始用户意图最终导致任务失败。现有的防御机制面临两难困境要么计算成本过高如反复调用LLM进行审计要么在多轮上下文中遭受信息冗余的困扰。更棘手的是防御者只知道记忆库可能被投毒但对攻击策略、触发词、中毒记忆的具体内容或目标行为一无所知。創新方法MIND的核心创新在于将记忆防御重新表述为一个基于信息瓶颈的去噪过程。具体来说1. 核心洞察驱动。作者通过初步分析发现良性轨迹和中毒轨迹在“初始用户意图”与“后续行为”之间的关系模式上存在显著差异。攻击者植入的恶意记忆会逐渐扭曲这种意图-行为一致性而这种扭曲是可以被捕捉和检测的。2. 意图感知信息瓶颈IB。MIND采用信息瓶颈理论来提取紧凑的意图-行为表示。IB的目标是最小化以下目标函数min⁡ I(Z;X)−α⋅I(Z;Y)\min \; I(Z;X) - \alpha \cdot I(Z;Y)minI(Z;X)−α⋅I(Z;Y)其中I(Z;X)I(Z;X)I(Z;X)是压缩项最小化输入与潜在表示之间的互信息迫使模型丢弃冗余信息I(Z;Y)I(Z;Y)I(Z;Y)是信息保留项最大化潜在表示与标签之间的互信息确保保留与任务相关的信号。参数α\alphaα用于平衡压缩与信息保留两个目标。在实践中MIND使用变分信息瓶颈方法IB编码器EEE对输入xix_ixi​生成高斯后验分布qE(zi∣xi)N(μ(xi),diag(σ2(xi)))q_E(z_i|x_i) \mathcal{N}(\mu(x_i), \text{diag}(\sigma^2(x_i)))qE​(zi​∣xi​)N(μ(xi​),diag(σ2(xi​)))并通过重参数化技巧实现端到端训练。3. 轻量级检测器。从IB提取的紧凑表示中一个轻量级检测器而非昂贵的LLM负责识别恶意记忆。这避免了反复调用LLM进行审计的巨大开销。研究成果实验在多个基准测试上评估了MIND的有效性包括ReAct-StrategyQA、MMLU等。主要结果如下指标结果攻击成功率降低ReAct-StrategyQA平均ASR-r降低55.4%ASR-a降低55.3%任务准确率与未防御的智能体相当几乎无损失推理效率保持与未防御智能体相当的延迟MMLU任务DeepSeek-V4上ASR降至0.72%ISR降至0.34%具体数据显示在DeepSeek-V4上MIND的准确率达到62.60%接近无防御的63.77%同时将ASR-r从50.37%降至20.91%ASR-a从74.52%降至32.72%。在GPT-4o-mini上MIND甚至实现了74.86%的准确率略高于无防御的74.72%ASR-a从75.51%降至48.65%。相比之下基线方法如LLM Auditor虽然在某些场景下防御效果好但带来了显著的延迟增加如DeepSeek-V4上从39.15秒增至51.60秒A-MemGuard在DeepSeek-V4上延迟高达79.94秒。MIND在保持低延迟的同时实现了优越的防御效果。實際落地應用的可能性MIND的轻量级设计使其具备较高的实际部署价值低计算开销无需反复调用LLM进行审计推理效率与未防御系统相当即插即用可作为记忆读写路径上的过滤模块与现有记忆增强型智能体架构兼容广泛适用性适用于各类记忆增强型LLM智能体包括ReAct框架、RAG系统等无需先验知识不需要了解攻击策略或中毒记忆的具体内容即可生效技術細節问题形式化设记忆库M′M∪Madv\mathcal{M} \mathcal{M} \cup \mathcal{M}_{adv}M′M∪Madv​其中M\mathcal{M}M为干净记忆Madv\mathcal{M}_{adv}Madv​为攻击者植入的中毒记忆。对于查询qqq检索器R\mathcal{R}R返回 top-kkk记忆R(q,M′,k)\mathcal{R}(q, \mathcal{M}, k)R(q,M′,k)。防御函数gϕ(⋅)g_{\phi}(\cdot)gϕ​(⋅)对检索结果进行过滤得到净化后的记忆集合M~rgϕ(R(q,M′,k))\tilde{\mathcal{M}}_r g_{\phi}(\mathcal{R}(q, \mathcal{M}, k))M~r​gϕ​(R(q,M′,k))。目标是最小化中毒记忆被保留的概率同时最大化任务准确率。MIND架构MIND的架构包含三个核心组件特征提取器fff将输入xix_ixi​包含初始意图和轮次级行为转换为特征表示IB编码器EEE将特征压缩为紧凑的潜在表示ziz_izi​。编码器输出高斯分布的均值和方差qE(zi∣xi)N(μ(xi),diag(σ2(xi)))q_E(z_i|x_i) \mathcal{N}(\mu(x_i), \text{diag}(\sigma^2(x_i)))qE​(zi​∣xi​)N(μ(xi​),diag(σ2(xi​)))训练时通过KL散度上界约束压缩性I(Z;X)≤Exi∼DDKL(qE(zi∣xi)∥p(z))I(Z;X) \leq \mathbb{E}_{x_i \sim \mathcal{D}} D_{KL}(q_E(z_i|x_i) \| p(z))I(Z;X)≤Exi​∼D​DKL​(qE​(zi​∣xi​)∥p(z))轻量级检测器从潜在表示ziz_izi​中识别恶意记忆训练过程MIND采用端到端训练方式优化目标结合了IB的压缩-信息保留权衡与分类损失。重参数化技巧确保梯度可以顺利回传。研究設定根据论文公开信息实验配置如下基准测试ReAct-StrategyQA多步骤常识问答包含来自Wikipedia的10k段落知识库、MMLU等基座模型DeepSeek-V4、GPT-4o-mini、Llama-3.1-8B-Instruct对比基线No Defense无防御、LLM Auditor、Distil、PPL困惑度检测、A-MemGuard、Sequential Monitor、AV Filter评估指标ACC任务准确率ASR-r / ASR-a攻击成功率不同攻击变体ISR注入成功率Time推理延迟隶属机构香港科技大学广州綜合分析方法论贡献MIND最值得关注的贡献在于将安全防御问题重新定义为信息论框架下的去噪问题。传统的记忆注入防御通常采用“黑名单过滤”或“LLM审计”的思路前者容易被绕过后者成本过高。MIND另辟蹊径既然攻击的本质是“意图-行为”一致性的破坏那么直接建模这种一致性关系就能实现高效检测。信息瓶颈理论的引入尤为精妙。通过强制模型在压缩输入信息的同时保留与标签相关的信息IB天然地过滤掉了任务无关的冗余——而这些冗余恰恰是攻击者用来隐藏恶意意图的“噪声”。这种“以信息论视角审视安全问题”的思路为LLM安全领域提供了新的方法论范式。性能分析从实验数据来看MIND在安全性-效用性权衡上表现优异安全性在ReAct-StrategyQA上ASR-r和ASR-a分别降低55.4%和55.3%在MMLU上DeepSeek-V4的ASR降至0.72%效用性任务准确率与无防御基线持平甚至略有提升效率推理延迟与无防御基线相当显著优于LLM Auditor和A-MemGuard等方案特别值得关注的是MIND在MMLU上的表现DeepSeek-V4的准确率达到92.39%无防御为70.95%这暗示IB的压缩过程可能不仅过滤了攻击信息还帮助模型聚焦于任务相关特征从而提升了整体性能。局限性思考尽管MIND表现亮眼但仍有一些问题值得深入探讨攻击演化的对抗性如果攻击者知晓MIND的防御机制是否可能设计出能够绕过意图-行为一致性检测的新型攻击跨任务泛化性实验主要在ReAct-StrategyQA和MMLU上进行在更复杂的真实场景如软件工程、科学研究等长周期任务中的表现有待验证IB参数的敏感性平衡参数α\alphaα的选择对性能影响显著在实际部署中如何高效调参是一个工程挑战冷启动问题在智能体运行初期缺乏足够的行为轨迹时意图-行为关系的建模是否依然可靠實踐應用适用场景企业级LLM智能体部署在客服、数据分析、自动化办公等场景中保护智能体免受记忆注入攻击RAG系统安全加固作为检索后处理模块过滤外部知识库中的恶意内容多轮对话系统防止攻击者通过长期对话逐步“污染”智能体记忆开源智能体框架可作为插件集成到LangChain、AutoGen等框架中部署建议作为记忆读写路径的过滤器在记忆检索后、输入LLM之前插入MIND模块或在记忆写入时进行实时检测与现有系统解耦MIND的轻量级设计使其可以作为独立服务部署不影响主系统的推理效率渐进式部署策略先在小规模场景中验证效果再逐步推广到生产环境持续监控与更新随着新型攻击方式的出现定期更新MIND的训练数据以保持防御能力技术门槛硬件要求标准GPU训练即可推理阶段无需额外硬件加速数据要求需要标注的良性/中毒轨迹数据用于训练集成难度中等主要工作在于将MIND嵌入现有记忆系统的读写路径參考資料來源原始论文https://arxiv.org/abs/2607.28103arXiv HTML版本https://arxiv.org/html/2607.28103v1作者Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li香港科技大学广州发表日期2026年7月30日会议标签AAAI Style
返回列表