ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架 大家读完觉得有帮助记得关注和点赞摘要Android生态系统面临着持续且快速演变的恶意软件威胁。现有的机器学习检测器容易受到概念漂移的影响因为它们依赖于特定实现的、分布随时间变化的特征。大型语言模型LLM提供了强大的语义理解和零样本推理能力但当前基于LLM的检测器通常依赖于以代码为中心或单一维度的证据使其容易受到混淆技术的影响并限制了全面的行为分析。我们提出了Moirae一个用于动态Android恶意软件检测的多模态智能体协作框架。Moirae动态收集多模态运行时证据并采用基于ReAct的专业智能体来分析互补的行为视图。检测过程从识别视觉欺骗线索、建模UI状态转换以及整合运行时API行为开始以融合跨用户可见界面和隐藏后端操作的多维证据。在时间和分布上未见过的数据集上的实验表明Moirae在无需微调的情况下达到了90.06%的准确率优于最先进的基线方法并展示了对Android恶意软件概念漂移的强大零样本泛化能力。引言Android主导着移动生态系统使其成为恶意软件攻击的主要目标并对数亿用户构成持续的安全威胁Faruki等2014Bhat和Dutta2019。大多数自动化Android恶意软件检测器依赖于静态或动态特征以及监督模型这些模型学习可观察程序工件与恶意软件标签之间的统计相关性Aafer等2013Li等2018Wu等2019。这些模型通常假设训练数据和测试数据遵循相似的分布。然而在实践中良性和恶意应用程序持续演变导致其特征分布随时间发生变化特别是在浅层特征空间中Tang等2023。因此在历史样本上训练的检测器在新出现的应用程序上往往表现出显著的性能下降限制了其在长期部署中的可靠性。先前的工作试图通过马尔可夫链建模Onwuzurike等2019、基于语义嵌入的聚类Xu等2020Yang等2024和自适应分布跟踪Yang等2021Fernando和Komninos2024来缓解概念漂移。动态分析也被广泛采用以捕获可能逃避静态检查的运行时行为和执行逻辑。此类方法在受控环境中收集系统调用轨迹、网络流量和运行时API序列Tang等2024Huang等2024Feng等2025。更近期的方法使用伪标记Xu等2019或持续主动学习Chen等2023来使用新收集的样本更新检测模型。尽管这些技术可以部分缓解概念漂移但它们仍然在很大程度上依赖于从不断发展的数据分布中学习特征-标签相关性。因此它们需要持续收集样本、标注和模型重新训练同时对观察到的行为背后的高层意图提供有限的理解。大型语言模型LLM由于其强大的知识迁移、零样本泛化和语义推理能力提供了一种有前景的替代方案Islam和Moushi2025Glm等2024。现有的基于LLM的Android恶意软件检测器通常遵循两种范式使用LLM总结程序特征以供下游分类器使用Zhao等2025Yan等2025或直接在反编译代码片段上进行推理He等2025Qian等2025。前者仅将LLM视为特征提取器忽略了其推理行为意图的能力。后者依赖于大规模的代码分析容易受到代码混淆的影响。更根本的是这两种范式通常依赖于单一的、以代码为中心的证据来源。此类证据仅提供了应用程序行为的部分视图可能不足以区分恶意行为和合法功能。我们的关键观察是Android恶意行为表现在多个互补的语义层次上。视觉内容揭示了应用程序如何呈现自身并诱导用户操作UI交互捕获状态转换和用户响应而系统级API操作暴露了由此产生的敏感后果。没有单一的模态是足够的可疑的界面不揭示应用程序最终执行了什么而孤立的API调用在没有用户面对上下文的情况下可能看起来是良性的。例如发送短信在消息应用中可能是合法的但在没有明确用户同意的欺骗性提示后被触发时则显得可疑。通过连接用户看到什么、他们如何交互以及应用程序执行了什么跨层次证据提供了恶意行为更完整的描述。尽管界面、代码结构和API组合可能演变但底层的恶意目标如欺骗性广告、用户恐吓、短信滥用和勒索保持相对稳定。这促使我们使用多模态推理来从不断演变的低层实现中推断高层恶意意图。受此观察的启发我们提出了Moirae¹一个由LLM驱动的多模态智能体框架用于Android恶意软件检测。通过动态执行Moirae从三个互补维度收集运行时证据应用程序呈现的视觉诱导、UI状态和交互转换以及系统级API操作。它将这些观察在语义层次上对齐以连接用户可见的行为和交互与其底层的系统后果。然后多个专门的LLM智能体分析和整合所得证据以推断高层恶意意图。通过利用LLM的多模态理解和推理能力Moirae超越了特定实现的特征拟合并在无需微调的情况下能够对之前未见过的应用程序进行更全面的分析。本文的主要贡献如下我们提出了Moirae。通过动态捕获和融合跨三个互补维度的运行时证据——视觉呈现、UI交互转换和系统级API操作——Moirae有效地将用户可见行为与底层系统后果相关联。我们设计了基于ReAct范式的多智能体自主分析机制。专门的LLM智能体协作处理跨层次证据使框架能够自主对齐和相互验证多模态数据。实验评估表明Moirae达到了90.06%的准确率。此外与最先进的基线相比该框架表现出优异的泛化性能。图1不同方案架构的比较。图描述显示三种架构的对比基于静态/动态特征的监督学习易受概念漂移影响、基于LLM的增强LLM作为特征提取器、基于LLM的直接推理以代码为中心、以及Moirae多模态智能体协作。Moirae的架构最全面。相关工作如图1所示基于浅层特征如API调用、权限和系统调用轨迹的静态分析已被广泛用于表征Android应用程序的关键行为Cui等2023Kim等2018Qiu等2022Tam等2015Afonso等2016。然而恶意软件实现技术的持续演变引发了概念漂移问题。为缓解此问题现有研究探索了包级抽象Onwuzurike等2019、语义嵌入Xu等2020Zhang等2022以及结合伪标签和主动学习的模型更新机制Xu等2019Chen等2023。同时在受控沙箱内收集系统调用轨迹、网络流量和运行时API序列的动态分析方法也被广泛引入Tam等2015Afonso等2016Wong和Lie2016Tang等2024Feng等2025。尽管这些方法在一定程度上增强了模型的韧性但它们本质上仍然依赖于拟合历史数据的特征分布。当面对浅层特征发生显著变化的未知威胁时这种基于特征拟合的模型往往难以泛化并需要持续的数据收集来进行昂贵的模型重新训练。利用LLM应对网络安全威胁正在成为一条非常有前景的技术路径Wang等2024。然而现有的LLM应用范式常常局限于代码或单一维度特征难以获取完整且相互佐证的行为证据。在增强范式下如AppPoetZhao等2025和SRDCZhou等2025LLM仅作为语义增强器Yan等2025系统最终仍受制于下游基于学习的模型所需的持续重新训练瓶颈。在直接推理范式下如AV-AgentZheng等2025、LAMDQian等2025和MARDZeng等2026方法过度依赖冗长的反编译代码。其单模态输入缺乏交叉验证无法为复杂的恶意行为提供全面的证据链。Moirae架构概述图2Moirae架构概述。图描述一个详细的架构图显示三个阶段动态多模态数据收集屏幕截图、XML UI状态、ART方法跟踪- 跨模态因果证据融合将UI事件与API调用在时间窗口内对齐- 多智能体协作推理与决策视觉智能体、UI/事件智能体、API智能体、法官智能体。尽管代码和API组合不断变化其背后的恶意目标保持一致。我们提出了Moirae一个用于动态Android恶意软件检测的多模态智能体协作框架。Moirae的核心思想是通过动态执行捕获应用程序在多个语义层次上的运行时多模态特征集ℱ{, , ℰ, }。它建立浅层用户交互与底层系统API调用之间的精确因果映射并利用一组LLM智能体Agents{A_vis, A_ue, A_api, A_judge}进行推理。如图2所示整体架构包括以下三个关键阶段动态多模态数据收集。系统在真实的Android模拟器环境中自动驱动被测应用程序。在执行期间系统同步记录设备屏幕截图捕获包含详细UI节点信息的XML状态树序列并通过Android运行时分析工具提取底层的ART方法调用轨迹。跨模态因果证据融合。系统将在动态探索期间生成的语义事件集ℰ的时间戳与底层二进制执行轨迹对齐。通过定义精确的时间窗口ΔtMoirae将底层API调用序列准确绑定到触发它们的浅层UI交互事件e_i∈ℰ从而构建一个消除噪声的跨模态因果证据_evidence。多智能体协作推理与决策。Moirae采用并行独立推理后聚合裁决的策略。我们设计了三个并行的领域专家智能体它们通过定制工具链从融合报告中分别检索特定模态证据并进行推理。最终一个独立的法官智能体A_judge聚合所有专家的观察向量输出最终的威胁分类和高度可解释的结构化证据链。方法论实现动态驱动与多模态特征捕获为触发应用程序内潜在的恶意负载Moirae实现了一个高度自动化的动态沙箱环境驱动。系统集成了DroidBotLi等2017引擎并采用基于深度优先搜索贪心算法的策略进行自主图形用户界面GUI遍历生成交互式探索动作序列Action⟨a₁, a₂, …, aₙ⟩。在探索期间驱动程序通过screenrecord持续捕获高帧率屏幕录像并周期性导出UI的XML语义状态_i。同时系统利用am profile命令在应用进程级启动ART Profiler以低开销记录详细的方法调用轨迹文件。为确保分析结果的可靠性系统在每次分析会话后执行深度包卸载、进程终止和设备状态快照回滚与清理操作。跨模态因果证据融合传统的动态分析常常生成海量的底层日志容易引发LLM的上下文溢出和幻觉。因此我们设计了此模块以实现底层轨迹与高层语义之间的因果对齐和降维。对于DroidBot捕获的每个因果事件e_k∈ℰ融合模块提取其时间戳t_k并在底层ART轨迹内构建一个向前扩展α秒、向后扩展β秒的时间窗口W_k[t_k-α, t_kβ]。当解析二进制Trace记录时系统通过引入预定义的白名单集Ω来精确过滤方法调用序列。此白名单保留系统API同时过滤掉自定义API。对于满足映射函数f(api_j)∈Ω的关键API系统不仅在其首次调用时记录其执行顺序还统计其在事件时间窗口W_k内的总触发频率Freq(api_j, W_k)最终输出一个高密度的融合报告。基于LLM的多智能体协作推理为避免LLM在处理复杂多模态长上下文时的性能瓶颈Moirae构建了基于ReAct推理与行动范式的多智能体协作方法。浅层视觉模态洞察。视觉智能体A_vis专注于应用程序GUI的全局扫描和深入审查。在ReAct框架下该智能体自主检索和遍历动态执行阶段捕获的所有截图证据。通过多模态视觉推理发现了诸如无休止的弹出广告、强制账户密码请求以及威胁勒索界面等行为。非结构化的像素矩阵被转换为结构化的视觉风险特征表示R_vis。语义交互因果重建。UI/事件智能体A_ue对XML视图树结构和组件交互因果事件进行高维时间分析。它专注于挖掘可见UI意图与实际行为之间的语义错位、无需用户干预的静默恶意触发以及异常权限提升轨迹为系统提供了脱离底层代码的纯粹业务逻辑视角特征表示R_ue。深度本机跟踪取证。API智能体A_api负责对隐藏的恶意负载执行微观层面的动态取证。该智能体检索与每个前端事件e_k严格绑定的本机API调用轨迹T(W_k)。通过在大量日志中执行上下文跟踪以识别恶意行为它将应用程序的底层物理行为凝练为明确的系统级滥用特征表示R_api。跨模态证据融合与裁决。一旦所有三个并行的证据智能体完成其全景ReAct取证法官智能体A_judge融合证据M_judge(R_vis, R_ue, R_api)分析跨视觉感知、语义交互和底层轨迹三大维度的异步观察结果向量对APK做出最终裁决输出一个评估元组Decision⟨y, C, S, E_chain⟩其中包含布尔恶意判决y∈{0,1}、特定威胁家族分类C、置信度分数S∈[0,100]以及高度逻辑可解释的结构化交叉验证证据链E_chain。实验评估方法AndroZoo 2017–2021CICMalDroid 2020CIC-AndMal2017ACCPreRecF1ACCPreRecF1ACCPreRecF1MalScan (KNN-1)72.6071.5573.2672.4060.9063.8886.1573.3645.5739.3374.2751.43MalScan (KNN-3)75.9174.2777.8376.0158.0162.3183.0871.2144.8239.3177.6752.20MalScan (RF)61.7365.4446.5254.3825.0037.7430.7733.9039.1733.9760.1943.43DroidEvolver82.4885.9877.7581.6665.0666.2989.7476.2548.9641.9081.5555.35MaMaDroid78.4387.3867.2775.7281.8686.4884.9285.5876.4670.5668.9869.76CL-Malware84.8884.2985.8685.0784.8481.2098.4588.9967.2355.5278.1664.92Moirae (Ours)89.2276.4783.0779.5890.0691.0093.3392.1585.9682.8986.5984.70表I跨数据集泛化性能比较%。我们在AndroZoo2011–2016数据集上训练了所有基线模型。我们在来自不同时间段的不同分布数据集上进行了测试法官智能体使用GLM-5.1模型其他智能体使用MiniMax-M3模型。最高值用粗体标出。第二高值用下划线标出。实验设置所有实验使用Python 3.11实现并在配备Intel Core i7-12700 CPU和32 GB RAM的环境中运行。使用的所有LLM包括MiniMax、Gemini、GLM和Qwen系列均为官方原始版本²温度等参数设置为默认值未进行任何领域特定的微调。默认情况下视图1、视图2和视图3模块使用MiniMax-M3。同时Qwen3.6-27b模型部署在单台NVIDIA A10080GB VRAMGPU服务器上本地运行。此外我们基于Android模拟器进行动态分析每个APK动态执行2分钟。代码将在接收后发布。数据集我们选择了三个代表性数据集AndroZooAllix等2016、CICMalDroid 2020Mahdavifar等2020和CIC-AndMal2017Lashkari等2018。对于AndroZoo我们随机抽样了从2011年到2021年的应用程序。结合VirusTotal检测结果被≥10个引擎标记的应用程序为恶意0个标记的为良性我们构建了一个包含16,216个应用程序8,193个恶意和8,023个良性的子数据集。相反CICMalDroid 2020和CIC-AndMal2017被严格保留为未知测试集以挑战模型的跨领域空间鲁棒性。基线模型我们将Moirae与两类最先进的SOTA模型进行了比较。静态图/行为模型MaMaDroidOnwuzurike等2019通过马尔可夫链建模行为转移概率。MalscanWu等2019将社交网络中的中心性分析引入函数调用图。自适应和抗漂移模型DroidEvolverXu等2019利用伪标签进行在线模型更新。CL-MalwareChen等2023结合主动学习和持续学习机制以持续积累知识。研究问题RQRQ1有效性分析Moirae的整体表现如何与依赖大规模数据训练的传统基线模型相比如何RQ2时间鲁棒性与现有基线相比Moirae在无需目标域微调的情况下对时间概念漂移的鲁棒性如何RQ3消融研究不同的LLM如何影响最终的判决准确率多维证据提取阶段起什么作用RQ4令牌效率每个分析阶段产生多少令牌开销分层证据提取在压缩原始运行时轨迹方面有多有效评估指标基于混淆矩阵中的真阳性TP、真阴性TN、假阳性FP和假阴性FN我们计算准确率ACC、精确率Pre、召回率Rec和F1分数F1。具体计算见表II。表II评估指标。指标公式准确率(TP TN) / (TP TN FP FN)精确率(TP) / (TP FP)召回率(TP) / (TP FN)F1分数2 ⋅ (Precision ⋅ Recall) / (Precision Recall)RQ1 - 有效性分析如表I所示我们在跨数据集评估设置下将Moirae与传统的基线模型进行了比较。结果表明Moirae在之前未见过的数据集上保持了强大且一致的检测性能表明对分布偏移和跨数据集泛化的鲁棒性有所提高。传统的机器学习和深度学习基线主要依赖于从2011年至2016年间收集的AndroZoo训练集中学习到的浅层统计特征和静态签名。当在具有显著不同分布或较大时间间隔的数据集上评估时它们的性能会大幅下降。例如MalScanRF在包含较新恶意软件变体的CICMalDroid 2020上仅达到25.00%的准确率。在CIC-AndMal2017上所有基于KNN和RF的基线准确率均低于50%。即使是最强的基线CL-Malware在此数据集上也仅达到67.23%的准确率和64.92%的F1分数。这些结果突显了传统有监督检测器在恶意软件技术演进面前有限的时间和跨数据集泛化能力。相比之下Moirae在各种未见数据集上取得了显著优势。它在无需任何目标域数据微调的情况下实现了这一点。在未见数据集上平均ACC为88.01%F1为88.43%与最佳基线相比分别相对提高了9.13%和11.41%。这有力地证明了基于LLM的多智能体架构不再局限于记忆底层二进制特征分布。相反它具备深度语义理解和因果推理能力能够捕获恶意软件欺骗和窃取的核心动机。RQ1的结论Moirae有效缓解了Android恶意软件检测中的跨数据集泛化性能下降。在未见数据分布上无需微调即达到平均ACC为88.01%和F1为88.43%在ACC上超过最佳基线9.13%。这证明了其对未见恶意软件变体的强大泛化能力。RQ2时间鲁棒性我们使用从2017年到2021年按时间组织的AndroZoo样本在时间概念漂移下评估Moirae。基线模型在历史2011-2016样本上训练而Moirae执行零样本推理。图3基于AndroZoo的时间感知评估。图描述折线图显示Moirae、CL-Malware、DroidEvolver、MaMaDroid、MalScan(KNN-3)和MalScan(RF)从2017年到2021年的准确率和F1分数。Moirae保持约90%的稳定准确率而基线随时间下降。如图3所示基线通常随时间间隔增大而退化。例如CL-Malware的准确率从2017年的92.46%下降到2021年的61.50%而DroidEvolver的F1分数从91.71%下降到60.23%。这种退化发生是因为有监督检测器从历史样本中学习特征-标签关联。随着Android生态系统、API、库和恶意软件实现的演变这些关联变得过时。相比之下Moirae的准确率在这五年内保持在约87%-92%之间并在2021年保持在约90.70%左右。尽管如此Moirae仍然受到动态分析固有局限性的影响。其召回率在2021年下降到约77%因为条件触发或环境依赖的恶意行为可能在动态探索期间未被激活。此外部分观察到的数据可能缺乏足够的上下文导致良性但敏感的操作被解释为恶意从而降低了精确率。RQ2的结论Moirae在无需微调的情况下显著缓解了时间退化。它在2021年样本上保持约90%的准确率优于基线约18-29个百分点。其剩余的性能损失主要源于动态分析期间触发和观察完整恶意行为的内在困难。RQ3 - 消融研究我们设计了两组消融研究以调查Moirae中不同设计选择的影响。第一项研究考察法官智能体的LLM选择如何影响检测性能而第二项评估来自视图1到视图3的证据模块的贡献。证据智能体法官智能体ACCPreRecF1MiniMax-M3MiniMax-M388.9391.7690.1790.96MiniMax-M3Gemini-3.1-Pro85.2692.0983.5987.63MiniMax-M3GLM-5.190.0691.0093.3392.15MiniMax-M3GLM-4.7-Flash87.1891.4487.6989.53Qwen3.6-27bQwen3.6-27b83.6580.5197.4488.17Qwen3.6-27bGLM-5.185.2582.5396.9289.15Qwen3.6-27bGLM-4.7-Flash78.1475.2096.9184.68Qwen3.6-27bMiniMax-M384.8984.5192.7888.45表III在CICMalDroid 2020数据集上的多智能体模型消融实验结果%。视图1至视图3模块证据提取使用MiniMax-M3或本地部署的Qwen3.6-27b。表 IIICICMalDroid 2020 数据集上的多智能体模型消融实验结果%View 1 至 View 3 模块证据提取分别使用 MiniMax-M3 或本地部署的 Qwen3.6-27b。证据智能体判决智能体ACCPreRecF1MiniMax-M3MiniMax-M388.9391.7690.1790.96Gemini-3.1-Pro85.2692.0983.5987.63GLM-5.190.0691.0093.3392.15GLM-4.7-Flash87.1891.4487.6989.53Qwen3.6-27bQwen3.6-27b83.6580.5197.4488.17GLM-5.185.2582.5396.9289.15GLM-4.7-Flash78.1475.2096.9184.68MiniMax-M384.8984.5192.7888.45列名说明ACC – 准确率Pre – 精确率Rec – 召回率F1 – F1 分数。表 IVCICMalDroid 2020 数据集上的证据模块消融实验%✓ 表示该实验保留了对应模块的证据输入。View 1View 2View 3ACCPreRecF1✓✓✓88.9391.7690.1790.96✓✓85.9590.5086.6388.52✓✓78.8293.3870.9580.63✓✓86.0591.7685.2588.39✓78.3295.0469.0780.00✓86.3289.8487.9688.89✓70.1695.3754.5069.36注原文表格中后三行的 View 标记可能存在对齐偏差此处按用户提供的原始字符顺序逐行保留实际含义请结合上下文确认。我们还观察到不同法官智能体之间存在明显的精确率-召回率权衡。Gemini-3.1-Pro采用更保守的决策策略实现了最高的精确率92.09%同时牺牲了一些召回率。相比之下本地部署的开源模型Qwen3.6-27b表现出更敏感的检测倾向实现了最高的召回率97.44%但精确率较低。这些结果表明Moirae通过为不同安全场景选择不同的法官智能体在平衡精确率和召回率方面具有灵活性。表IV进一步分析了跨模态证据链中每个组件的贡献。结果表明整合所有三个视图实现了最强的整体检测性能。其中视图2发挥了重要作用。在“移除单个模块”设置中移除视图2导致最大的性能下降准确率降低10.11个百分点至78.82%。同时在“保留单个模块”设置中仅视图2就保持了86.32%的准确率表明UI交互状态为恶意软件检测提供了高度区分性的行为证据。相比之下仅使用视图3实现了最高的精确率95.37%但召回率大幅降低54.50%。这表明仅凭底层API证据不足以进行全面检测因为复杂的恶意软件可能通过反射和动态加载等技术隐藏恶意行为。纳入视图1和视图2的高层语义信息有助于建立用户可见行为与底层敏感操作之间的联系。RQ3的结论Moirae受益于具有互补决策偏好的异构LLM智能体不同的法官智能体实现了灵活的Pre-Rec权衡例如Gemini-3.1-Pro达到92.09%的Pre而Qwen3.6-27b达到97.44%的Rec。多维证据融合对于鲁棒检测至关重要其中视图2发挥核心作用完整视图实现了最佳整体性能。RQ4 - 令牌效率为评估Moirae的部署令牌效率我们分析了其在跨不同数据集和恶意软件家族的恶意软件分析期间的令牌消耗。图4按家族和数据集划分的系统总令牌分布。图描述箱线图显示不同恶意软件家族Adware、Banking、Benign、Ransomware、Scareware、SMSmalware在CIC-AndMal2017和CICMalDroid 2020上的令牌消耗分布。如图4所示整体令牌消耗主要在10⁵到10⁶令牌范围内。不同恶意软件家族由于其行为特征而表现出不同的消耗模式。具体来说图5展示了各类别的平均令牌消耗。在CIC-AndMal2017数据集上广告软件766k、恐吓软件742k和短信恶意软件646k消耗的令牌显著多于良性397k和勒索软件372k样本。类似地在CICMalDroid 2020上短信恶意软件的平均消耗最高835k而良性样本保持相对稳定约为673k令牌。这些差异与不同恶意软件类别的行为复杂性一致。例如广告软件和基于短信的恶意软件经常触发UI交互和广泛的API调用序列导致更长的行为轨迹。相比之下勒索软件通常在执行后不久执行快速文件加密操作产生更短的行为轨迹需要更少的证据令牌。图5跨数据集的绝对令牌成本和智能体贡献。图描述堆叠条形图显示每个数据集的总令牌消耗分解为视图1、视图2、视图3和法官智能体的贡献。视图3贡献最大。图6输入和输出令牌的消耗。图描述散点图显示输入令牌10⁵-10⁶和证据提取智能体的输出令牌约10⁴。输出令牌显著少于输入令牌。图5进一步说明了不同视图智能体的令牌贡献。视图3贡献了总令牌开销的大部分主要是因为底层API序列和系统调用轨迹自然地包含高度重复和细粒度的信息。相比之下法官智能体在接收到压缩的证据表示后仅消耗总令牌的一小部分。这证明了证据提取方法在减少冗余低层信息方面的有效性。没有这种中间抽象直接将原始API序列提供给法官智能体很可能会超出上下文窗口并引入大量的推理延迟和计算成本。图6进一步突出了Moirae的有效性。在对数散点图中输入令牌广泛分布在10⁵到10⁶范围内而来自证据提取智能体的输出令牌集中在10⁴左右。这表明视图1-3有效地将冗长的行为轨迹转换为紧凑的语义表示。得到的压缩比约为10倍到100倍使法官智能体能够在受限的上下文窗口内进行高效推理。RQ4的结论Moirae通过根据恶意软件复杂度调整消耗并将原始行为日志压缩10倍-100倍实现了高效的令牌利用。尽管交互密集型恶意软件家族的成本较高但它能在受限上下文窗口下实现可扩展的基于LLM的分析。结论本文提出了Moirae一个由LLM驱动的多模态智能体框架用于概念漂移下的Android恶意软件检测。Moirae不依赖于特定实现的特性或单一维度的证据而是动态整合视觉诱导、UI交互转换和系统级API操作以重建跨层次行为链并推断高层恶意意图。在时间和分布上未见过的数据集上的广泛实验表明Moirae在无需目标域微调的情况下实现了零样本泛化达到了90.06%的准确率并优于最先进的基线方法。
返回列表