Ethiack与美国圣母大学联合研究揭示真实世界评估难题

Ethiack与美国圣母大学联合研究揭示真实世界评估难题
这项由葡萄牙网络安全公司Ethiack与美国圣母大学联合开展的研究以预印本形式发布于2026年7月论文编号为arXiv:2605.10834v2有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。说起渗透测试很多人可能感到陌生。简单说渗透测试就是雇佣一批职业黑客让他们在获得授权的情况下像真正的攻击者一样尝试入侵某家公司的系统从而找出安全漏洞帮助企业在真实攻击发生之前修补它们。这件事历来依赖经验丰富的安全专家费时费力成本高昂。近年来人工智能技术突飞猛进一批AI渗透测试系统应运而生宣称能自主发现系统漏洞。然而问题随之而来我们怎么知道这些AI究竟好不好用考核它们的试卷是否真的能反映现实战场的复杂程度这项研究的核心动机恰恰就是回答这个棘手的问题。研究团队发现当前对AI渗透测试系统的评测大多停留在一种叫做夺旗赛Capture The Flag的竞技模式里——就好比考察一名厨师只要求他炒出一道指定菜肴却从不关心他能否独立设计菜单、应对复杂宴席。这种考核方式固然方便打分却与真实工作场景相去甚远。研究团队因此提出了一套全新的评估框架试图让考题真正贴近现实让测试成绩真正能预测系统在真实网络攻防中的表现。一、现有考题为何不够用要理解这项研究的价值首先得弄清现有评估方法的局限性在哪里。现有的AI渗透测试评估方法大体可以分成三类。第一类最为常见就是前面提到的夺旗赛模式。研究人员在一个封闭环境里预先藏好一个旗帜通常是一段特殊字符串然后让AI去找。找到了就算成功找不到就算失败。这种方式的好处是打分极为简单但它的问题也很明显——真实的渗透测试根本不是只有一个正确答案的填空题。现实中的系统往往存在几十甚至上百个安全漏洞分布在不同的功能模块、不同的攻击面上测试人员需要像侦探一样四处摸排而不是奔向一个预定终点。第二类评估方法稍微进步了一些例如有研究团队设计了要求AI实现远程代码执行的场景或者引入了干扰项、多步骤攻击链等元素让测试环境更接近真实系统。但这些方法的本质仍然是单一目标——AI只需要完成一件预定任务而不需要在一片漏洞密林中自主判断从哪里入手、优先处理哪些威胁。第三类方法则借助真实公开漏洞CVE来构建测试场景虽然漏洞本身是真实的但每个目标依旧只对应一个预设攻击路径没有给AI留下真正开放性的探索空间。更重要的是现有评估方法几乎无一例外地将评分视为一次性任务忽视了几个在现实中至关重要的因素AI系统是随机性的同一个AI在不同时刻运行可能得出截然不同的结果渗透测试在现实中往往是反复进行、持续积累的而非一锤定音运行成本和时间效率同样是选择工具时的关键考量。这些被忽略的维度导致实验室里评分漂亮的系统到了真实业务环境中可能表现平平。二、新的评估框架是如何设计的研究团队提出的新框架核心理念是把评估的焦点从完成了没有转向发现了什么漏洞、发现得准不准、发现得全不全。这就好比从考察一名侦探有没有抓到指定嫌疑人转变为评估他在整个案发现场找到了多少有效线索找错了多少还有多少遗漏。整个框架建立在四根支柱之上。第一测试目标必须足够复杂包含多个漏洞、多种攻击面要求AI真正具备探索、规划和策略决策的能力。第二用一套结构化的流程把AI的发现与预先整理的漏洞清单进行语义层面的比对而不是要求字面上的精确匹配。第三把漏洞清单视为一个持续更新的活文件而非一次性的标准答案。第四通过多次重复运行来应对AI系统天然的随机性并且既评估单次表现也评估多次累积的综合效果。具体操作上评估分为三个步骤像三道关卡一样依次把控质量。第一关是建立标准答案文件研究人员对每个测试目标预先整理出所有已知漏洞的档案每条记录包含漏洞名称、类别、描述和补充信息。这份档案也同时划定了评估范围比如只关注高危漏洞或者只关注某几类攻击方式。第二关是语义匹配AI系统完成测试后会输出一份发现报告列出它认为存在的安全问题。评估系统使用另一个AI充当评判官来逐一比对AI的发现与标准答案中的每条记录判断两者描述的是否同一个漏洞。这里有一个很重要的设计细节——允许一对多匹配也就是说AI的一条发现可以同时被认为可能对应标准答案中的好几条记录。这种宽松设计是有意为之因为AI的描述方式和标准答案的描述方式可能大相径庭强行要求精确匹配会冤枉很多正确答案。第三关是二分图解析Bipartite Resolution。经过第二关之后会出现这样的情况一个AI发现可能对应多条标准答案多个AI发现可能对应同一条标准答案。这时候就需要一个数学工具来做最终裁决。研究团队采用了一种叫做匈牙利算法的经典方法它能够在所有可能的配对方案中找出最优的一对一匹配结果确保每条标准漏洞最多只被计一次同时避免AI重复报告同一漏洞却被当作多次成功发现。三、如何给AI的表现打分有了这套配对机制打分就变得有依据了。评估框架借鉴了信息检索领域常用的几个指标但把它们迁移到了安全测试场景中。准确率衡量的是AI报告的问题中有多少是真实漏洞就好比一个侦探报告了十个可疑点其中有几个真的与案件有关。召回率衡量的是AI找到了多少比例的已知漏洞就好比案发现场一共有二十个线索侦探发现了其中几个。综合这两个维度的F1分数和更侧重准确率的F0.5分数则提供了平衡视角。重复发现计数专门记录AI重复上报同一个漏洞的次数这在实际使用中非常有价值因为大量重复报告会淹没真正有价值的发现让安全团队疲于应付噪音。严重性得分是另一个特色指标。每条已知漏洞都有一个行业通用的CVSS评分反映其危险程度。研究团队将这个分数转化为积分制评分在0.1到3.9的低危漏洞值3分4.0到6.9的中危漏洞值15分7.0到8.9的高危漏洞值30分9.0到10.0的严重漏洞值50分。AI发现了哪些漏洞就累加对应的分数。这个设计体现了一种实用主义逻辑发现一个可能导致系统完全沦陷的严重漏洞价值远超发现十个无关痛痒的小问题。CWE覆盖率则反映AI发现的漏洞种类有多广CWE是业界对软件弱点类型的标准化分类体系。一个优秀的渗透测试工具应该能识别多种不同类型的安全问题而不只是擅长找某一类漏洞。在这套评分体系之上研究团队还特别强调了标准答案必须持续维护。这是因为真实系统中的漏洞永远无法被完全穷举当AI报告了一个标准答案里没有的漏洞时有可能不是AI犯了错而是最初整理标准答案的人遗漏了这个漏洞。因此安全专家应当定期审查AI报告中未被匹配的发现验证其是否为真实漏洞并在确认后将其补充进标准答案文件。随着这个循环不断进行标准答案会越来越完整评分也会越来越公正。四、如何应对AI系统天生的随机性这是整个框架中最容易被忽略、却又至关重要的一个设计考量。AI渗透测试系统本质上依赖大型语言模型而语言模型的输出天然存在随机波动即使面对完全相同的目标不同时刻的运行结果也可能差异显著。打个比方同一个侦探在不同状态下调查同一个案件可能会注意到不同的细节得出不同的结论。正因如此单次测试结果根本无法代表一个AI系统的真实水平。研究团队建议对每个测试场景进行多次重复运行并且同时汇报每次运行成绩的平均值和标准差后者反映了系统表现的稳定程度。在统计比较两个系统时研究团队推荐使用Welchs t检验这是一种不要求两组数据方差相等的统计方法非常适合AI系统这种可能高度不稳定的场景。然而当重复次数较少时统计检验的威力会大幅下降——即使两个系统的表现差异很大也可能因为数据量不足而无法达到统计显著性。这就好比你只抛了三次硬币即使全部正面朝上也很难据此下结论说这枚硬币有问题。因此研究团队建议同时报告Cohens d这个效应量指标。Cohens d衡量的是两个系统性能差异的绝对量级与样本量无关。一般来说d大于0.8就被认为是大效应意味着差异在实际使用中非常显著。将统计p值和Cohens d结合起来看即使在只有少量重复实验的情况下也能对两个系统的差异做出更全面的判断——p值告诉你差异是否足够可靠Cohens d告诉你差异是否足够重要。五、累积评估为何不可缺少除了关注单次运行表现研究团队还特别设计了累积评估维度这是整个框架中最具现实意义的创新之一。在真实的网络安全工作中渗透测试往往不是做一次就结束。安全团队可能每隔几个月就对同一个系统做一轮测试发现的问题修复之后再做下一轮。AI的随机性在这里反而成了一种优势不同时刻的运行可能会探索不同的路径发现不同的漏洞累积下来的发现总量可能远超任何单次运行。累积评估的方法很直观把多次运行的所有发现合并在一起去除重复项然后整体打分。通过对比单次平均成绩与多次累积成绩可以观察到几个重要的现象。有些系统在单次运行中表现平平但多次累积后召回率大幅提升说明它的随机探索具有很强的互补性适合反复使用。有些系统则恰恰相反多次累积后准确率急剧下降因为它每次运行都会产生大量重复的误报噪音越积越多反而让结果越来越难用。还有一个特别值得关注的现象研究团队发现通过分析每次运行中被多次发现的漏洞与仅在某次特定运行中被发现的漏洞的比例可以判断系统的随机探索质量。如果一个AI每次都能找到大量新漏洞说明它的随机性是有价值的多样性如果每次都在重复发现同样的东西说明它的随机性不过是低效的抖动。六、效率同样是不可忽视的维度研究团队还明确将运行效率纳入评估框架这在学术研究中颇为少见但在实际部署中极为重要。一个能发现二十个漏洞、但要花三天时间、耗费数千美元API费用的系统和一个发现十八个漏洞、只需两小时、花费几十美元的系统对用户来说价值截然不同。评估框架要求记录每次运行的总耗时和总费用并且鼓励追踪漏洞发现随时间的累积曲线——也就是说不只看最终发现了多少还要看这些发现是在运行早期密集出现还是均匀分布抑或是绝大多数出现在运行末期。如果发现曲线在运行前半段就已趋于平缓意味着后续的大量计算资源投入并没有带来多少额外收益可以考虑缩短运行时间来降低成本。此外框架还提供了一种数据驱动的方法来精简测试套件。在进行迭代开发、消融实验或小规模改进时对全套测试目标做完整评估往往代价高昂。研究团队建议利用历史评估数据在有限预算约束下筛选出一个与完整套件评分结论高度一致的小型子集。筛选标准以Pearson相关系数为主Spearman相关系数为辅确保子集不仅能正确排列系统的相对优劣还能保留性能差异的实际量级。但研究团队也特别提醒这类精简子集只能作为日常快速验证的代理不能取代周期性的完整评估。七、用三款真实AI系统验证这套框架理论固然重要但这套框架能否真正工作研究团队用实际实验给出了回答。他们选择了三款代表性的AI渗透测试系统开源的Strix和PentAGI以及Anthropic公司的通用智能编程助手Claude Code。每款系统分别配合四种大型语言模型后端运行Claude Sonnet 4.6、GPT-5.4、DeepSeek v3.1以及Qwen 3.6 Plus。测试目标选取了三个开源的存在漏洞的应用程序其中vuln-bank包含60个已知漏洞paygoat包含28个xben-090包含20个三个目标合计108个经安全研究员精心标注的漏洞。每种系统与模型的组合都在每个目标上重复运行三次以捕捉随机性带来的波动。在正式评估之前研究团队首先验证了AI评判官自身的可靠性。他们从实验中筛选出50个案例其中25个经人工确认为真实漏洞25个为误报然后让四款不同的AI分别扮演评判官与人工结论对比。结果显示GPT-4.5 Mini和Gemini 3 Flash表现最为可靠前者在三次重复测试中平均只误判约一个案例因此被选定为正式评判官。正式评估的结果揭示了许多仅凭夺旗赛评分无法发现的信息。Claude Code在F1综合分数、漏洞发现总量和运行效率上均表现最佳同时CWE覆盖率最广说明它能识别最多种类的安全问题。然而Claude Code也产生了相当数量的重复发现且准确率81.24%在高报量的情况下意味着会产生大量误报在大规模部署中可能给安全团队带来噪音负担。PentAGI与Claude Sonnet搭配时发现了最高严重性得分的漏洞但代价是最高的运行费用、最长的扫描时间以及最多的误报数量。Strix的策略则相反它产生的误报数量最少输出结果最为干净但代价是漏洞发现总量也最少召回率偏低。在累积评估中这些差异变得更加戏剧化。Strix与Claude Sonnet的组合在三次累积后召回率几乎翻倍而准确率保持相对稳定最终在累积F0.5分数上超越了所有其他配置成为多轮评估场景下的最佳选择。PentAGI与Claude Sonnet的组合则出现了一个反直觉的现象累积后的F1分数低于三次单次运行的平均分数因为每次运行都产生了大量新的误报累积越多、噪音越大、准确率越低。各个独立目标的表现也揭示了截然不同的侧面。xben-090虽然仅包含20个漏洞却成了最严苛的精准度压力测试几乎所有系统在这个目标上都产生了大比例的误报。vuln-bank凭借60个漏洞的规模成为测试覆盖广度的理想场所即使表现最优秀的系统在单次运行中也只能覆盖其中的部分漏洞。paygoat则有一个特别有趣的现象三次累积后各系统之间的性能差距明显收窄一些在单次运行中差距悬殊的系统在累积模式下表现趋于相近。时间维度上的追踪同样提供了洞察。以Claude Code为例在vuln-bank目标上三次独立运行的漏洞发现曲线都呈现出近乎线性的稳定增长说明它在整个运行周期内保持着稳定的探索节奏。而在paygoat目标上某次运行的误报在后半段急剧累积即使此时真实漏洞发现已趋于饱和说明该次运行陷入了低效的过度探索状态是一个缩短运行时间、减少不必要消耗的信号。从统计对比来看claude-code-sonnet在F1上比strix-sonnet高出16.79个百分点p值为0.0141Cohens d达到3.504这是一个既统计显著又实际意义重大的差距。pentagi-sonnet与strix-sonnet的比较则体现了精确率与召回率之间的经典取舍前者的召回率高出17.28个百分点但准确率低了25.70个百分点两个指标的效应量几乎对称说明这两个系统本质上代表了截然不同的策略选择而非简单的优劣之分。归根结底这项研究的价值在于它指出了一件听起来简单却长期被忽视的事评估AI渗透测试系统的方式本身就是这个领域能否健康发展的关键。一套不够真实的考题会让错误的系统脱颖而出让正确的系统默默无闻。而当AI安全工具被部署在金融、医疗等真正关乎社会稳定的基础设施上时评估方法的失误代价将不再只是学术上的遗憾而可能是实实在在的安全漏洞。研究团队已将专家标注的漏洞地面真值数据集和评估框架代码全部开放任何研究者或实践者都可以在此基础上进一步探索。研究的局限性也值得坦诚面对团队没有提出新的测试目标集合实验中也没有尝试带跨轮记忆的连续评估场景安全方面的行为评估例如AI是否会避免执行破坏性操作也尚未纳入框架。这些都是下一步工作的清晰方向。对普通人而言这项研究提醒我们下次看到某个AI安全工具声称在某项测试中取得了多少高分不妨多问一句——这个测试题真的是真实世界的题目吗QAQ1AI渗透测试评估框架的二分图解析是什么意思为什么需要它A在评估AI渗透测试系统时AI的一个发现可能对应多条已知漏洞多个发现也可能对应同一条漏洞。为了避免重复计分研究团队引入了数学上的二分图最优匹配方法使用匈牙利算法确保每条已知漏洞最多只被成功计一次每个AI发现也只能匹配一条漏洞从而得到可靠的真实阳性计数防止重复报告虚抬成绩。Q2为什么单次测试不足以评估AI渗透测试系统的水平AAI渗透测试系统依赖大型语言模型其输出天然存在随机波动同一系统在不同时刻面对相同目标可能产生差异显著的结果。单次测试只是众多可能结果中的一个快照无法反映系统的平均水平和稳定性。研究团队建议多次重复运行汇报均值与标准差并同时使用Welchs t检验和Cohens d效应量以便在样本量有限的情况下也能对系统差异做出较为全面的判断。Q3累积评估和单次评估有什么本质区别为什么累积评估更接近真实使用场景A单次评估衡量一次运行能发现多少漏洞而累积评估将多次独立运行的发现合并去重后统一打分模拟安全团队对同一系统反复进行渗透测试的真实工作模式。由于不同次运行可能探索不同路径累积发现总量往往超过单次最优表现能更真实地反映AI工具在持续使用中的价值。但研究也发现对于每次都产生大量误报的系统累积反而会导致噪音越积越多综合评分下降这是选择工具时不可忽视的实际风险。