
PentAGI Moonshot 模型全 Agent 能力测试报告kimi-k2.5 / k2.6 在渗透测试自动化中的 295/295 全通过实测【免费下载链接】pentagiFully autonomous AI Agents system capable of performing complex penetration testing tasks项目地址: https://gitcode.com/GitHub_Trending/pe/pentagi本篇指南以 PentAGI 开源仓库中的 examples/tests/moonshot-report.md 测试报告为核心深入解读 MoonshotKimi系列模型接入该自主渗透测试 Agent 系统后的实测结果13 类 Agent、295 个用例全部通过、总体平均延迟 3.353s。读完本文你将掌握 PentAGI 的 Agent 测试框架如何运作、测试报告中的各项指标如何解读、kimi-k2.5 与 kimi-k2.6 在推理/工具调用/流式/记忆等能力上的真实差异以及如何依据 examples/configs/moonshot.provider.yml 这类配置复现与验证同级别的模型接入质量。一、报告概览这是一次什么样的测试moonshot-report.md生成于 2026-07-23是 PentAGI 针对 MoonshotKimi提供商在全部 13 种 Agent 角色上的自动化测试结果。核心结论如下指标结果测试总数295 个用例通过数295100.00%覆盖 Agent 类型13 种总体平均延迟3.353s参与模型kimi-k2.5、kimi-k2.6报告按Agent → 测试分组Basic / Advanced / Capability→ 单个用例三层组织每个用例给出通过状态✅ Pass、单次延迟Latency与错误信息Error。这一结构与 PentAGI 的测试执行框架一一对应测试由 backend/pkg/providers/tester/runner.go 中的TestProvider驱动从 backend/pkg/providers/tester/testdata/tests.yml 加载内嵌用例定义按 backend/pkg/providers/tester/config.go 中的默认分组Basic、Advanced、Knowledge并行执行最终由groupResults按 13 种 Agent 类型归并成 backend/pkg/providers/tester/result.go 定义的ProviderTestResults结构。二、13 类 Agent 与两款 Kimi 模型的分工报告中的 13 类 Agent 对应 PentAGI 渗透测试流水线中的不同职责角色通过 backend/pkg/providers/pconfig/config.go 中的ProviderOptionsType枚举定义。汇总各 Agent 的模型分配与表现Agent模型Reasoning成功率平均延迟角色定位据源码结构与模板推断simplekimi-k2.5true24/241.796s基础完成/对话能力基准simple_jsonkimi-k2.5true7/71.967sJSON 结构化输出专用primary_agentkimi-k2.5true24/243.957s主循环编排任务拆解与调度assistantkimi-k2.5true24/244.266s助手式交互与工具使用generatorkimi-k2.6true24/244.365s内容/代码生成refinerkimi-k2.6true24/244.738s结果精炼与格式整理adviserkimi-k2.6true24/244.320s安全建议与方案咨询reflectorkimi-k2.5true24/242.589s反思/自检默认关闭思考searcherkimi-k2.5true24/242.311s搜索查询构造enricherkimi-k2.5true24/242.184s情报/上下文增强coderkimi-k2.6true24/244.455s漏洞利用代码编写installerkimi-k2.5true24/241.340s环境/工具安装操作pentesterkimi-k2.6true24/244.322s渗透执行主 Agent观察两个明显的数据分层kimi-k2.5 系simple、reflector、searcher、enricher、installer 等承担编排、搜索、反思、安装等低延迟任务平均延迟普遍落在1.3s ~ 4.3s区间其中 installer1.340s、simple1.796s最快kimi-k2.6 系generator、refiner、adviser、coder、pentester承担生成、精炼、渗透等高强度推理任务平均延迟集中在4.3s ~ 4.8s。需要说明的是报告中的Reasoningtrue表示该轮测试用例运行在开启推理thinking的线路上详见下文“能力门控”而 examples/configs/moonshot.provider.yml 中 reflector/searcher/enricher 等角色实际配置为thinking: {type: disabled}其 Reasoning 列仍为 true说明 Reasoning 标记反映的是测试通道而非最终模型行为具体角色是否真正思考以 Agent 自身 YAML 配置为准。三、测试用例体系Basic、Advanced 与 Capability 三层结构3.1 用例如何定义与加载所有内置用例定义在 backend/pkg/providers/tester/testdata/tests.yml通过//go:embed嵌入二进制由 backend/pkg/providers/tester/testdata/registry.go 的LoadBuiltinRegistry加载为TestRegistry再按TestGroupbasic / advanced / knowledge划分为测试套件。用例类型有三种由createTestCase分派completion纯文本补全验证模型的基础对话、数学、领域知识jsonJSON 输出校验验证结构化生成能力tool工具调用验证 function calling 的参数构造与工具选择。3.2 Basic Tests基础能力基准Basic 组覆盖 8 个用例含 3 个流式变体在报告中每个 Agent 都稳定通过。以math_simple为例tests.yml 第 2-8 行- id: math_simple name: Simple Math type: completion group: basic prompt: What is 22? Write only the number without any other text. expected: 4 streaming: false同时还包括Text Transform Uppercase、Count from 1 to 5、Math Calculation等系统-用户双角色消息用例以及echo_function_basic这类“必须调用工具而非生成文本”的工具强制用例。从报告延迟看该组各 Agent 普遍在 0.2s4s 内完成。3.3 Advanced Tests函数调用、记忆与多轮上下文Advanced 组是验证“Agent 化”能力的关键报告中每个 Agent 都执行了 16 个该组用例主要包括函数调用JSON Response Function、Search Query Function、Ask Advice Function及流式变体记忆与多轮上下文Basic Context Memory Test、Function Argument Memory Test验证模型记得此前工具调用的 query 参数、Function Response Memory Test验证记得工具返回的温度数值渗透领域综合Penetration Testing Memory with Tool Call多轮 nmap → web_scan → generate_report 工具链、Cybersecurity Workflow Memory Test端口扫描 → SQLi 检测 → SSH 爆破的完整取证链路文件编辑Read a file, then edit it via unified diff——这是唯一一个不用 YAML 定义、而是在 Go 代码中动态构建的用例见 backend/pkg/providers/tester/runner.go 第 120-158 行与 backend/pkg/providers/tester/file_edit.go它通过MultiTurnTestCase接口模拟“先 read_file、再基于 unified diff 编辑”的真实工作流每个 Agent 需要独立的用例实例以避免多轮会话状态串扰。值得注意的是Cybersecurity Workflow Memory Testtests.yml 第 655-721 行包含一次包含ssh_bruteforce、sql_injection_test、port_scan三个工具的 7 轮消息链最终要求模型只回答域名example.com——这是对多轮上下文保持与事实抽取的综合考验。3.4 渗透领域知识专项Knowledge 组moonshot-report.md的 Advanced 小节中可见的渗透领域用例Penetration Testing Methodology、Vulnerability Assessment Tools、SQL Injection Attack Type、Penetration Testing Framework、Web Application Security Scanner、Penetration Testing Tool Selection实际来自 tests.yml 中的knowledge组验证模型在侦察reconnaissance、利用exploitation、扫描scanning等渗透方法论与工具选型上的正确性。报告数据表明这类用例是各 Agent 延迟波动最大的部分例如Penetration Testing Methodology在 primary_agent 上耗时 13.352s而在 reflector 上仅 4.302s反映出知识组用例的作答耗时高度依赖模型当时的思考路径长度。3.5 Capability 用例能力门控的专项验证simple_json 是唯一执行 Capability 用例的 Agent其Structured Output With JSON Schema通过 backend/pkg/providers/tester/capability.go 的capabilitySupported门控验证模型在收到 JSON Schematests.yml 第 113-141 行的person_infoschema时能否产出 schema 约束下的严格 JSON。PentAGI 对能力用例的过滤逻辑backend/pkg/providers/tester/runner.go 第 100-106 行非常关键只有当 Agent 的真实配置在运行时确实会触发某条能力线路时对应用例才会被下发。例如adaptive_thinking用例只在UsesAdaptiveThinking判定为真的 Agent 上执行reasoning_off用例只在Reasoning.EffectiveMode() ReasoningModeOff的 Agent 上执行——这正是报告中“每个 Agent 的用例数未必相同、但全部 100% 通过”的机制保障也解释了为何moonshot-report.md中未出现任何 adaptive_thinking / reasoning_off 用例该测试所用 moonshot.provider.yml 未启用相应线路。四、全量测试数据详解13 个 Agent × 24 用例以下逐 Agent 列出报告中完整保留的延迟明细单位秒便于横向对比与归档引用。simplekimi-k2.5平均 1.796sBasicSimple Math 0.895 / Text Transform Uppercase 1.297 / Count 1-5 1.032 / Math Calculation 0.969 / Basic Echo Function 3.208 / Streaming Simple Math 0.808 / Streaming Count 1-3 0.986 / Streaming Basic Echo Function 1.959。AdvancedJSON Response Function 1.425 / Search Query Function 1.535 / Ask Advice Function 1.619 / Streaming Search Query 1.114 / Basic Context Memory 1.013 / Function Argument Memory 0.867 / Function Response Memory 0.900 / Pentest Memory with Tool Call 2.500 / Cybersecurity Workflow Memory 0.923 / Read-edit via unified diff 4.219 / Pentest Methodology 3.738 / Vulnerability Assessment Tools 2.997 / SQL Injection Attack Type 1.121 / Pentest Framework 3.280 / Web App Security Scanner 3.237 / Pentest Tool Selection 1.440。simple_jsonkimi-k2.5平均 1.967sAdvancedVulnerability Report Memory Test 2.467 / Project Information JSON 1.150 / User Profile JSON 1.212 / Person Information JSON 3.402 / JSON Array Response Without Schema 1.093 / Streaming Person Info JSON 1.077。CapabilityStructured Output With JSON Schema 3.365。primary_agentkimi-k2.5平均 3.957sBasic2.305 / 2.342 / 2.497 / 2.481 / 1.815 / 1.669流式数学/ 2.113流式计数/ 3.913流式 echo。Advanced2.038 / 1.937 / 2.215 / 1.998 / 3.114 / 2.322 / 1.849 / 4.368 / 2.494 / 5.740diff 编辑/ 13.352方法论/ 8.196漏洞评估工具/ 4.320SQLi 类型/ 10.678框架/ 8.652Web 扫描器/ 2.552工具选型。assistantkimi-k2.5平均 4.266sBasic2.380 / 2.331 / 2.426 / 2.075 / 2.262 / 2.023 / 4.728 / 3.033。Advanced2.140 / 1.916 / 4.464 / 3.774 / 2.999 / 2.366 / 1.823 / 6.054 / 2.396 / 5.359 / 11.012 / 8.955 / 3.065 / 11.366 / 10.102 / 3.317。generatorkimi-k2.6平均 4.365sBasic1.913 / 2.192 / 3.272 / 1.969 / 2.705 / 1.686 / 2.868 / 3.255。Advanced2.243 / 2.619 / 3.650 / 2.351 / 2.882 / 3.427 / 3.298 / 4.572 / 2.705 / 8.207 / 8.700 / 12.066 / 4.792 / 12.127 / 7.843 / 3.398。refinerkimi-k2.6平均 4.738sBasic3.139 / 2.017 / 2.373 / 2.178 / 2.085 / 5.937 / 4.080 / 2.923。Advanced5.016 / 3.299 / 3.688 / 2.842 / 2.909 / 2.791 / 2.528 / 4.526 / 3.346 / 6.351 / 11.479 / 7.501 / 8.031 / 7.261 / 14.175Web 扫描器全报告单用例最高之一/ 3.236。adviserkimi-k2.6平均 4.320sBasic2.295 / 3.447 / 4.048 / 1.847 / 1.917 / 2.278 / 3.744 / 2.216。Advanced2.189 / 2.661 / 3.112 / 2.570 / 2.852 / 2.158 / 3.948 / 5.220 / 3.178 / 8.016 / 12.722 / 9.431 / 3.374 / 9.579 / 7.260 / 3.605。reflectorkimi-k2.5平均 2.589sBasic1.041 / 0.980 / 1.225 / 0.850 / 5.903 / 1.063 / 1.048 / 5.683。Advanced3.408 / 1.334 / 1.613 / 1.318 / 2.537 / 2.855 / 0.857 / 5.121 / 0.871 / 4.488 / 4.302 / 3.465 / 1.112 / 5.472 / 2.119 / 3.445。searcherkimi-k2.5平均 2.311sBasic0.978 / 0.994 / 1.165 / 0.940 / 1.388 / 0.959 / 1.065 / 5.431。Advanced3.495 / 1.219 / 1.444 / 1.237 / 1.257 / 1.342 / 0.225 / 4.309 / 0.209 / 7.008 / 5.034 / 4.613 / 1.003 / 4.241 / 2.512 / 3.387。enricherkimi-k2.5平均 2.184sBasic0.232 / 0.224 / 1.100 / 0.963 / 1.470 / 0.851 / 1.045 / 1.353。Advanced3.472 / 1.430 / 0.218流式搜索/ 4.921 / 1.303 / 1.036 / 0.214 / 4.652 / 0.212 / 9.266 / 3.660 / 4.067 / 1.244 / 3.793 / 4.408 / 1.273。coderkimi-k2.6平均 4.455sBasic3.659 / 2.506 / 4.214 / 1.777 / 2.076 / 2.050 / 3.035 / 3.241。Advanced2.432 / 3.953 / 2.887 / 3.064 / 2.934 / 2.628 / 3.309 / 5.068 / 2.931 / 7.246 / 9.288 / 12.754 / 3.329 / 10.587 / 8.721 / 3.211。installerkimi-k2.5平均 1.340s全报告最快Basic2.428 / 0.214 / 0.214 / 0.213 / 0.336 / 0.220 / 0.218 / 0.212。Advanced0.218 / 0.305 / 0.210 / 0.212 / 0.210 / 0.208 / 0.210 / 0.215 / 0.212 / 0.436 / 11.948方法论/ 0.217 / 0.216 / 12.837框架/ 0.212 / 0.216。pentesterkimi-k2.6平均 4.322sBasic2.417 / 2.190 / 2.829 / 1.977 / 3.627 / 2.141 / 4.264 / 2.765。Advanced2.237 / 2.821 / 3.527 / 3.081 / 2.819 / 2.171 / 3.305 / 4.360 / 3.502 / 7.206 / 10.850 / 7.985 / 5.954 / 10.774 / 7.508 / 3.406。从数据可以归纳几点可复用的判断缓存/确定性任务的延迟极低installer 的多数基础用例在 0.2s 附近完成说明模型对固定指令如“仅输出数字”具备高度确定性的响应这类路径可作为日常可用性探针知识类用例延迟方差最大同一用例在不同 Agent 上从 0.2s 到 14s 不等反映了思考链长度的真实波动不宜以单次延迟做硬性 SLAk2.6 系整体慢于 k2.5 系约 2 倍这与 k2.6 配置为 thinking 全开keep: all且面向高推理任务的角色定位一致。五、从报告到配置moonshot.provider.yml 的关键参数解读报告背后的运行配置为 examples/configs/moonshot.provider.yml而仓库内的官方模型配置参考是 backend/pkg/providers/kimi/config.yml该文件还详细记录了各模型家族的 API 约束如 kimi-k3 不支持thinking参数、kimi-k2.7 系列仅接受type: enabledkeep: all等。两类配置的核心字段一致按 Agent 分组定义model该 Agent 使用的模型名temperature/top_p/n采样参数。k2.5 非思考态固定为 0.6思考态固定为 1.0top_p 0.95n 1max_tokens输出上限从 simple 的 8192 到 generator/refiner 的 32768 不等extra_body透传给 API 的扩展体。thinking.type: enabled/disabled控制是否开启推理thinking.keep: all仅 k2.6 及以上支持保留完整思考链tool_choice: auto允许模型自主选择工具price成本核算字段input/output/cache_read单位为美元/百万 token用于 PentAGI 的费用统计。报告中 kimi-k2.5 与 kimi-k2.6 的Reasoning列全部为 true与配置的对应关系是k2.5 的 reflector/searcher/enricher/simple 配置为thinking: disabled其推理关闭但测试通道仍为 reasoning 标记k2.6 系generator/refiner/adviser/coder/pentester与 k2.5 的 primary_agent/assistant/installer 配置为thinking: enabled走真实推理线路。这一差异在 backend/pkg/providers/kimi/config.yml 顶部的注释中被特别强调langchaingo 会对包含 2.5 子串的模型名强制覆盖 temperature 为 1.0因此 k2.5 非思考态需要把temperature: 0.6冗余写入extra_body以绕开该覆盖——这解释了为何 simple/reflector 等段落中 temperature 出现了两次。六、测试是如何执行的并行 Worker 与结果归并从源码层面moonshot-report.md的生成链路如下backend/pkg/providers/tester/runner.go 的TestProvider接收 provider 实例与选项WithAgentTypes、WithGroups、WithStreamingMode、WithVerbose、WithParallelWorkers加载内置注册表collectTestRequests遍历各测试组为每个 Agent × 用例 构造请求期间应用三类过滤流式开关Streaming()且关闭流式则跳过、Agent 类型兼容simple_json 只跑 JSON 类用例其余 Agent 跳过 JSON 类、能力门控capabilitySupportedexecuteTestsParallel以默认 4 个并发 workerbackend/pkg/providers/tester/config.go 的parallelWorkers: 4并行执行executeTest根据用例形态分派到CallWithExtraOptions/CallWithTools含多轮MultiTurnTestCase循环/CallEx/Call四条线路工具类用例会先验证模型返回的 function_name 与 arguments 是否符合expected再由TestCase.Execute产出结果groupResults将结果按 13 个 Agent 槽位归并为 backend/pkg/providers/tester/result.go 的ProviderTestResults最终序列化为本报告中的总体表与明细表。报告中每个用例的 Latency 即executeTest起始到返回的墙钟时间runner.go 中time.Since(startTime)。若模型能力不被支持如结构化输出被 SDK 主动拒绝会被标记为Unsupported而非硬性失败见isUnsupportedCapabilityError对ErrStructuredOutputUnsupported等哨兵错误的识别。七、如何复现与验证PentAGI 的模型测试框架位于 backend/pkg/providers/tester使用ctester命令行工具backend/cmd/ctester对任意提供商执行此类测试。要复现 Moonshot 场景可按以下思路操作准备一份仿照 examples/configs/moonshot.provider.yml 的提供商配置或在本地为 kimi 提供商设置 API Key指定 13 个 Agent 的模型与extra_body.thinking策略运行测试框架并开启 verbose对应WithVerbose(true)观察每个[PASS] agent - test (latency)输出校验报告中的三类指标成功率应接近 100%能力不支持的用例会显示为 Unsupported、总体平均延迟、各 Agent 分组的用例覆盖数若需定向验证可通过WithAgentTypes/WithGroups/WithStreamingMode(false)等选项缩小范围例如仅验证simple_json的 JSON Schema 能力或关闭流式用例以节省调用。需要注意报告的延迟与成功率受模型服务端负载、API 限流、网络与推理参数temperature、thinking 开关影响不同时间复现的绝对值会有波动报告的价值在于横向对比同一批用例下各 Agent/模型的相对表现以及验证配置与能力门控是否正确生效。八、结论与建议moonshot-report.md表明在 PentAGI 的完整 Agent 测试矩阵下Moonshot kimi-k2.5 / kimi-k2.6 组合实现了 295/295 全通过、总体平均延迟 3.353s 的成绩kimi-k2.5胜任编排、搜索、反思、安装等对延迟敏感的任务确定性响应极快0.2s 级kimi-k2.6胜任生成、精炼、渗透等高推理负载虽延迟更高4.3s4.8s 均值但结合keep: all的完整思考链在工具链调用与领域知识用例上表现稳定测试框架的能力门控机制保证了“用例即真实运行线路”因此 100% 通过率具有较高的配置有效性含义而非简单的提示词模板匹配。如需进一步深入可继续阅读仓库内的 backend/pkg/providers/tester/testdata/tests.yml全部 40 用例定义、backend/pkg/providers/tester/runner.go执行与归并逻辑、backend/pkg/providers/tester/capability.go能力门控以及 examples/tests 目录下其他提供商的同类报告进行横向对比。【免费下载链接】pentagiFully autonomous AI Agents system capable of performing complex penetration testing tasks项目地址: https://gitcode.com/GitHub_Trending/pe/pentagi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考