指南:从 Harbor Smoke Eval 到评估体系路线图)
Kilo 基准测试Benchmarking指南从 Harbor Smoke Eval 到评估体系路线图【免费下载链接】kilocodeKilo is the all-in-one agentic engineering platform. Build, ship, and iterate faster with the most popular open source coding agent.项目地址: https://gitcode.com/GitHub_Trending/ki/kilocode导读本文基于 benchmarking.md 展开梳理 Kilo Code 当前已落地的基准测试证据Harbor 烟测工作流、云端模型评估数据链路与尚未验证的评估路线图Harbor 适配器、ATIF 轨迹、Opik 集成。你将掌握基准测试要回答的两个核心问题、仓库中 smoke-test 工作流的具体执行细节触发方式、依赖、两个烟测任务、产物上传以及贡献者在把评估命令写入文档前必须满足的验证要求。Benchmarking 要回答的两个核心问题Kilo Code 的基准测试体系围绕两个独立问题设计模型对比Model comparison在同一个 Kilo Code Agent 之上使用不同模型结果如何差异Agent / 版本对比Agent comparison在同一个模型与任务集之上使用不同 Agent 或不同 Kilo Code 版本结果如何差异这两个问题分别隔离了模型变量与代理变量是后续所有评估设计任务集、对比维度、轨迹分析的出发点。需要特别强调的是基准测试与生产可观测性是两套体系。生产可观测性见 agent-observability.md监控的是真实会话的运行状态指标、会话摄入、告警评估等而基准测试运行的是受控的评估任务用于在发布前、模型切换前获得可复现的质量信号。该文档的边界声明也很明确页面内容只区分已核实的仓库证据与路线图规划不保证私有基准工具、外部适配器或示例命令对贡献者立即可用。当前已核实的评估证据文档以证据表的形式给出了现状Status 为Partial即部分落地能力状态证据与边界Harbor 面向的烟测评估Harbor-facing smoke eval当前工作流.github/workflows/smoke-test.yml检出私有仓库Kilo-Org/kilo-bench安装依赖后通过仓库脚本运行两个烟测任务CLI 发布烟测覆盖CLI release smoke coverage当前工作流工作流可测试最新 npm CLI也可测试指定版本的发布产物随后校验结果烟测结果产物Smoke result artifacts当前工作流工作流上传 result、trajectory 与 agent 安装日志供检查云端模型评估数据摄入Cloud model eval ingest当前服务静态源码检查发现services/model-eval-ingest/的推广同步promotion sync表面私有kilo-bench内部实现此处未验证私有仓库脚本、适配器行为与支持的本地命令不在已检查文档范围内生产环境启用情况此处未验证静态源码无法证明部署、灰度、留存或供应商配置可见已核实的证据集中在工作流文件层面而私有基准仓库的内部脚本、适配器行为、生产环境启用情况均明确标注为未验证这也是整篇文档刻意保持严谨的原因。仓库中的 smoke-eval 工作流源码级拆解文档明确指出现有烟测工作流为.github/workflows/smoke-test.yml该文件在仓库中真实存在。以下是结合源码的完整拆解。工作流定位与触发方式从 smoke-test.yml 的头部注释可见其定位独立的烟测工作流——检出 kilo-bench 并对最新发布的 CLI或指定版本运行一小撮 Harbor 评估任务。它有两种触发方式workflow_dispatch手动在 Actions 页面触发可传可选输入cli_version例如7.0.36留空则测试最新 npm 发布版workflow_call由发布工作流在草稿发布产物上传后调用。工作流还配置了concurrency组group: smoke-test不取消进行中的运行与timeout-minutes: 30的上限。前置条件与所需 Secrets工作流运行需要三个 Secrets缺少时会在 Validate API key 步骤直接报错退出Secret用途KILO_API_KEYKilo Gateway 密钥用于驱动评估中的模型请求KILO_ORG_IDKilo 组织 IDBENCH_GITHUB_TOKEN具有Kilo-Org/kilo-bench私有仓库contents:read权限的 PAT用于检出基准仓库执行步骤流水线工作流运行在blacksmith-2vcpu-ubuntu-2404运行器上完整步骤为检出 kilo-benchactions/checkoutv6检出Kilo-Org/kilo-bench使用BENCH_GITHUB_TOKEN安装 uvastral-sh/setup-uvv6开启缓存设置 Pythonuv python install 3.13安装依赖uv sync --no-dev校验 API keyKILO_API_KEY为空则输出 error 并退出下载 CLI 产物cli_version为空则测试最新 npm 版否则用gh release download v$VERSION --pattern kilo-linux-x64.tar.gz从发布草稿下载对应归档并以环境变量KILO_CLI_PATH传给后续步骤运行两个烟测任务见下文校验结果python3 scripts/validate_smoke_test.py jobs/smoke-test-*/脚本位于私有 kilo-bench 仓库中上传产物if: always()保证即使失败也上传供排查。两个烟测任务工作流通过私有仓库脚本./scripts/run_eval.sh运行两个任务使用模型kilo/anthropic/claude-sonnet-4.6任务数据集选择工作流中记录的预期范围hello-world-d hello-world小规模烟测任务log-summary-date-ranges-d terminal-bench-sample --include-task-name log-summary-date-ranges小型终端基准Terminal-Bench样例两个任务都附加了--job-namesmoke-test-hello-world/smoke-test-log-summary与--timeout-multiplier 2。关于超时倍增器的设计工作流注释中有详细说明Harbor 默认的 agent-setup 超时为 360 秒而hello-world容器FROM ubuntu:24.04在 CLI 真正下载前需要执行apt-get update、apt-get install、NodeSource 的curl|bash以及apt install nodejs在 Blacksmith 运行器上若 apt 镜像或 NodeSource CDN 变慢可能超过 6 分钟并触发AgentSetupTimeoutError。将 multiplier 设为 2 可为瞬时镜像/CDN 波动留出余量该参数会统一缩放 setup、agent、verifier、env build 的超时但它们都是上限值因此无害。成本与产物工作流注释给出了成本预期hello-world约$0.01log-summary-date-ranges约$0.13总成本预期低于$0.50墙钟时间低于 15 分钟。这组数据来自仓库内注释可作为该烟测在发布门禁场景下开销的参考。上传产物名为smoke-test-results路径包括jobs/smoke-test-*/**/result.json评估结果jobs/smoke-test-*/**/trajectory.json轨迹jobs/smoke-test-*/**/agent/setup/*.txtCLI 安装脚本的标准输出/错误/返回码用于定位卡住的步骤产物保留 30 天retention-days: 30if-no-files-found: warn避免空目录导致硬失败。注释特别说明kilo-bench 的安装脚本使用set -euo pipefail无set -x且从不回显认证令牌或 API 密钥因此上传安装日志是安全的。与发布流程的衔接在 publish.yml 中烟测被编排为预发布门禁smoke-test任务依赖version与build-cli仅在github.repository Kilo-Org/kilocode时执行通过uses: ./.github/workflows/smoke-test.yml复用工作流并传入cli_version: ${{ needs.version.outputs.version }}与secrets: inherit。最终的publish任务在依赖列表中包含smoke-test意味着烟测未通过则不会进入发布步骤。这从调用链上印证了文档中CLI 发布烟测覆盖与发布前跑稳定子集的规划方向。文档对上述证据的定性是这证明了 smoke 覆盖存在但不能据此推断出公开的 Harbor 适配器契约或贡献者可直接使用的本地 CLI。Cloud model-eval-ingest 的证据边界文档指出静态源码检查在云端发现了services/model-eval-ingest/服务用于推广同步promotion sync。需要严格对待的边界是这仅代表当前仓库定义的服务表面repository-defined surface部署环境、滚动节奏、数据留存与供应商配置必须另行验证不能在验证之前作出生产级声明。路线图待验证的评估能力文档给出了清晰的路线图其中除烟测外均标注为未验证/规划中能力状态预期用途面向贡献者的 Harbor 适配器未验证路线图在受控评估环境中自主运行 Kilo CLIATIF 轨迹适配器未验证路线图输出结构化 step 级轨迹用于对比Opik 集成未验证路线图摄入轨迹并对比评估运行标准模型对比工作流规划中跨模型对比质量、成本与墙钟时间标准 Agent 对比工作流规划中在同一任务上对比不同 Agent 或 Kilo 版本自定义任务集模板规划中构建聚焦的回归或能力套件烟测之外的 CI 回归套件规划中在发布前运行稳定子集拟议评估设计Harbor ATIF Opik 的组合文档提出的更完整评估设计可复用开源评估组件但前提是在实现过程中逐一验证适配器可用性组件路线图角色需要验证的内容Harbor评估框架与数据集确认支持的 Kilo 适配器及调用契约ATIF结构化轨迹确认输出的字段与推理数据策略Opik轨迹摄入与分析确认 Harbor 集成配置与 Kilo 适配器支持Terminal-Bench 或其他数据集受控任务确认版本、许可证与任务选择潜在架构文档原文Evaluation task set - controlled trial environment - verified Kilo adapter - model request - result and optional trajectory artifacts - smoke validation, aggregate analysis, or trace analysis这条链路与现有 smoke 工作流完全吻合任务集即hello-world/terminal-bench-sample受控环境即 Harbor 容器如ubuntu:24.04模型请求即kilo/anthropic/claude-sonnet-4.6产物即result.json/trajectory.json最后一步即validate_smoke_test.py或未来的聚合/轨迹分析。拟议对比维度对比类型固定输入变量衡量指标模型对比Kilo Code Agent 任务集模型完成度Completion、成本Cost、墙钟时间Agent 对比模型 任务集Agent 或 Kilo Code 版本完成度、成本、墙钟时间轨迹分析评估任务运行轨迹工具选择、错误、重复步骤模型对比与 Agent 对比共享完成度 / 成本 / 墙钟时间三个指标从质量与资源消耗两个维度给出可量化的决策依据轨迹分析则深入到单次运行内部回答工具选得对不对、哪里出错、是否原地打转这类行为层面的问题。命令验证要求什么不能直接写进文档文档提出了明确的命令纪律不要将opik harbor run -a kilo、kilo --auto、kilo run --auto当作开箱即用的接口写进文档除非在相关仓库中验证了适配器与自主 CLI 调用确实可行。私有kilo-bench工作流命令只是实现证据不是面向公众的使用保证。这一点直接约束了贡献者在写评估类文档时的措辞边界。未来交付物验证并文档化受支持的自主 CLI 调用方式验证 Harbor 适配器的归属与可用性定义 ATIF 导出字段与数据处理策略在发布任何命令前验证 Opik 摄入路径仅在本地复现成功后才发布贡献者工作流在成本与运行时长允许的前提下将 smoke 覆盖扩展为稳定的回归子集。参考资料仓库内延伸阅读本文依据benchmarking.md烟测工作流源码smoke-test.yml发布门禁调用链publish.yml与基准测试区分的生产可观测性agent-observability.md结论Kilo 的基准测试当前处于烟测落地、体系待建的阶段。仓库内已有可独立运行、可接入发布门禁的 Harbor 烟测工作流含成本与超时设计而 Harbor 适配器契约、ATIF 轨迹、Opik 摄入等更完整的评估体系仍属路线图须逐项验证后方可文档化与对外承诺。【免费下载链接】kilocodeKilo is the all-in-one agentic engineering platform. Build, ship, and iterate faster with the most popular open source coding agent.项目地址: https://gitcode.com/GitHub_Trending/ki/kilocode创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考