Resource2Skill: Distilling Executable Skills from Human-Created Resources for Software Agents
阅读笔记Resource2Skill — Distilling Executable Skills from Human-Created Resources for Software AgentsTL;DR这篇论文用从多模态人类资源教学视频、代码库、文章、参考制品蒸馏出可执行技能、再组织成层级化多模态 Skill Wiki的方法回答“能否自动从多模态资源尤其是教学视频里提炼出软件 agent 可复用的技能”这个问题。核心结论是装备该技能库的 agent 在 7 个创作类软件任务上平均比无技能 agent 高 11.9 个百分点并在 28 个主对比格子里的 26 个上击败 Claude Code / Codex 两个现成 harness最关键证据是消融显示教学视频是不可替代的资源源去掉视频平均从 68.9% 掉到 59.4%。主要 caveat判官与 agent 同属 GPT-5.x 家族存在同族偏好嫌疑且 11.9pp 的 headline 用的是刻意最弱的“无技能”baseline——换上产品级 harness 后技能库的边际收益缩到约 6pp进一步消融表明大部分提升来自“喂给 agent 经过整理的技能文本”多模态与层级化是真实但偏小的增量。1. 研究内容1.1 研究问题、痛点与动机研究问题能否自动从多模态人类创作资源尤其是教学视频中蒸馏出可执行技能并为软件 agent 构建一个可扩展、可维护的技能库痛点现有 agent 技能库的来源受限于三种——专家手写如 Anthropic Agent Skills、从 agent 自身交互 trace 累积如 Voyager / AWM / SkillFlow、或从纯文本/代码挖掘如 SkillFoundry。这漏掉了人类学创作类软件最自然的方式看教程视频。视频里有文本无法表达的东西——操作的时序、每一步编辑的视觉前后变化、 tacit 的设计选择。而把原始视频直接塞进 agent 记忆又贵又冗余一段教程里大量无关 setup 与 narration压成纯文本摘要又会丢掉“视频之所以有用”的动态信息。难点在于把视频等资源里的过程性信号抽出来、归一化成可复用表征、组织好让 agent 能高效检索并执行。动机 / 为什么重要软件 agent 越来越被期待“产出高质量制品”幻灯片、表格、网页、3D 场景、CAD、音频工程其成败很少取决于孤立的事实知识更多取决于可复用的过程性 know-how——怎么分解目标、用哪个工具/API pattern、中间检查什么状态、失败怎么恢复。把这些过程性知识从“经验”转成“可复用专长”是 agent 落地的关键瓶颈而教程视频是未被充分利用的最大人力专长矿。领域定位应用 系统构建方向上游是教学视频/公开代码/文档等“人类资源”与 LLM agent 工具使用研究下游是创作类软件办公/3D/音频/CAD的自动化 agent。1.2 核心贡献资源到技能的学习范式把“从多模态人类资源蒸馏可复用可执行技能”形式化为一个问题以教学视频为关键但此前未被用起来的过程性/感知性知识源新范式角度不是增量改进。层级化多模态技能库Skill Wiki每个技能是s (p, x_text, x_visual, x_code, m)——分类路径 文本说明 视觉示例 可执行/可改代码 元数据/出处按领域特定 taxonomy 组织成层级 wikibrowse-and-read 接口跨领域共享。统一的离线-在线构建流水线同一个构造算子(f_θ, A_D)既离线蒸馏大规模资源、也在推理时技能库覆盖不足时在线“补洞”使库可增量扩展、可维护。跨 7 个商业创作域的广泛实证PPT / Excel / Web / Blender / CAD / UE5 / Reaper配对消融逐一隔离资源源、模态格式、库规模、在线获取、选择策略的贡献。1.3 相关工作脉络flowchart LR subgraph trace_line[在线 trace 挖掘单域 · 文本/代码]voyager[Voyagerbr/Wang et al., 2024]awm[AWMbr/Wang et al., 2024]asi[ASIbr/Wang et al., 2025]skillflow[SkillFlowbr/Zhang et al., 2026]end skillfoundry[SkillFoundrybr/Shen et al., 2026br/离线文本/代码 → 知识树科学计算]anthropic[Agent Skillsbr/Anthropic, 2025br/手工编写 bundle]subgraph resource_line[人类多模态资源此前仅作预训练/检索语料]video_res[HowTo100M / Ego4Dbr/MineDojo / COINbr/教学视频]code_res[CodeSearchNet / Codexbr/公开代码文档]end trace_line --|启发技能库抽象|this_paper skillfoundry --|离线挖掘思路|this_paper video_res --|蒸馏为可执行技能新|this_paper code_res --|蒸馏为可执行技能新|this_paper anthropic -.-|对照手工 vs 自动获取|this_paper this_paper[Resource2Skillbr/Fan et al., 2026br/多模态 · 层级 wiki · 离线在线 · 7 域]关键传承Voyager / AWM / ASI / SkillFlow 一线确立了“agent 技能库”这个抽象把过程性知识从权重/提示里拿出来变成显式可复用条目SkillFoundry 一线证明了“离线挖掘资源进知识树”可行Resource2Skill 把这两条线的精华显式技能库 离线挖掘接过来。分歧与 trace 挖掘一线的根本差异是知识来源——前者只用 agent 自己跑出来的 trace文本/代码、单域本文用人类创作的多模态资源含视频与 SkillFoundry 的差异是模态与域——前者仅文本/代码、面向科学计算本文多模态文本视觉代码、面向创作类软件并加上受控在线补洞与制品级视觉/音频判官评估。教学视频这条平行线HowTo100M 等此前只被当作预训练或检索语料“整块吞下”本文首次把它蒸馏成经过校验的结构化技能。2. 方法概要方法路线系统构建 受控实证7 域 × 4 后端 × 多消融。关键假设显式从人类资源蒸馏的技能 从 agent trace 生成的技能层级 wiki 检索 扁平检索多模态 纯文本视频是不可替代的源。隐式读者识别vision-capable LMGPT-5.4/5.5能从关键帧/代码/散文里可靠蒸馏出结构化、可执行的技能5 个确定性 gate 足以过滤坏技能80 条/域的 benchmark brief 能代表该域任务分布判官评分与人类偏好一致。数据 / 实验设置7 个创作域每域 80 条 screened brief主对比/规模/在线研究用匹配的 N80消融用 N40 子集brief 与建库资源语料无重叠。技能库规模PPT 996 / Excel 632 / Web 941 / Blender 661 / Reaper 934 / CAD 312 / UE5 417 条。4 个 agent 后端GPT-5.5、GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano。4 个对比系统w Skills完整流水线、w/o Skills同 agent 跑 free-form 代码、无库、ClaudeCode-HClaude Code CLI v2.1.x、Codex-HCodex CLI v0.129.x。判官非音频用 GPT-5.4 vision、Reaper 用 audio-capable GPT-4o-series5 轴 rubric0–10 分折成百分比overall 5 轴无权平均无制品/低于阈值 failureoverall0。所有调用 temperature 0、reasoning effort low。训练目标n/a —— 本文无训练构造算子是“vision-LM 单次调用 确定性后处理/gate”无任何针对 Resource2Skill 的可学习参数。整体处理流程鸟瞰见下图四类资源跨 7 个创作域蒸馏进同一层级 Skill Wiki技术流水线详见 2.1Figure 1 — 概念总览教学视频 / 代码库 / 文章 / 参考制品四类资源跨 7 个创作软件域PPT/Excel/Web/Blender/CAD/UE5/Reaper蒸馏成层级多模态 Skill Wiki资源教学视频 / 代码库 / 文章 / 参考制品先进construction 阶段确定性预处理器按资源类型抽证据视频抽关键帧、代码库做 AST 感知的代码区与参数签名抽取、文章分段落、制品做图像预处理再由 vision-capable LM 配领域 prompt 模板蒸馏成结构化技能 JSON经确定性后处理归一化 / 校验 / SHA1 求稳定 ID / 落盘后过 5 个确定性 acceptance gate通过的条目归入wiki 组织阶段——按领域特定 taxonomy如 PPT 按 layout/typography/motionBlender 按 geometry/material/lighting挂到层级树上。在线推理时进入selection 阶段MetaBrowse 先用 BM25打分项含名称、标签、适用性文本、分类路径从库里挑 top-K20 候选再由 LM 读取这些候选的元数据与文本/视觉/代码视图、选出 n5 个子集允许选 0 个。最后是execution 阶段选中的技能代码若有经统一的 MCP 工具面直接打到领域后端执行选中与执行之间不做 LM 翻译每域遵循同一控制循环 plan → MetaBrowse → apply → render。当 BM25 候选集里没有合适条目同一个构造算子在线被调用去搜新资源、蒸馏临时技能、过同样的 gate作为单独的 online pool 供当前任务使用。2.1 架构图Figure 2 — Resource2Skill 四阶段流水线construction operator 蒸馏资源进层级 Skill WikiMetaBrowse 检索候选、LM 从文本/视觉/代码视图选择经 MCP 应用到领域后端离线池不足时同一算子在线复用上图原文 Figure 2给出技术骨架左侧四类资源经(f_θ, A_D)进中间的层级 Skill WikiMetaBrowse 做 BM25 短列 LM 选择右下通过 MCP 把选中技能应用到领域后端下方虚线回环表示离线池不足时同一算子在线补洞。2.2 模块详解资源连接器 确定性预处理器per resource type输入资源字节视频帧 / 仓库树 / 文章文本 / 制品字节→ 输出该资源类型的“证据”。处理流程因类型而异教学视频做关键帧采样代码库做AST 感知的代码区与参数签名抽取文章做段落分割参考制品做图像预处理。设计理由把“把长视频/大仓库整块喂给 LM”的高成本与噪声问题前置到确定性步骤——先抽真正承载过程信号的局部关键帧、AST 节点、段落再交给 LM既省 token 又聚焦。关键参数关键帧数量、AST 抽取的代码区粒度由领域 prompt 模板决定论文未给具体数值(uncertain)。多模态蒸馏器f_θ输入资源证据 领域 prompt 模板→ 输出结构化 JSON 技能候选s̃skill_name / category_path / applicability / tags / text_body / code_body / visual_caption / provenance。处理流程单次 vision-capable LM 调用不是微调无针对本文的可学习参数按领域 prompt 模板要求产出上述 JSON 字段。设计理由复用前沿模型的视觉代码能力靠 prompt 结构化输出而非训练——降低构建成本、跨域可复用同一套机制。关键机制LM 的角色是“prompt 工程 结构化输出”不是学习打分一个资源可产出多个候选技能s̃_1:k。确定性后处理normalize输入候选s̃→ 输出落盘的规范化条目。处理流程1. 归一化空白字符2. 校验 JSON 形状3. 由(domain, source_path, extracted_node_index)的 SHA1 哈希算稳定技能 ID同一源的不同抽取节点可生成多条不同技能4. 按规定格式落盘。设计理由稳定 ID 是后面去重 gate 与可复现性的基础——保证重跑用同样的技能 ID 而非重采样。接受谓词A_D5 个确定性 gate输入候选s̃→ 输出 accept/reject。任一 gate 可独立拒绝全部是规则检查无 LM-as-judge。处理流程5 gate1.完整性——schema 校验要求所有必需 frontmatter 字段非空、text_body 不短于阈值、至少一个内容模态非空2.出处可追溯——文件系统检查 source_path / video_url 指向 connector manifest 里登记的可检索资源3.去重——SHA1 ID 命中已有技能则折叠进已有条目同源再做归一化名称字符串相等检查4.模态一致性——modalities_present 声明的每个模态在磁盘期望子路径下确有非空文件5.结构可执行性——对有可执行 code_body 的域沙箱导入并对最小样本输入跑 code_body必要时跑 render/overlap gate设 Booleanexec_okexec_okFalse的条目不删留作 reference-only被 agent 的 verified-only 模式过滤。设计理由把“质量”拆成可机器校验的确定性 gate避免用 LM-as-judge 反复筛选那会引入偏好与成本结构可执行 gate 验证的是“代码能跑通、能产出非平凡制品”不是“能解 benchmark 任务”——这是诚实划界。关键参数最小文本长度、去重哈希策略、per-domain 最小尺寸常量——都在 benchmark 评分之前冻在小 dev 资源样本上评分后不回调防信息泄漏。层级 Skill Wiki 存储输入通过 gate 的规范化条目 → 输出按领域 taxonomy 挂好的多模态 bundle。处理流程每条技能落成skills_wiki/domain/skill_id/目录含source/出处、text/机制/适用条件/输入/预期效果、visual/缩略图/截图/渲染/示意、code/可执行/可改代码、meta.json分类路径/标签/源类型/校验状态。设计理由模态 bundle 而非单文件是为了让 agent 能按需只取需要的视图视觉缩略图仅在 agent 显式请求时才解析进 token 预算——不占文本 token层级 taxonomy 编码领域结构、缩小搜索空间、在合适抽象层暴露候选。关键参数单条技能均值 4332 tokenPPT 3934 / Excel 3207 / Web 5726 / Blender 4248 / Reaper 4170推理时每任务 BM25 短列 K20frontmatter 各约 200–500 token LM 选 n5 条全展开约 22k token合计约 26–32k token与库总规模无关K、n 固定。MetaBrowse 选择器输入用户 briefq→ 输出选中的技能子集S(q)。处理流程两阶段1.BM25 词法打分——对库内每条技能把name(s) ⊕ tags(s) ⊕ applicability(s) ⊕ p(s)名称、标签、适用性文本、分类路径拼起来与q算 BM25取 top-K20分类路径进打分函数是关键——树结构天然偏向拓扑相关子树里的技能而非把库当扁平列表。2.LM 选择——LM 读这 K 个候选的结构化证据Φ(s)含元数据与当前配置暴露的文本/视觉/代码视图输出一个子集而非排序——可以选 0 个没有合适候选时 agent 退回 free-form 代码。设计理由两阶段把“检索精度”与“任务适配判断”分工——BM25 廉价缩范围、用 taxonomy 路径借力层级结构LM 贵但聪明只在小候选集上判断“这几条组合起来能不能用”。子集而非排序让 LM 能表达“都不合适”。关键参数K20、n5消融对比 BM25 / Embeddense RAG/ BM25Embed / Random-FullPool / No-Skill本文 hierarchy-then-LM 全域第一68.9% vs BM25 66.0% vs BM25Embed 64.2% vs Embed 60.0% vs Random 58.0% vs No-Skill 57.3%。MCP 执行面 领域适配器输入选中技能 领域后端 → 输出渲染好的制品。处理流程wiki 侧暴露 discovery 动作列分类、列技能卡片、读各模态内容 search 动作包 BM25 短列领域侧暴露单个apply动作背后是 per-domain capabilities manifest缺失能力返回结构化 not-applicable。选中技能的代码若有直接打到 live MCP server 执行选中与执行之间不做 LM 翻译。reference-only 技能无可用代码仍有用——agent 拿它的文本/视觉证据自己写代码并通过选中技能 ID 保留出处。控制循环每域相同plan → MetaBrowse → apply → render。设计理由单apply动作 capabilities manifest 让同一 agent 循环跨 7 个完全异构的后端SVG→pptx、openpyxl、Playwright、bpy、ReaScript、ezdxf/FreeCAD、UE5-MCP复用选中即执行无 LM 翻译减少误差与延迟。各域后端PPTSVG→pptx 16:9/ Excelopenpyxlxlsxwriter/ WebHTML5CSS3ES2020Playwright 渲染/ Blenderbpy 4.1 headless/ ReaperReaScript over MCP/ CADezdxfFreeCAD fallback/ UE5UE5-MCP 桥暴露 editor Python 动作。2.3 算法 / 伪代码原文无形式化 Algorithm 框但给出集合论式的构造与选择定义式。完整转述并对关键步骤逐步解读构造construction定义式逐步解读遍历领域 的资源池 四类资源里的每个资源 蒸馏器 把 映射成一个或多个候选技能 vision-LM 单次调用接受谓词 对候选跑 5 个确定性 gate全部通过才保留通过的候选经normalize归一化 校验 稳定 ID 落盘成为正式技能 所有这样的 构成领域库 。关键点同一个算子 在线推理时被原样复用——这是“离线-在线统一”的形式基础。选择MetaBrowse定义式逐步解读第一阶段对库内每条技能把名称、标签、适用性文本、分类路径拼接后与 brief 算 BM25取前 成候选集 第二阶段LM 选择器 读这 个候选的视图集合 含元数据与暴露的文本/视觉/代码视图输出一个子集 子集而非排序——LM可选 0 个此时 agent 退回 free-form 代码等价于触发在线补洞。3. 关键结果主要发现装备技能库w Skills在全部 28 个主对比格子4 后端 × 7 域上都赢无技能w/o Skills均值 56.8% vs 45.0%11.9 pp并赢两个现成 harnessCodex-H 50.5%、ClaudeCode-H 50.4%中的较强者在28 格中的 26 格。提升集中在“约定密集、从 prompt 难反推”的域——UE5 最猛30 到 40 pp因为 free-form agent 几乎无法通过 UE5 Python API 拼出最小可用场景常返回低于阈值的制品Reaper 最小no-skill 先验已较能干。证据强度配对 Wilcoxon 检验——w Skills 对 w/o Skills 的 delta 在每个报告格子都显著其中 88/99 格 Appendix G。但这是跨 brief 的配对显著性同一 brief ID、同一判官、同一 seed不是跨随机种子的运行稳定性——温度 0、每格单次运行主表无误差棒。盲评人类 A/B200 评分、5 评委/对、Krippendorff α0.58独立佐证方向w Skills 赢 68.0%、平 20.5%、输 11.5%去平局胜率 85.5%最小 CAD 77.8%、最大 UE5 95.7%。最支撑结论的一条证据资源源消融——去掉视频平均从 68.9% 掉到 59.4%且“仅视频”库仍比“三源无视频”库高 7.4 分。这同时支撑了“多模态资源尤其视频是真信号”与“本文不是在卖一个普通技能库”两个论点。3.1 关键结果图 / 表主对比Table 1 节选GPT-5.5 与 GPT-5.4 两后端overall %后端系统WebExcelReaperPPTBlenderCADUE5AvgGPT-5.5w Skills82.861.377.667.553.148.769.565.8GPT-5.5w/o Skills69.458.273.153.935.642.630.251.9GPT-5.4w Skills82.476.477.364.844.155.767.366.9GPT-5.4w/o Skills68.758.673.255.429.548.729.151.9完整表含 4 后端含 Mini/Nano× 4 系统含 ClaudeCode-H/Codex-H。跨全部 28 格的聚合w Skills 56.8% / w/o Skills 45.0% / Codex-H 50.5% / ClaudeCode-H 50.4%。两个 harness 赢 w Skills 的例外GPT-5.5 Web vs ClaudeCode-H、GPT-5.4 Nano PPT vs Codex-H均在 1 分以内。重点解读UE5 是 delta 的“大头”GPT-5.5 上 39.3 pp、GPT-5.4 上 38.2 pp但这部分是地板效应——w/o Skills 在 UE5 常产出低于阈值的制品被记 0 分w Skills 的赢更多是“产出了可评分的东西”而非“质量高得多”论文诚实承认。Blender/Web 的提升更接近真实质量提升。Excel/Reaper 的 no-skill 先验已较强delta 小3 到 4 pp。资源源消融Table 35 域 coreoverall %配置VideoCodeArticleArtifactAvg全源本文✓✓✓✓68.9无视频三源✗✓✓✓59.4仅视频✓✗✗✗~66.8由“仅视频比三源无视频高 7.4”推得视频移除的下降集中在时序/视觉序列承载信号的域Excel −14.2 pp、Web −11.5 pp。全源比最强两源组合在每域仍领先 0.3–0.9 pp。表征消融Table 4matched-budgetoverall %表征Avg边际Text only65.0—Visual66.91.9Code68.92.0Full全部模态68.9每域第一选择策略消融Table 5overall %策略AvgOurshierarchy-then-LM68.9BM2566.0BM25Embed64.2Embeddense RAG60.0Random-FullPool58.0No-Skill57.3Ours 对最强检索 baseline 的最大领先在 Excel5.0、PPT3.8、Blender2.3——这些域“任务适配与互补性”是词法/向量相似度抓不到的。库规模与 wiki 组织研究原文图 panel a / b库规模曲线每域随库增大单调上升约 200 条处饱和wiki 组织对比扁平纯文本技能访问 vs 完整 wiki 界面 vs 无技能重点解读规模性能随库规模单调上升约200 条处饱和0→200 这段增益最大Reaper 3.1 pp 到 Excel 14.2 pp200 之后曲线趋平400→Full 每域至多 0.8 pp。说明“常见操作与恢复例程”在前 200 条就被覆盖后面的条目只是填领域缝隙。重点解读wiki 组织扁平纯文本技能库已经每域都赢“无技能”说明可复用技能描述本身就有用完整 wiki 比扁平文本每域领先2.5–8.2 pp最大在 Excel/Web/Blender——层级浏览缩窄搜索空间、代码与视觉字段提供纯文本欠规范的执行锚定。离线 vs 在线获取Table 2overall %配置离线池在线池任务集MeanΔOffline-only8910T_standard65.4—OfflineOnline891100T_standard66.10.7Offline-only8910T_novel41.2—OfflineOnline891100T_novel62.821.6重点解读标准任务集上在线补洞只 0.7 pp基本是噪声离线池已覆盖常见请求但在专门针对离线池覆盖盲区的 T_novel 压力测试上同样 100 条在线技能把均值从 41.2% 拉到 62.8%21.6 pp。在线获取是补洞器、不是增益器——论文据此在标准 benchmark 上默认 Offline-only这是诚实的取舍。定性案例原文 Figures 5 / 9 / 8success / success / failureGPT-5.4PPT successw Skills左vs w/o Skills右——技能臂产出 shell 多样、单页内容密、主题一致的全员大会 deckBlender successw Skills左vs w/o Skills右——技能臂产出有轮廓/关键光蓝琥珀、PBR 材质的祖母绿戒指 hero shot无技能臂只是平面光照的几何拼搭Excel failurew Skills左vs w/o Skills右——技能臂复用 dashboard 组件但留下可见的重点解读成功案例如约展示技能库带来的视觉/结构密度优势失败案例更有诊断价值——Excel 案例里技能臂复用了 dashboard 组件但被引用公式的绑定没解析出来留下#NAME?错误比无技能臂的手写干净布局还差。论文把这种“部分接地”partial grounding技能被选中、表面 pattern 被借走、但关键绑定/参数没解析与“保守组合”conservative composition技能臂贴单一样式、丢了变化列为两类反复出现的失效模式——这与选择消融里 Random/Embed baseline 落后于 Ours 一致技能只有“能被 agent 绑定参数”才有用强选择缩小这个绑定成本。4. 批判性评估与价值4.1 批判性评估最值得盯的一处判官与 agent 同族。非音频制品的判官是 GPT-5.4 vision而 agent 主力后端也是 GPT-5.4 / GPT-5.5。文献里“同模型家族偏好”同族判官系统性偏好同族产出是有据可查的偏置。论文做了两道对冲——17 对人机对照judge vs 人类中位数 Spearman ρ0.71、ICC0.66判官自一致性 ρ0.83与 200 评分盲评人类 A/B去平局胜率 85.5%。方向被佐证了但这两道对冲都不算强人机对照只有 17 对、且 “utility” 轴人机分歧最大判官倾向于奖励“看起来能用”的东西即便交互缺失人类 A/B 只有 200 评分、Krippendorff α0.58仅“中等”一致、且人类同样可能奖励技能注入的感知 polish主题、布局密度与判官同向偏置。所以 headline 数字的真实大小仍有水分未挤出——方向大概率对幅度可能高估。反方最强论证。站到对立面11.9 pp 的 headline 主要来自一个刻意最弱的对照与一个奖励感知 polish 的同族判官技能库对“产品级 harness”的边际价值其实只有约 6 pp而这 6 pp 里的大头又来自“喂给 agent 整理过的技能文本”与本文最大的新颖性多模态、视频、层级关系不大。展开三条(1) w/o Skills 是 free-form 代码、reasoning effort low、无库——刻意最弱产品级 harnessClaudeCode-H 50.4%、Codex-H 50.5%把差距吃到只剩 ~6 pp且 28 格里 harness 赢了 2 格。(2) 表征消融自己交底纯文本已达 65.0%对 No-Skill 57.3% 是 7.7 pp视觉 1.9、代码 2.0选择消融里 hierarchy-then-LM 对纯 BM25 只领先 2.9 pp。也就是说“给 agent 整理过的相关技能文本”贡献了大部分提升多模态与层级是真实但偏小的增量。(3) 判官奖励的“主题一致、布局密度”恰是技能注入的东西与功能正确性未必相关——Excel 失败案例的#NAME?就是功能回归被感知 polish 掩盖的信号。把三条合起来真实世界非 benchmark 分布、非同族判官、对产品级 harness的净增益很可能显著低于 11.9 pp。值得肯定的方法论诚实。这不是一篇只报喜的论文它报失败案例Appendix J 的 5 对 boundary probe、报 harness 赢的 2 格、报最小增益域Reaper、报判官-人类在 utility 轴的最大分歧matched-budget 的表征消融固定资源池、技能 ID、frontmatter、BM25-LM 预算、agent、判官只变后检索内容是干净到能下结论的设计在线/离线研究诚实承认在线在标准集上只是噪声、默认关掉brief 生成与资源采集都做了“wiki-blind / taxonomy-driven”的防泄漏说明接受阈值在评分前冻结、不回调。这套消融卫生在同类系统论文里属上乘。其余次要保留消融用 N40非主对比的 N80理由是算力预算——力更弱源消融没有像表征消融那样明确声明“matched skill count”若无视频的库条目更少59.4% 的下降里可能混了规模成分“仅视频比三源无视频高 7.4”部分控制了这一点但未完全排除(uncertain)技能构造完全靠前沿 vision-LM对更小/开源模型的迁移未测——可迁移性是个未答的问题。综合可信度中-高—— 实证规模7 域 × 4 后端 × 多消融 人类盲评 配对显著性与消融卫生足够支撑“技能库有用、视频是真信号、层级多模态有小幅额外收益”这些定性结论但 headline 数字的绝对幅度因同族判官与最弱 baseline 而偏高应按“对产品级 harness 约 6 pp、其中大部分来自整理过的文本”来打折读。4.2 Limitations 与复现性论文自承不主张推广到“缺程序化工具接口或缺公开过程性内容流”的域在线获取引入搜索/蒸馏/校验延迟故只在 T_novel 上评估而非并入主流程检索 baselineEmbed、BM25Embed是在蒸馏后的技能库上做的未与“同 token 预算下的原始资源语料检索”对比留作未来工作。读者发现判官-agent 同族偏置未被正面讨论w/o Skills 刻意最弱主表单种子无误差棒Wilcoxon 是跨 brief 配对、非跨种子源消融未明确 matched skill count技能构造绑前沿 vision-LM、小模型迁移性未测。复现性代码 是否开放未明说(uncertain)论文提“supplementary material 含运行目录/trace/制品/评分 JSON”但未提公开代码库· 数据 技能库与 benchmark brief 的公开发布未明确(uncertain)· 超参 是per-domain 后端、taxonomy、接受阈值、K20/n5、判官设置、CLI 版本均详述于附录 A–C。4.3 可复用与后续可借鉴技能元组s (p, x_text, x_visual, x_code, m)的 schema5-gate 接受谓词尤其“结构可执行性 gate reference-only 兜底”——exec_okFalse不删而留作参考这套软校验思路很实用MetaBrowse 的 BM25含分类路径 LM 子集选择允许选 0两段式离线-在线同一算子的统一设计单apply动作 capabilities manifest 跨异构后端复用同一 agent 循环。引用场景构建 agent 技能库 / 从多模态资源蒸馏过程性知识 / 教学视频用于 agent 时引用BibTeX key 候选fan2026resource2skill。下一步☐把“5-gate 接受谓词 reference-only 兜底”的思路与本工作区lusca-skill的 SKILL.md 精简拆分规范对照看能否给技能加一个轻量“结构可执行/可触发”校验。☐若要复现核心结论先验证“对产品级 harness 的净增益”——在自己的 skill 体系上跑一组 w/ vs w/o skills 的配对对比。Verdict推荐深读— 对构建 agent skill 系统尤其是本工作区这种 Claude Code skill 体系高度相关它把“技能 schema、接受校验、层级检索、离线-在线统一”这些实战问题做了一遍大规模、消融卫生上乘的示范schema 与 5-gate 谓词可直接借鉴。但读时务必盯紧两点——判官与 agent 同族、headline 用的是最弱 baseline——把绝对数字打折读定性结论技能库有用、视频不可替代、层级多模态有小幅额外收益可信。作者lusca 版本lusca-paper-read v1.10.1 出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read