阅读笔记:Resource2Skill — Distilling Executable Skills from Human-Created Resources for Software Agents
TL;DR
这篇论文用从多模态人类资源(教学视频、代码库、文章、参考制品)蒸馏出可执行技能、再组织成层级化多模态 Skill Wiki的方法,回答“能否自动从多模态资源(尤其是教学视频)里提炼出软件 agent 可复用的技能”这个问题。核心结论是装备该技能库的 agent 在 7 个创作类软件任务上平均比无技能 agent 高 +11.9 个百分点,并在 28 个主对比格子里的 26 个上击败 Claude Code / Codex 两个现成 harness,最关键证据是消融显示教学视频是不可替代的资源源(去掉视频平均从 68.9% 掉到 59.4%)。主要 caveat:判官与 agent 同属 GPT-5.x 家族(存在同族偏好嫌疑),且 +11.9pp 的 headline 用的是刻意最弱的“无技能”baseline——换上产品级 harness 后技能库的边际收益缩到约 +6pp;进一步消融表明大部分提升来自“喂给 agent 经过整理的技能文本”,多模态与层级化是真实但偏小的增量。
1. 研究内容
1.1 研究问题、痛点与动机
- 研究问题:能否自动从多模态人类创作资源(尤其是教学视频)中蒸馏出可执行技能,并为软件 agent 构建一个可扩展、可维护的技能库?
- 痛点:现有 agent 技能库的来源受限于三种——专家手写(如 Anthropic Agent Skills)、从 agent 自身交互 trace 累积(如 Voyager / AWM / SkillFlow)、或从纯文本/代码挖掘(如 SkillFoundry)。这漏掉了人类学创作类软件最自然的方式:看教程视频。视频里有文本无法表达的东西——操作的时序、每一步编辑的视觉前后变化、 tacit 的设计选择。而把原始视频直接塞进 agent 记忆又贵又冗余(一段教程里大量无关 setup 与 narration),压成纯文本摘要又会丢掉“视频之所以有用”的动态信息。难点在于:把视频等资源里的过程性信号抽出来、归一化成可复用表征、组织好让 agent 能高效检索并执行。
- 动机 / 为什么重要:软件 agent 越来越被期待“产出高质量制品”(幻灯片、表格、网页、3D 场景、CAD、音频工程),其成败很少取决于孤立的事实知识,更多取决于可复用的过程性 know-how——怎么分解目标、用哪个工具/API pattern、中间检查什么状态、失败怎么恢复。把这些过程性知识从“经验”转成“可复用专长”是 agent 落地的关键瓶颈,而教程视频是未被充分利用的最大人力专长矿。
- 领域定位:应用 + 系统构建方向;上游是教学视频/公开代码/文档等“人类资源”与 LLM agent 工具使用研究,下游是创作类软件(办公/3D/音频/CAD)的自动化 agent。
1.2 核心贡献
- 资源到技能的学习范式:把“从多模态人类资源蒸馏可复用可执行技能”形式化为一个问题,以教学视频为关键但此前未被用起来的过程性/感知性知识源(新范式角度,不是增量改进)。
- 层级化多模态技能库(Skill Wiki):每个技能是
s = (p, x_text, x_visual, x_code, m)——分类路径 + 文本说明 + 视觉示例 + 可执行/可改代码 + 元数据/出处;按领域特定 taxonomy 组织成层级 wiki,browse-and-read 接口跨领域共享。 - 统一的离线-在线构建流水线:同一个构造算子
(f_θ, A_D)既离线蒸馏大规模资源、也在推理时技能库覆盖不足时在线“补洞”,使库可增量扩展、可维护。 - 跨 7 个商业创作域的广泛实证:PPT / Excel / Web / Blender / CAD / UE5 / Reaper,配对消融逐一隔离资源源、模态格式、库规模、在线获取、选择策略的贡献。
1.3 相关工作脉络
flowchart LR subgraph trace_line["在线 trace 挖掘(单域 · 文本/代码)"]voyager["Voyager<br/>Wang et al., 2024"]awm["AWM<br/>Wang et al., 2024"]asi["ASI<br/>Wang et al., 2025"]skillflow["SkillFlow<br/>Zhang et al., 2026"]end skillfoundry["SkillFoundry<br/>Shen et al., 2026<br/>离线文本/代码 → 知识树(科学计算)"]anthropic["Agent Skills<br/>Anthropic, 2025<br/>手工编写 bundle"]subgraph resource_line["人类多模态资源(此前仅作预训练/检索语料)"]video_res["HowTo100M / Ego4D<br/>MineDojo / COIN<br/>(教学视频)"]code_res["CodeSearchNet / Codex<br/>(公开代码+文档)"]end trace_line -->|"启发:技能库抽象"|this_paper skillfoundry -->|"离线挖掘思路"|this_paper video_res -->|"蒸馏为可执行技能(新)"|this_paper code_res -->|"蒸馏为可执行技能(新)"|this_paper anthropic -.->|"对照:手工 vs 自动获取"|this_paper this_paper["Resource2Skill<br/>Fan et al., 2026<br/>多模态 · 层级 wiki · 离线+在线 · 7 域"]- 关键传承:Voyager / AWM / ASI / SkillFlow 一线确立了“agent 技能库”这个抽象(把过程性知识从权重/提示里拿出来变成显式可复用条目),SkillFoundry 一线证明了“离线挖掘资源进知识树”可行;Resource2Skill 把这两条线的精华(显式技能库 + 离线挖掘)接过来。
- 分歧:与 trace 挖掘一线的根本差异是知识来源——前者只用 agent 自己跑出来的 trace(文本/代码、单域),本文用人类创作的多模态资源(含视频);与 SkillFoundry 的差异是模态与域——前者仅文本/代码、面向科学计算,本文多模态(文本+视觉+代码)、面向创作类软件,并加上受控在线补洞与制品级视觉/音频判官评估。教学视频这条平行线(HowTo100M 等)此前只被当作预训练或检索语料“整块吞下”,本文首次把它蒸馏成经过校验的结构化技能。
2. 方法概要
- 方法路线:系统构建 + 受控实证(7 域 × 4 后端 × 多消融)。
- 关键假设:
- 显式:从人类资源蒸馏的技能 > 从 agent trace 生成的技能;层级 wiki 检索 > 扁平检索;多模态 > 纯文本;视频是不可替代的源。
- 隐式(读者识别):vision-capable LM(GPT-5.4/5.5)能从关键帧/代码/散文里可靠蒸馏出结构化、可执行的技能;5 个确定性 gate 足以过滤坏技能;80 条/域的 benchmark brief 能代表该域任务分布;判官评分与人类偏好一致。
- 数据 / 实验设置:7 个创作域,每域 80 条 screened brief(主对比/规模/在线研究用匹配的 N=80,消融用 N=40 子集),brief 与建库资源语料无重叠。技能库规模:PPT 996 / Excel 632 / Web 941 / Blender 661 / Reaper 934 / CAD 312 / UE5 417 条。4 个 agent 后端:GPT-5.5、GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano。4 个对比系统:w Skills(完整流水线)、w/o Skills(同 agent 跑 free-form 代码、无库)、ClaudeCode-H(Claude Code CLI v2.1.x)、Codex-H(Codex CLI v0.129.x)。判官:非音频用 GPT-5.4 vision、Reaper 用 audio-capable GPT-4o-series;5 轴 rubric,0–10 分折成百分比,overall = 5 轴无权平均;无制品/低于阈值 = failure(overall=0)。所有调用 temperature 0、reasoning effort low。
- 训练目标:n/a —— 本文无训练,构造算子是“vision-LM 单次调用 + 确定性后处理/gate”,无任何针对 Resource2Skill 的可学习参数。
整体处理流程(鸟瞰见下图:四类资源跨 7 个创作域蒸馏进同一层级 Skill Wiki;技术流水线详见 2.1):
Figure 1 — 概念总览:教学视频 / 代码库 / 文章 / 参考制品四类资源跨 7 个创作软件域(PPT/Excel/Web/Blender/CAD/UE5/Reaper)蒸馏成层级多模态 Skill Wiki
资源(教学视频 / 代码库 / 文章 / 参考制品)先进construction 阶段:确定性预处理器按资源类型抽证据(视频抽关键帧、代码库做 AST 感知的代码区与参数签名抽取、文章分段落、制品做图像预处理),再由 vision-capable LM 配领域 prompt 模板蒸馏成结构化技能 JSON,经确定性后处理(归一化 / 校验 / SHA1 求稳定 ID / 落盘)后,过 5 个确定性 acceptance gate,通过的条目归入wiki 组织阶段——按领域特定 taxonomy(如 PPT 按 layout/typography/motion,Blender 按 geometry/material/lighting)挂到层级树上。在线推理时进入selection 阶段:MetaBrowse 先用 BM25(打分项含名称、标签、适用性文本、分类路径)从库里挑 top-K=20 候选,再由 LM 读取这些候选的元数据与文本/视觉/代码视图、选出 n=5 个子集(允许选 0 个)。最后是execution 阶段:选中的技能代码(若有)经统一的 MCP 工具面直接打到领域后端执行(选中与执行之间不做 LM 翻译),每域遵循同一控制循环 plan → MetaBrowse → apply → render。当 BM25 候选集里没有合适条目,同一个构造算子在线被调用去搜新资源、蒸馏临时技能、过同样的 gate,作为单独的 online pool 供当前任务使用。
2.1 架构图
Figure 2 — Resource2Skill 四阶段流水线:construction operator 蒸馏资源进层级 Skill Wiki;MetaBrowse 检索候选、LM 从文本/视觉/代码视图选择;经 MCP 应用到领域后端;离线池不足时同一算子在线复用
上图(原文 Figure 2)给出技术骨架:左侧四类资源经(f_θ, A_D)进中间的层级 Skill Wiki;MetaBrowse 做 BM25 短列 + LM 选择;右下通过 MCP 把选中技能应用到领域后端;下方虚线回环表示离线池不足时同一算子在线补洞。
2.2 模块详解
资源连接器 + 确定性预处理器(per resource type):输入资源字节(视频帧 / 仓库树 / 文章文本 / 制品字节)→ 输出该资源类型的“证据”。
- 处理流程因类型而异:教学视频做关键帧采样;代码库做AST 感知的代码区与参数签名抽取;文章做段落分割;参考制品做图像预处理。
- 设计理由:把“把长视频/大仓库整块喂给 LM”的高成本与噪声问题前置到确定性步骤——先抽真正承载过程信号的局部(关键帧、AST 节点、段落),再交给 LM,既省 token 又聚焦。
- 关键参数:关键帧数量、AST 抽取的代码区粒度由领域 prompt 模板决定(论文未给具体数值,(uncertain))。
多模态蒸馏器
f_θ:输入(资源证据 + 领域 prompt 模板)→ 输出结构化 JSON 技能候选s̃(skill_name / category_path / applicability / tags / text_body / code_body / visual_caption / provenance)。- 处理流程:单次 vision-capable LM 调用(不是微调,无针对本文的可学习参数),按领域 prompt 模板要求产出上述 JSON 字段。
- 设计理由:复用前沿模型的视觉+代码能力,靠 prompt + 结构化输出而非训练——降低构建成本、跨域可复用同一套机制。
- 关键机制:LM 的角色是“prompt 工程 + 结构化输出”,不是学习打分;一个资源可产出多个候选技能(
s̃_1:k)。
确定性后处理(normalize):输入候选
s̃→ 输出落盘的规范化条目。- 处理流程:1. 归一化空白字符;2. 校验 JSON 形状;3. 由
(domain, source_path, extracted_node_index)的 SHA1 哈希算稳定技能 ID(同一源的不同抽取节点可生成多条不同技能);4. 按规定格式落盘。 - 设计理由:稳定 ID 是后面去重 gate 与可复现性的基础——保证重跑用同样的技能 ID 而非重采样。
- 处理流程:1. 归一化空白字符;2. 校验 JSON 形状;3. 由
接受谓词
A_D(5 个确定性 gate):输入候选s̃→ 输出 accept/reject。任一 gate 可独立拒绝;全部是规则检查,无 LM-as-judge。- 处理流程(5 gate):1.完整性——schema 校验,要求所有必需 frontmatter 字段非空、text_body 不短于阈值、至少一个内容模态非空;2.出处可追溯——文件系统检查 source_path / video_url 指向 connector manifest 里登记的可检索资源;3.去重——SHA1 ID 命中已有技能则折叠进已有条目(同源再做归一化名称字符串相等检查);4.模态一致性——modalities_present 声明的每个模态在磁盘期望子路径下确有非空文件;5.结构可执行性——对有可执行 code_body 的域,沙箱导入并对最小样本输入跑 code_body(必要时跑 render/overlap gate),设 Boolean
exec_ok;exec_ok=False的条目不删,留作 reference-only,被 agent 的 verified-only 模式过滤。 - 设计理由:把“质量”拆成可机器校验的确定性 gate,避免用 LM-as-judge 反复筛选(那会引入偏好与成本);结构可执行 gate 验证的是“代码能跑通、能产出非平凡制品”,不是“能解 benchmark 任务”——这是诚实划界。
- 关键参数:最小文本长度、去重哈希策略、per-domain 最小尺寸常量——都在 benchmark 评分之前冻在小 dev 资源样本上,评分后不回调(防信息泄漏)。
- 处理流程(5 gate):1.完整性——schema 校验,要求所有必需 frontmatter 字段非空、text_body 不短于阈值、至少一个内容模态非空;2.出处可追溯——文件系统检查 source_path / video_url 指向 connector manifest 里登记的可检索资源;3.去重——SHA1 ID 命中已有技能则折叠进已有条目(同源再做归一化名称字符串相等检查);4.模态一致性——modalities_present 声明的每个模态在磁盘期望子路径下确有非空文件;5.结构可执行性——对有可执行 code_body 的域,沙箱导入并对最小样本输入跑 code_body(必要时跑 render/overlap gate),设 Boolean
层级 Skill Wiki 存储:输入通过 gate 的规范化条目 → 输出按领域 taxonomy 挂好的多模态 bundle。
- 处理流程:每条技能落成
skills_wiki/<domain>/<skill_id>/目录,含source/(出处)、text/(机制/适用条件/输入/预期效果)、visual/(缩略图/截图/渲染/示意)、code/(可执行/可改代码)、meta.json(分类路径/标签/源类型/校验状态)。 - 设计理由:模态 bundle 而非单文件,是为了让 agent 能按需只取需要的视图(视觉缩略图仅在 agent 显式请求时才解析进 token 预算——不占文本 token);层级 taxonomy 编码领域结构、缩小搜索空间、在合适抽象层暴露候选。
- 关键参数:单条技能均值 4332 token(PPT 3934 / Excel 3207 / Web 5726 / Blender 4248 / Reaper 4170);推理时每任务 BM25 短列 K=20(frontmatter 各约 200–500 token)+ LM 选 n=5 条全展开(约 22k token),合计约 26–32k token,与库总规模无关(K、n 固定)。
- 处理流程:每条技能落成
MetaBrowse 选择器:输入用户 brief
q→ 输出选中的技能子集S(q)。- 处理流程(两阶段):1.BM25 词法打分——对库内每条技能,把
name(s) ⊕ tags(s) ⊕ applicability(s) ⊕ p(s)(名称、标签、适用性文本、分类路径)拼起来与q算 BM25,取 top-K=20;分类路径进打分函数是关键——树结构天然偏向拓扑相关子树里的技能,而非把库当扁平列表。2.LM 选择——LM 读这 K 个候选的结构化证据Φ(s)(含元数据与当前配置暴露的文本/视觉/代码视图),输出一个子集而非排序——可以选 0 个(没有合适候选时 agent 退回 free-form 代码)。 - 设计理由:两阶段把“检索精度”与“任务适配判断”分工——BM25 廉价缩范围、用 taxonomy 路径借力层级结构;LM 贵但聪明,只在小候选集上判断“这几条组合起来能不能用”。子集而非排序,让 LM 能表达“都不合适”。
- 关键参数:K=20、n=5;消融对比 BM25 / Embed(dense RAG)/ BM25+Embed / Random-FullPool / No-Skill,本文 hierarchy-then-LM 全域第一(68.9% vs BM25 66.0% vs BM25+Embed 64.2% vs Embed 60.0% vs Random 58.0% vs No-Skill 57.3%)。
- 处理流程(两阶段):1.BM25 词法打分——对库内每条技能,把
MCP 执行面 + 领域适配器:输入选中技能 + 领域后端 → 输出渲染好的制品。
- 处理流程:wiki 侧暴露 discovery 动作(列分类、列技能卡片、读各模态内容)+ search 动作(包 BM25 短列);领域侧暴露单个
apply动作(背后是 per-domain capabilities manifest,缺失能力返回结构化 not-applicable)。选中技能的代码(若有)直接打到 live MCP server 执行,选中与执行之间不做 LM 翻译。reference-only 技能(无可用代码)仍有用——agent 拿它的文本/视觉证据自己写代码,并通过选中技能 ID 保留出处。控制循环每域相同:plan → MetaBrowse → apply → render。 - 设计理由:单
apply动作 + capabilities manifest 让同一 agent 循环跨 7 个完全异构的后端(SVG→pptx、openpyxl、Playwright、bpy、ReaScript、ezdxf/FreeCAD、UE5-MCP)复用;选中即执行(无 LM 翻译)减少误差与延迟。 - 各域后端:PPT(SVG→pptx 16:9)/ Excel(openpyxl+xlsxwriter)/ Web(HTML5+CSS3+ES2020,Playwright 渲染)/ Blender(bpy 4.1 headless)/ Reaper(ReaScript over MCP)/ CAD(ezdxf,FreeCAD fallback)/ UE5(UE5-MCP 桥暴露 editor Python 动作)。
- 处理流程:wiki 侧暴露 discovery 动作(列分类、列技能卡片、读各模态内容)+ search 动作(包 BM25 短列);领域侧暴露单个
2.3 算法 / 伪代码
原文无形式化 Algorithm 框,但给出集合论式的构造与选择定义式。完整转述并对关键步骤逐步解读:
构造(construction)定义式:
逐步解读:
- 遍历领域 的资源池 (四类资源)里的每个资源 ;
- 蒸馏器 把 映射成一个或多个候选技能 (vision-LM 单次调用);
- 接受谓词 对候选跑 5 个确定性 gate,全部通过()才保留;
- 通过的候选经
normalize(归一化 + 校验 + 稳定 ID + 落盘)成为正式技能 ; - 所有这样的 构成领域库 。
关键点:同一个算子 在线推理时被原样复用——这是“离线-在线统一”的形式基础。
选择(MetaBrowse)定义式:
逐步解读:
- 第一阶段:对库内每条技能,把名称、标签、适用性文本、分类路径拼接后与 brief 算 BM25,取前 成候选集 ;
- 第二阶段:LM 选择器 读这 个候选的视图集合 (含元数据与暴露的文本/视觉/代码视图),输出一个子集 ;
- 子集而非排序——LM可选 0 个,此时 agent 退回 free-form 代码(等价于触发在线补洞)。
3. 关键结果
- 主要发现:装备技能库(w Skills)在全部 28 个主对比格子(4 后端 × 7 域)上都赢无技能(w/o Skills),均值 56.8% vs 45.0%(+11.9 pp);并赢两个现成 harness(Codex-H 50.5%、ClaudeCode-H 50.4%)中的较强者在28 格中的 26 格。提升集中在“约定密集、从 prompt 难反推”的域——UE5 最猛(+30 到 +40 pp,因为 free-form agent 几乎无法通过 UE5 Python API 拼出最小可用场景,常返回低于阈值的制品),Reaper 最小(no-skill 先验已较能干)。
- 证据强度:配对 Wilcoxon 检验——w Skills 对 w/o Skills 的 delta 在每个报告格子都显著(),其中 88/99 格 (Appendix G)。但这是跨 brief 的配对显著性(同一 brief ID、同一判官、同一 seed),不是跨随机种子的运行稳定性——温度 0、每格单次运行,主表无误差棒。盲评人类 A/B(200 评分、5 评委/对、Krippendorff α=0.58)独立佐证方向:w Skills 赢 68.0%、平 20.5%、输 11.5%,去平局胜率 85.5%;最小 CAD 77.8%、最大 UE5 95.7%。
- 最支撑结论的一条证据:资源源消融——去掉视频平均从 68.9% 掉到 59.4%,且“仅视频”库仍比“三源无视频”库高 7.4 分。这同时支撑了“多模态资源(尤其视频)是真信号”与“本文不是在卖一个普通技能库”两个论点。
3.1 关键结果图 / 表
主对比(Table 1 节选:GPT-5.5 与 GPT-5.4 两后端,overall %)
| 后端 | 系统 | Web | Excel | Reaper | PPT | Blender | CAD | UE5 | Avg |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | w Skills | 82.8 | 61.3 | 77.6 | 67.5 | 53.1 | 48.7 | 69.5 | 65.8 |
| GPT-5.5 | w/o Skills | 69.4 | 58.2 | 73.1 | 53.9 | 35.6 | 42.6 | 30.2 | 51.9 |
| GPT-5.4 | w Skills | 82.4 | 76.4 | 77.3 | 64.8 | 44.1 | 55.7 | 67.3 | 66.9 |
| GPT-5.4 | w/o Skills | 68.7 | 58.6 | 73.2 | 55.4 | 29.5 | 48.7 | 29.1 | 51.9 |
完整表含 4 后端(含 Mini/Nano)× 4 系统(含 ClaudeCode-H/Codex-H)。跨全部 28 格的聚合:w Skills 56.8% / w/o Skills 45.0% / Codex-H 50.5% / ClaudeCode-H 50.4%。两个 harness 赢 w Skills 的例外(GPT-5.5 Web vs ClaudeCode-H、GPT-5.4 Nano PPT vs Codex-H)均在 1 分以内。
- 重点解读:UE5 是 delta 的“大头”(GPT-5.5 上 +39.3 pp、GPT-5.4 上 +38.2 pp),但这部分是地板效应——w/o Skills 在 UE5 常产出低于阈值的制品被记 0 分,w Skills 的赢更多是“产出了可评分的东西”而非“质量高得多”(论文诚实承认)。Blender/Web 的提升更接近真实质量提升。Excel/Reaper 的 no-skill 先验已较强,delta 小(+3 到 +4 pp)。
资源源消融(Table 3,5 域 core,overall %)
| 配置 | Video | Code | Article | Artifact | Avg |
|---|---|---|---|---|---|
| 全源(本文) | ✓ | ✓ | ✓ | ✓ | 68.9 |
| 无视频(三源) | ✗ | ✓ | ✓ | ✓ | 59.4 |
| 仅视频 | ✓ | ✗ | ✗ | ✗ | ~66.8(由“仅视频比三源无视频高 7.4”推得) |
视频移除的下降集中在时序/视觉序列承载信号的域:Excel −14.2 pp、Web −11.5 pp。全源比最强两源组合在每域仍领先 0.3–0.9 pp。
表征消融(Table 4,matched-budget,overall %)
| 表征 | Avg | 边际 |
|---|---|---|
| Text only | 65.0 | — |
| +Visual | 66.9 | +1.9 |
| +Code | 68.9 | +2.0 |
| Full(全部模态) | 68.9 | 每域第一 |
选择策略消融(Table 5,overall %)
| 策略 | Avg |
|---|---|
| Ours(hierarchy-then-LM) | 68.9 |
| BM25 | 66.0 |
| BM25+Embed | 64.2 |
| Embed(dense RAG) | 60.0 |
| Random-FullPool | 58.0 |
| No-Skill | 57.3 |
Ours 对最强检索 baseline 的最大领先在 Excel(+5.0)、PPT(+3.8)、Blender(+2.3)——这些域“任务适配与互补性”是词法/向量相似度抓不到的。
库规模与 wiki 组织研究(原文图 panel a / b)
库规模曲线:每域随库增大单调上升,约 200 条处饱和
wiki 组织对比:扁平纯文本技能访问 vs 完整 wiki 界面 vs 无技能
- 重点解读(规模):性能随库规模单调上升,约200 条处饱和;0→200 这段增益最大(Reaper +3.1 pp 到 Excel +14.2 pp),200 之后曲线趋平,400→Full 每域至多 +0.8 pp。说明“常见操作与恢复例程”在前 200 条就被覆盖,后面的条目只是填领域缝隙。
- 重点解读(wiki 组织):扁平纯文本技能库已经每域都赢“无技能”(说明可复用技能描述本身就有用);完整 wiki 比扁平文本每域领先2.5–8.2 pp,最大在 Excel/Web/Blender——层级浏览缩窄搜索空间、代码与视觉字段提供纯文本欠规范的执行锚定。
离线 vs 在线获取(Table 2,overall %)
| 配置 | 离线池 | 在线池 | 任务集 | Mean | Δ |
|---|---|---|---|---|---|
| Offline-only | 891 | 0 | T_standard | 65.4 | — |
| Offline+Online | 891 | 100 | T_standard | 66.1 | +0.7 |
| Offline-only | 891 | 0 | T_novel | 41.2 | — |
| Offline+Online | 891 | 100 | T_novel | 62.8 | +21.6 |
- 重点解读:标准任务集上在线补洞只 +0.7 pp(基本是噪声,离线池已覆盖常见请求);但在专门针对离线池覆盖盲区的 T_novel 压力测试上,同样 100 条在线技能把均值从 41.2% 拉到 62.8%(+21.6 pp)。在线获取是补洞器、不是增益器——论文据此在标准 benchmark 上默认 Offline-only,这是诚实的取舍。
定性案例(原文 Figures 5 / 9 / 8,success / success / failure,GPT-5.4)
PPT success:w Skills(左)vs w/o Skills(右)——技能臂产出 shell 多样、单页内容密、主题一致的全员大会 deck
Blender success:w Skills(左)vs w/o Skills(右)——技能臂产出有轮廓/关键光(蓝琥珀)、PBR 材质的祖母绿戒指 hero shot;无技能臂只是平面光照的几何拼搭
Excel failure:w Skills(左)vs w/o Skills(右)——技能臂复用 dashboard 组件但留下可见的
- 重点解读:成功案例如约展示技能库带来的视觉/结构密度优势;失败案例更有诊断价值——Excel 案例里技能臂复用了 dashboard 组件但被引用公式的绑定没解析出来,留下
#NAME?错误,比无技能臂的手写干净布局还差。论文把这种“部分接地”(partial grounding:技能被选中、表面 pattern 被借走、但关键绑定/参数没解析)与“保守组合”(conservative composition:技能臂贴单一样式、丢了变化)列为两类反复出现的失效模式——这与选择消融里 Random/Embed baseline 落后于 Ours 一致:技能只有“能被 agent 绑定参数”才有用,强选择缩小这个绑定成本。
4. 批判性评估与价值
4.1 批判性评估
最值得盯的一处:判官与 agent 同族。非音频制品的判官是 GPT-5.4 vision,而 agent 主力后端也是 GPT-5.4 / GPT-5.5。文献里“同模型家族偏好”(同族判官系统性偏好同族产出)是有据可查的偏置。论文做了两道对冲——17 对人机对照(judge vs 人类中位数 Spearman ρ=0.71、ICC=0.66;判官自一致性 ρ=0.83)与 200 评分盲评人类 A/B(去平局胜率 85.5%)。方向被佐证了,但这两道对冲都不算强:人机对照只有 17 对、且 “utility” 轴人机分歧最大(判官倾向于奖励“看起来能用”的东西,即便交互缺失);人类 A/B 只有 200 评分、Krippendorff α=0.58(仅“中等”一致)、且人类同样可能奖励技能注入的感知 polish(主题、布局密度),与判官同向偏置。所以 headline 数字的真实大小仍有水分未挤出——方向大概率对,幅度可能高估。
反方最强论证。站到对立面:+11.9 pp 的 headline 主要来自一个刻意最弱的对照与一个奖励感知 polish 的同族判官,技能库对“产品级 harness”的边际价值其实只有约 +6 pp,而这 6 pp 里的大头又来自“喂给 agent 整理过的技能文本”,与本文最大的新颖性(多模态、视频、层级)关系不大。展开三条:(1) w/o Skills 是 free-form 代码、reasoning effort low、无库——刻意最弱;产品级 harness(ClaudeCode-H 50.4%、Codex-H 50.5%)把差距吃到只剩 ~6 pp,且 28 格里 harness 赢了 2 格。(2) 表征消融自己交底:纯文本已达 65.0%(对 No-Skill 57.3% 是 +7.7 pp),视觉 +1.9、代码 +2.0;选择消融里 hierarchy-then-LM 对纯 BM25 只领先 2.9 pp。也就是说“给 agent 整理过的相关技能文本”贡献了大部分提升,多模态与层级是真实但偏小的增量。(3) 判官奖励的“主题一致、布局密度”恰是技能注入的东西,与功能正确性未必相关——Excel 失败案例的#NAME?就是功能回归被感知 polish 掩盖的信号。把三条合起来:真实世界(非 benchmark 分布、非同族判官、对产品级 harness)的净增益很可能显著低于 11.9 pp。
值得肯定的方法论诚实。这不是一篇只报喜的论文:它报失败案例(Appendix J 的 5 对 boundary probe)、报 harness 赢的 2 格、报最小增益域(Reaper)、报判官-人类在 utility 轴的最大分歧;matched-budget 的表征消融(固定资源池、技能 ID、frontmatter、BM25-LM 预算、agent、判官,只变后检索内容)是干净到能下结论的设计;在线/离线研究诚实承认在线在标准集上只是噪声、默认关掉;brief 生成与资源采集都做了“wiki-blind / taxonomy-driven”的防泄漏说明,接受阈值在评分前冻结、不回调。这套消融卫生在同类系统论文里属上乘。
其余次要保留:消融用 N=40(非主对比的 N=80),理由是算力预算——力更弱;源消融没有像表征消融那样明确声明“matched skill count”,若无视频的库条目更少,59.4% 的下降里可能混了规模成分(“仅视频比三源无视频高 7.4”部分控制了这一点,但未完全排除,(uncertain));技能构造完全靠前沿 vision-LM,对更小/开源模型的迁移未测——可迁移性是个未答的问题。
综合可信度:中-高—— 实证规模(7 域 × 4 后端 × 多消融 + 人类盲评 + 配对显著性)与消融卫生足够支撑“技能库有用、视频是真信号、层级+多模态有小幅额外收益”这些定性结论;但 headline 数字的绝对幅度因同族判官与最弱 baseline 而偏高,应按“对产品级 harness 约 +6 pp、其中大部分来自整理过的文本”来打折读。
4.2 Limitations 与复现性
- 论文自承:不主张推广到“缺程序化工具接口或缺公开过程性内容流”的域;在线获取引入搜索/蒸馏/校验延迟,故只在 T_novel 上评估而非并入主流程;检索 baseline(Embed、BM25+Embed)是在蒸馏后的技能库上做的,未与“同 token 预算下的原始资源语料检索”对比(留作未来工作)。
- 读者发现:判官-agent 同族偏置未被正面讨论;w/o Skills 刻意最弱;主表单种子无误差棒(Wilcoxon 是跨 brief 配对、非跨种子);源消融未明确 matched skill count;技能构造绑前沿 vision-LM、小模型迁移性未测。
- 复现性:代码 是否开放未明说((uncertain),论文提“supplementary material 含运行目录/trace/制品/评分 JSON”但未提公开代码库)· 数据 技能库与 benchmark brief 的公开发布未明确((uncertain))· 超参 是(per-domain 后端、taxonomy、接受阈值、K=20/n=5、判官设置、CLI 版本均详述于附录 A–C)。
4.3 可复用与后续
- 可借鉴:技能元组
s = (p, x_text, x_visual, x_code, m)的 schema;5-gate 接受谓词(尤其“结构可执行性 gate + reference-only 兜底”——exec_ok=False不删而留作参考,这套软校验思路很实用);MetaBrowse 的 BM25(含分类路径)+ LM 子集选择(允许选 0)两段式;离线-在线同一算子的统一设计;单apply动作 + capabilities manifest 跨异构后端复用同一 agent 循环。 - 引用场景:构建 agent 技能库 / 从多模态资源蒸馏过程性知识 / 教学视频用于 agent 时引用;BibTeX key 候选
fan2026resource2skill。 - 下一步:
- ☐把“5-gate 接受谓词 + reference-only 兜底”的思路与本工作区(
lusca-skill)的 SKILL.md 精简拆分规范对照,看能否给技能加一个轻量“结构可执行/可触发”校验。 - ☐若要复现核心结论,先验证“对产品级 harness 的净增益”——在自己的 skill 体系上跑一组 w/ vs w/o skills 的配对对比。
- ☐把“5-gate 接受谓词 + reference-only 兜底”的思路与本工作区(
Verdict
推荐深读— 对构建 agent skill 系统(尤其是本工作区这种 Claude Code skill 体系)高度相关:它把“技能 schema、接受校验、层级检索、离线-在线统一”这些实战问题做了一遍大规模、消融卫生上乘的示范,schema 与 5-gate 谓词可直接借鉴。但读时务必盯紧两点——判官与 agent 同族、headline 用的是最弱 baseline——把绝对数字打折读,定性结论(技能库有用、视频不可替代、层级+多模态有小幅额外收益)可信。
作者:lusca | 版本:lusca-paper-read v1.10.1 | 出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read