评价 Skill,不能只看最后一段答案

一个结果看起来不错,不代表 Skill 值得复用。评测要穿过触发、执行、输出、成本与安全,观察整个能力闭环是否可靠。

安全是门槛,不是平均分
触发准确性

既要少误触,也要少漏触

Trigger Precision 衡量被激活的任务中有多少真的需要它;Trigger Recall 衡量应该使用时有多少成功出现。正样本、负样本与模糊样本必须同时存在。

准确率 = 正确触发 ÷ 总触发召回率 = 正确触发 ÷ 应触发

最小对照思想

真正要回答的是:Skill 是否比临时 Prompt 更稳定,自动选择是否接近人工指定,多 Skill 组合是否抵消了额外成本。

基线

普通 Prompt

观察未经封装的方法能达到什么水平。

控制

手动指定 Skill

隔离 Skill 本身的能力增益。

系统

自动选择与组合

同时检验路由、接口、顺序和冲突处理。

评测集不是一堆正常示例

只有成功案例,会让触发、鲁棒性和恢复能力全部失去可见性。

15正常任务

覆盖主要使用方式,建立任务成功与结构有效的基础分布。

5模糊任务

观察 Skill 会保守推断、追问补充,还是擅自填满缺失信息。

5负向样本

任务看起来相近但不应触发,用来测量误触与能力边界。

5异常输入

空内容、错误格式、矛盾要求、缺失字段和上游残缺输出。

重复执行每个样本运行三至五次

没有重复,标准差与稳定性没有意义;只跑一次无法区分方法问题和随机波动。

同时记录触发、完成、结构、遗漏、时间与人工修改

最终质量只是一个结果,额外重试和人工修复决定它是否具有生产价值。

历史回流失败案例进入下一版本评测集

每次修复都应留下可复现样本,让版本迭代不是凭感觉改 Prompt。