技能 Tester

工程开发 社区
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

方法与流程

  • Phase 1: Understand & Design:原文以此为独立章节。
  • 1b. Design test prompts:Design test prompts applying criteria from test-design-guide.md (realistic prompts, assertion design, persona setup): Propose 2-3 test prompts:
  • 1c. Design trigger eval queries:Design trigger eval queries applying patterns from trigger-eval-guide.md: Generate 15-20 trigger eval queries: 8-10 should-trigger: varied phrasings of the skill's intended use

适用与边界

  • 1c. Design trigger eval queries:Design trigger eval queries applying patterns from trigger-eval-guide.md: Generate 15-20 trigger eval queries: 8-10 should-trigger: varied phrasings of the skill's intended use
  • Phase 4: Test Description Triggering:原文以此为独立章节。
  • 4a. Evaluate trigger accuracy:For each trigger eval query from trigger-evals.json: Assess whether the skill's current description would cause Claude to invoke the skill for this query
  • 当前原文没有单列不适用场景或限制。

原文中的明确线索

  • 要点:「[Process]」、「[Outcome]」、「[Compliance]」、「Checkpoint」、「With-skill runners (2 per scenario)」、「Baseline runner (1 per scenario)」、「Pass rate」、「Timing comparison」
  • 文件与命令~/.claude/skill-tests/{skill-name}/iteration-{N}/evals.jsontrigger-evals.jsonSkill(skill="{tested-skill-name}")runinbackground: truetiming.jsonTaskOutput(taskid)scripts/

流狐整理:以上内容来自当前 SKILL.md 的章节与原词;未补写作者没有声明的工具、兼容性或能力。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
工程开发
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
88 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@pavel-molyanov · 未声明 license
流狐 Token 估算
中等消耗
流狐接入估算
需简单配置
是否需要外部 API Key
未发现要求
检测到的系统要求
未声明
底层运行要求
未声明
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
  • Shell 执行
检测到的网络行为
仅限本地
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 skill-tester-pavel-molyanov.preview
# 3b. Compile results per scenario

1. Build results table (assertions × runners)
2. Cross-runner consistency: where did skill-runners diverge?
   - Divergence on a criterion = ambiguous instruction in the skill
3. Baseline comparison:
   - Passed by skill-runners ONLY → skill adds value
   - Passed by ALL → criterion too easy or skill doesn't help here

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。