Skillsbench PR验证
- 作者仓库星标 1,209
- 作者仓库 skillsbench
SkillsBench
Benchmark evaluating how well AI agents use skills.
Official Resources
- GitHub: https://github.com/benchflow-ai/skillsbench
- BenchFlow SDK: https://github.com/benchflow-ai/benchflow
Quick Workflow
# 1. Install and initialize a task
pip install 'benchflow>=0.3.0a7'
bench tasks init <task-name>
# 2. Write files (see CONTRIBUTING.md for templates)
# 3. Validate
bench tasks check tasks/my-task
bench eval create -t tasks/my-task -a oracle # Must pass 100%
# 4. Test with agent (with skills)
bench eval create -t tasks/my-task -a claude-agent-acp -s tasks/my-task/environment/skills/
# 5. Test WITHOUT skills (omit -s)
bench eval create -t tasks/my-task -a claude-agent-acp
# 6. Submit PR (see PR template)
Task Requirements
- Realistic workflows people actually do
- Measurably easier with skills than without
- instruction.md, solve.sh, and task.toml must be human-authored
- Deterministic, outcome-based verification
- Skills must be generalizable and reusable
References
- Full guide: CONTRIBUTING.md
- Task quality rubric: task-review skill (workflow + policy/implementation rubrics)
- Finding tasks: CONTRIBUTING.md#finding-good-task-ideas
- 流狐分类
- AI 智能
- 作者声明 Agent
- 未找到明确声明;不据此推断已兼容或已测试
- 静态检查
- 88 / 100 · 启发式扫描,不代表运行安全
- 作者 / 版本 / 许可
- @benchflow-ai · 未声明 license
- 流狐 Token 估算
- 低消耗
- 流狐接入估算
- 即装即用
- 是否需要外部 API Key
- 未发现要求
- 检测到的系统要求
- 未声明
- 底层运行要求
- 未声明
- 检测到的文件与系统行为
-
- 只读
- 允许写入 / 修改
- 检测到的网络行为
- 仅限本地
- 安装命令数
- 无(仅作为资料)
档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。
需要注意: 未限定 allowed-tools,默认拥有全部工具权限。
作者没有在当前 SKILL.md 中定义固定输出样例。 Official Resources
GitHub: https://github.com/benchflow-ai/skillsbench BenchFlow SDK: https://github.com/benchflow-ai/benchflow
Quick Workflow
Quick Workflow
Task Requirements
Realistic workflows people actually do Measurably easier with skills than without instruction.md, solve.sh, and task.toml must be human-authored
References
Full guide: CONTRIBUTING.md Task quality rubric: task-review skill (workflow + policy/implementation rubrics) Finding tasks: CONTRIBUTING.mdfinding-good-task-ideas
# SkillsBench
Benchmark evaluating how well AI agents use skills.
## Official Resources
- **GitHub**: https://github.com/benchflow-ai/skillsbench
- **BenchFlow SDK**: https://github.com/benchflow-ai/benchflow
## Quick Workflow
```bash
# 1. Install and initialize a task
pip install 'benchflow>=0.3.0a7'
bench tasks init <task-name>
# 2. Write files (see CONTRIBUTING.md for templates)
# 3. Validate
bench tasks check tasks/my-task
bench eval create -t tasks/my-task -a oracle # Must pass 100%
# 4. Test with agent (with skills)
bench eval create -t tasks/my-task -a claude-agent-acp -s tasks/my-task/environment/skills/
# 5. Test WITHOUT skills (omit -s)
bench eval create -t tasks/my-task -a claude-agent-acp
# 6. Submit PR (see PR template)
```
## Task Requirements
- Realistic workflows people actually do
- Measurably easier with skills than without
- instruction.md, solve.sh, and task.toml must be human-authored
- Deterministic, outcome-based verification
- Skills must be generalizable and reusable
## References
- Full guide: [CONTRIBUTING.md](../../../../CONTRIBUTING.md)
- Task quality rubric: [task-review skill](../task-review/) (workflow + policy/implementation rubrics)
- Finding tasks: [CONTRIBUTING.md#finding-good-task-ideas](../../../../CONTRIBUTING.md#finding-good-task-ideas) 证据边界与执行链路
作者原文负责流程事实;流狐只索引当前章节、要点、文件与命令。
章节 -> Official Resources → Quick Workflow → Task Requirements → References
要点 -> GitHub · BenchFlow SDK · Benchmark evaluating how well AI agents use skills.
文件/命令 -> github.com/benchflow-ai/skillsbench · github.com/benchflow-ai/benchflow · CONTRIBUTING.md · tasks/my-task · tasks/my-task/environment/skills · instruction.md · ../../../../CONTRIBUTING.md · ../task-review
内容 SHA-256 -> c9aed5f7871c
方法与流程
适用与边界
原文中的明确线索
github.com/benchflow-ai/skillsbench、github.com/benchflow-ai/benchflow、CONTRIBUTING.md、tasks/my-task、tasks/my-task/environment/skills、instruction.md、../../../../CONTRIBUTING.md、../task-review