Agent 代码测试

AI 智能 社区
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

原文结构

  • 安装:原文以此为独立章节。
  • 核心概念:原文以此为独立章节。
  • YAML 任务定义:以声明方式定义任务。每个任务指定要做什么、要修改哪些文件以及如何判断成功:

适用与边界

  • 何时使用:在你自己的代码库上比较编码代理(Claude Code、Aider、Codex 等) 在采用新工具或模型之前衡量代理性能 当代理更新其模型或工具时运行回归检查
  • 当前原文没有单列不适用场景或限制。

原文中的明确线索

  • 要点:「从 3-5 个任务开始」、「每个代理至少运行 3 次试验」、「在你的任务 YAML 中固定提交」、「每个任务至少包含一个确定性判断器」、「跟踪成本与通过率」、「对你的任务定义进行版本控制」
  • 文件与命令tasks/github.com/joaquinhuigomez/agent-eval.git./my-projectsrc/httpclient.pytests/testhttpclient.py3/3tasks/add-retry-logic.yaml2/3

流狐整理:以上内容来自当前 SKILL.md 的章节与原词;未补写作者没有声明的工具、兼容性或能力。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
AI 智能
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
88 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@tomevault-io · 未声明 license
流狐 Token 估算
低消耗
流狐接入估算
需简单配置
是否需要外部 API Key
未发现要求
检测到的系统要求
Docker
底层运行要求
Docker
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
检测到的网络行为
仅限本地
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 agent-eval-tomevault-io.preview
作者没有在当前 SKILL.md 中定义固定输出样例。

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。