benchmark

其他 社区 v1.0.0
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

benchmark 是 gstack 工作流里的「跑性能基准」入口——在你项目里跑一组基准测试,输出对比报告。

设计思路

作者把性能基准做成 gstack 的标准命令之一,逻辑是:每个工程问题都该有可量化的方法。性能不是「感觉变快了」,而是「benchmark 数字从 X 降到 Y」。这个技能负责把 benchmark 流程标准化——你不必每次重新发明跑 benchmark 的方法。

Plan Mode 下的行为

按 SKILL.md 的 Plan Mode Safe Operations:在 plan mode 下只允许只读操作(读 ~/.gstack/codex exec/codex review、写 plan 文件、open 已生成的 artifact)。意思是 benchmark 在 plan mode 下只准备「要跑什么」、不真跑——把跑 benchmark 这种带副作用的操作留到正式执行阶段。

SETUP 检查

作者把「Step 0: 跑 SETUP」写成所有 browse 命令前都要做的事。SETUP 会检查:是否在 gstack 项目里、benchmark 工具是否装好、上次运行的 baseline 在哪儿。

Skill Routing

当用户说「跑 benchmark」时,会先经过 Skill Routing 决定调哪个具体的 benchmark 子命令(看是 perf benchmark 还是 model benchmark)——这就是 benchmark-models 存在的原因,二者是路由分流。

Telemetry

按 Telemetry 章节,每次跑完会自动收集结果摘要,方便后续 gstack-openclaw-retro 分析「这周性能变化」。

Voice / 写作风格

作者在 SKILL.md 里专门写了一节「Voice」——所有报告必须用统一的客观语气,不带「显著提升」「巨大优化」这种营销词。这是 gstack 命令的统一风格。

适合谁

  • 用 gstack 工作流的初创团队
  • 每周 / 每月做性能跟踪的项目
  • 大重构前后想客观对比的开发者
  • 团队里需要把「性能改进」量化交付给老板的人

不适合

  • 一次性性能调试——直接用语言自带的 profiler 更快
  • 微基准(比较两个函数的纳秒级差别)——用 hyperfine / Criterion 更精确

配套

benchmark-models 配套:那个比模型,这个比代码 / 系统性能。gstack-openclaw-retro 会消费它的输出。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
通用
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
92 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@garrytan · v1.0.0 · 未声明 license
流狐 Token 估算
较高消耗
流狐接入估算
需简单配置
是否需要外部 API Key
未发现要求
检测到的系统要求
macOS · Linux · Windows
底层运行要求
Bun
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
  • Shell 执行
检测到的网络行为
允许外网请求
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 benchmark.preview
作者没有在当前 SKILL.md 中定义固定输出样例。

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。