benchmark-models

其他 社区 v1.0.0
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

benchmark-models 让多个 LLM 模型同时回答同一个问题,输出对比表——比成本、比质量、比速度。

设计思路

作者把「选模型」做成可量化的事:你给 5 个 prompt 模板和 5 个候选模型,技能帮你跑 5×5 矩阵,每格都给出回答 + 耗时 + token 消耗。看完这张表就知道应该用哪个模型。

Step 0: Locate the binary

SKILL.md 里 Step 0 章节说得很具体:先找 benchmark 工具的二进制位置——可能在系统 PATH,可能在 gstack 仓库里需要先 ./setup。这一步是 BLOCKING 的,没找到不允许继续。

Plan Mode 行为

benchmark 类似,plan mode 下只允许只读操作(不实际调用模型 API);正式执行阶段才会真的调 API、产生 token 费用。

输出

默认输出表格,列:

  • 模型名(gpt-5、claude-sonnet-4-6、gemini-pro 等)
  • prompt id
  • 回答(截断或完整)
  • token in / out
  • 耗时
  • 自动评分(如果配了 evaluator)

Voice

benchmark 一样,必须用客观语气——不会给某个模型「赢家」标签,让你自己看数字判断。

Operational Self-Improvement

每跑一次 benchmark,结果会回写进 ~/.gstack/,下次跑同一组 prompt 时可以做 diff(这次 vs 上次)。这对追踪模型升级(claude 4.6 → 4.7 之后效果变好还是变差)特别有用。

Telemetry

跑完会自动 telemetry,让 gstack-openclaw-retro 知道你这周做了哪些模型选型工作。

适合谁

  • 决定「我们项目用哪个模型」的工程负责人
  • 模型新版本发布后做回归对比
  • 给业务方算模型成本(同样质量下哪家更便宜)
  • 写技术博客 / 评测的人

不适合

  • 单次问问题——直接调一家模型就够
  • 主观体验对比(哪家「感觉」更聪明)——基准跑不出主观感受

配套

benchmark(系统性能)、gstack-openclaw-retro(数据消费)形成测量链路。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
通用
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
92 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@garrytan · v1.0.0 · 未声明 license
流狐 Token 估算
较高消耗
流狐接入估算
需手动接入
是否需要外部 API Key
需要 · Anthropic / Google
检测到的系统要求
macOS · Linux · Windows
底层运行要求
Bun
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
  • Shell 执行
检测到的网络行为
允许外网请求
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 benchmark-models.preview
# Step 5: Interpret results

- **Fastest** — provider with lowest latency.
- **Cheapest** — provider with lowest cost.
- **Highest quality** (if `--judge` ran) — provider with highest score.
- **Best overall** — use judgment. If judge ran: quality-weighted. Otherwise: note the tradeoff the user needs to make.

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。