GitHub项目说明 · 非用户反馈
编码代理技能可将自主编码任务失败率降低 45%
Autoprompt 是一个安装在 Claude Code、Codex、OpenCode 等编码代理上的技能,通过结构化提示与子代理流程提升任务完成率。其自测显示 OpenCode 在 Terminal-Bench 2.1 上解决率从 60/89 升至 73/89,失败减少 45%,但代价约为 3 倍时间和 2 倍令牌。
查看原始信号github:Spielewoy/autoprompt-skill
目标用户
使用 OpenCode、Claude Code、Codex 等编码代理处理真实代码修改、测试与修复任务的开发者,包括 1-3 人小团队。
潜在需求
需要可移植、可跨代理复用的提示技能或工作流,在不大幅增加时间和令牌成本的前提下降低编码代理的任务失败率,并适配不同操作系统与代理版本。
发生场景
开发者依赖编码代理完成 agentic coding 任务时,代理常在复杂任务上失败;项目基准中 OpenCode 单独运行 89 个任务即有 29 个失败,需要人工介入。Autoprompt 以技能形式注入提示工作流来减少这类失败。
来源证据
在 Terminal-Bench 2.1 上,OpenCode 单独解决 60/89 个任务,配合 Autoprompt 后解决 73/89,失败从 29 降至 16(减少 45%)。
<summary><strong>Measured OpenCode comparison</strong></summary> <p align="center"> <img src="assets/terminal-bench-2.1.svg" width="900" alt="OpenCode 1.18.7 on Terminal-Bench 2.1: OpenCode solved 60 of 89 tasks and OpenCode with Autoprompt solved 73 of 89 tasks."/> </p> | Track | Solved | Score | Failed | |---|---:|---:|---:| | OpenCode | 60/89 | 67.42% | 29 | | **OpenCode + Autoprompt** | **73/89** | **82.02%** | **16** | | **Change** | **+13 solves** | **+14.61 points** | **45% fewer** |https://github.com/Spielewoy/autoprompt-skill
为什么值得留意
编码代理正被更多开发者采用,但失败率高仍是实际阻碍;Autoprompt 展示了通过技能层提升成功率的路径,同时其时间/令牌开销、跨平台适配和第三方基准缺失等问题留下观察空间,值得继续跟踪实际采用与反馈。
未满足部分
- Windows 上 Git 安装到非默认路径时,安装与测试流程会因硬编码路径失败(issue #14)
可能延伸 · 模型推测
- 将技能抽象为开放标准配置供更多代理直接导入(推测)
- 增加低成本令牌策略的优化开关(推测)
- 为 Windows 等平台提供原生路径检测与安装适配(推测)
目前未知
- 基准由项目方自测,缺乏第三方独立复现
- 失败率改善集中在 Terminal-Bench 2.1,真实项目效果未知
- issue 来自项目测试套件,不一定反映最终用户使用场景
- 时间与令牌开销为经验估计,未留存实测日志
继续核实
- 外部开发者在真实仓库中使用 Autoprompt 后,失败率是否同样下降?
- 3 倍时间和 2 倍令牌开销在什么任务规模下会变得不可接受?
- Windows 部署问题是否影响实际用户采用?
- 该技能能否迁移到未支持的代理或 IDE?
主题词
coding agentagentic coding tasksprompt workflowtask failure ratecross-agent compatibility