Lode 需求雷达
--卡片
--主题
--失败
GitHub项目说明 · 非用户反馈

编码代理技能可将自主编码任务失败率降低 45%

Autoprompt 是一个安装在 Claude Code、Codex、OpenCode 等编码代理上的技能,通过结构化提示与子代理流程提升任务完成率。其自测显示 OpenCode 在 Terminal-Bench 2.1 上解决率从 60/89 升至 73/89,失败减少 45%,但代价约为 3 倍时间和 2 倍令牌。

查看原始信号github:Spielewoy/autoprompt-skill

目标用户

使用 OpenCode、Claude Code、Codex 等编码代理处理真实代码修改、测试与修复任务的开发者,包括 1-3 人小团队。

潜在需求

需要可移植、可跨代理复用的提示技能或工作流,在不大幅增加时间和令牌成本的前提下降低编码代理的任务失败率,并适配不同操作系统与代理版本。

发生场景

开发者依赖编码代理完成 agentic coding 任务时,代理常在复杂任务上失败;项目基准中 OpenCode 单独运行 89 个任务即有 29 个失败,需要人工介入。Autoprompt 以技能形式注入提示工作流来减少这类失败。

来源证据

在 Terminal-Bench 2.1 上,OpenCode 单独解决 60/89 个任务,配合 Autoprompt 后解决 73/89,失败从 29 降至 16(减少 45%)。

<summary><strong>Measured OpenCode comparison</strong></summary> <p align="center"> <img src="assets/terminal-bench-2.1.svg" width="900" alt="OpenCode 1.18.7 on Terminal-Bench 2.1: OpenCode solved 60 of 89 tasks and OpenCode with Autoprompt solved 73 of 89 tasks."/> </p> | Track | Solved | Score | Failed | |---|---:|---:|---:| | OpenCode | 60/89 | 67.42% | 29 | | **OpenCode + Autoprompt** | **73/89** | **82.02%** | **16** | | **Change** | **+13 solves** | **+14.61 points** | **45% fewer** |
https://github.com/Spielewoy/autoprompt-skill

为什么值得留意

编码代理正被更多开发者采用,但失败率高仍是实际阻碍;Autoprompt 展示了通过技能层提升成功率的路径,同时其时间/令牌开销、跨平台适配和第三方基准缺失等问题留下观察空间,值得继续跟踪实际采用与反馈。

未满足部分

  • Windows 上 Git 安装到非默认路径时,安装与测试流程会因硬编码路径失败(issue #14)

可能延伸 · 模型推测

  • 将技能抽象为开放标准配置供更多代理直接导入(推测)
  • 增加低成本令牌策略的优化开关(推测)
  • 为 Windows 等平台提供原生路径检测与安装适配(推测)

目前未知

  • 基准由项目方自测,缺乏第三方独立复现
  • 失败率改善集中在 Terminal-Bench 2.1,真实项目效果未知
  • issue 来自项目测试套件,不一定反映最终用户使用场景
  • 时间与令牌开销为经验估计,未留存实测日志

继续核实

  • 外部开发者在真实仓库中使用 Autoprompt 后,失败率是否同样下降?
  • 3 倍时间和 2 倍令牌开销在什么任务规模下会变得不可接受?
  • Windows 部署问题是否影响实际用户采用?
  • 该技能能否迁移到未支持的代理或 IDE?

主题词

coding agentagentic coding tasksprompt workflowtask failure ratecross-agent compatibility

管理令牌