Product Hunt讨论 · 身份未知
编码 agent 输入上下文膨胀:本地代理压缩省 token 且不破坏正确性
编码智能体(Claude Code、Codex 等)每轮调用都会把工具 schema、文件内容、旧历史和终端日志重新发给大模型,输入 token 是账单大头。作者此前用让模型"穴居人式"简短回答的 skill 省输出 token,实测无济于事,于是做成本地代理 Caveman:按日志、代码、JSON 分别压缩,原件写入内容寻址存储可回溯,解析失败则原样透传;固定 54 次基准中减少 33.2% 输入 token,18/18 正确性检查通过,并兼容多个主流 CLI agent。
查看原始信号producthunt:1220849
目标用户
使用 Claude Code、Codex、Gemini CLI 等编码智能体并按 token 付费的开发者,尤其是成本敏感的学生与个人开发者。
潜在需求
在不改 agent 配置、不损失正确性的前提下,大幅压缩每次 provider 调用的输入上下文以降低费用,同时保证有损压缩不会悄悄改变结果——需要能取回原始内容。
发生场景
作者在学生时期 AI 开销超过伙食费;实测每次调用 agent 都会重发工具 schema、文件内容、旧历史和数百行安装日志,输入 token 远超回答本身;此前让模型用简短语气回答,对账单几乎没有帮助。
来源证据
编码 agent 每轮都会重发旧历史与数百行安装日志等上下文;作者自述此前只让模型简短作答,对这类输入开销没有帮助("talked like a caveman and read like a lawyer")。
old history, and 300 lines of npm install noise. My agent talked like a caveman and read like a lawyer. v2 is a local proxy between your agent and the provider. caveman claude wraps Claude Code; same for Codex, Gemini CLI, Aider, opencode, Hermes, OpenClaw. It never touches your config, and subscription OAuth passes through byte-exact. The engine sniffs each payload type and routes it to a different compressor: logs keep errors and stack traces and lose the progress spam, code keeps imports andhttps://www.producthunt.com/products/caveman?comment=5779316&utm_campaign=producthunt-api&utm_medium=api-v2&utm_source=Application%3A+Lode+%28ID%3A+295681%29
为什么值得留意
作者把痛点拆得很具体:输出风格优化省下的钱只是"rounding error",输入上下文重发才是成本主体;Caveman 给出按类型压缩、无损回溯、失败透传的代理层解法,并以基准数据验证节省与正确性,值得继续观察独立用户采用与真实工作负载下的表现。
已有方案
- 让编码 agent 用极简风格回答以省输出 token 的 skill(作者称用户保留安装、账单变小,但实测输出 token 只是"rounding error")
未满足部分
- 只压缩回答文本无法降低主要账单:每轮重发的旧历史、安装日志等输入上下文仍未被处理(作者自述"talked like a caveman and read like a lawyer")
可能延伸 · 模型推测
- 把按类型压缩的本地代理模式扩展到非代码场景的长上下文 agent 任务(推测)
- 基于压缩率统计向用户展示每轮省下的费用,强化成本感知(推测)
- 把该压缩层做成通用 CLI 包装器模板,方便更多 agent 工具接入(推测)
目前未知
- 核心评论来自项目作者自述,缺少独立第三方验证
- 97K+ GitHub stars 与"用户保留安装"均为作者单方说法,不能代表本项目采用量
- 33.2% 与 18/18 来自作者固定的 54 次基准,未覆盖更长会话与不同工作负载
继续核实
- 除作者自述外,是否有独立用户报告编码 agent 输入上下文占比过高、省 token 代理被实际采用?
- 54 次固定基准之外的场景(长会话、多工具、大仓库)能否保持约 1/3 的输入 token 节省与正确性?
- 开发者是否愿意为省 token 改变启动命令或引入本地代理这一额外环节?
- 是否有其他工具在尝试同样的输入上下文压缩,效果如何对比?
主题词
coding agentinput token reductioncontext compressionllm api costlocal proxy