Lode 需求雷达
--卡片
--主题
--失败
HN讨论 · 身份未知

AI 编码代理提速后,测试的发现、维护与扩展成为主要阻碍

使用 Codex/Claude 等编码代理在 Chrome 中验证 UX 的团队表示,当 agent 生成代码达到一定规模后,发现、维护和扩展测试成为主要问题;为此他们转而构建行为驱动测试工具,让工具发现行为并生成、维护测试用例。该信号展示了编码代理提速后 QA 测试维护成为瓶颈的具体场景。

目标用户

使用 AI 编码代理生成代码、同时仍需要验证 UX 并维护测试质量的开发团队

潜在需求

需要一种方式在编码代理生成代码规模扩大时,自动发现软件行为、生成测试用例并长期维护测试,让 QA 跟上代码生成的速度。

发生场景

团队用 Codex 或 Claude 在 Chrome 中直接验证 UX;当 agent 生成代码的规模扩大后,测试的发现、维护和扩展开始成为主要问题,而非某个具体功能的实现。

来源证据

评论者称其团队用 Codex 或 Claude 在 Chrome 中验证 UX,并认为 agent 生成代码达到规模时,发现、维护和扩展测试是主要问题。

I dont this is top most priority. We do this with codex or claude in chrome and validate the UX. I think BDD is going to be back in style for agent generate code. When you generate at scale discovering, maintaining and scaling test is the major problem, thats why were katana [1] a behavior driven testinf utility thay discovers behavior and maintain, generates test cases. [1] https://github.com/adaptive-scale/katana
https://news.ycombinator.com/item?id=49351020

为什么值得留意

评论者不是在泛泛讨论,而是已经在用编码代理实践后指出测试发现、维护与扩展是主要问题,并因此正在构建自己的行为驱动测试工具;信号同时出现了 agentic QA 和 BDD 两种解法,说明同一阻碍有不同应对方向,值得进一步观察哪种方式能真正补齐规模化测试维护。

已有方案

  • Argus(agentic QA,读取屏幕而非 DOM)
  • 用 Codex 或 Claude 在 Chrome 中验证 UX
  • Katana(行为驱动测试工具,发现行为并维护、生成测试用例)

未满足部分

  • agent 生成代码规模扩大时,测试的发现、维护与扩展仍是主要问题
  • 常规 e2e 测试在 CI 中通常昂贵且慢,agentic QA 相对成本未被说明

可能延伸 · 模型推测

  • 将行为驱动测试的发现与维护能力接入编码代理的生成循环,边生成代码边更新测试(推测)
  • 为 CI 中的 e2e 测试按成本和速度分层,agentic QA 只处理常规测试跑不起的部分(推测)

目前未知

  • 评论者来自另一个测试工具项目(Katana),可能以自身方案立场评价 Argus,未必代表独立用户
  • signal 中没有说明评论者团队的规模、生成代码的规模到底多大
  • Argus 的价格、运行成本或实际能力没有可核对的信息
  • 无法判断存在这种问题的团队有多少

继续核实

  • 采用编码代理的团队在什么阶段会发现测试发现、维护和扩展成为瓶颈
  • agentic QA 与行为驱动测试工具在 CI 成本和执行速度上的差异如何
  • 除了 Katana 和 Argus,还有哪些已有方案在解决同一问题
  • 这种测试维护问题是否只在特定项目规模或代码类型下出现

主题词

agentic codingux validationtest discoverytest maintenancetest scalingbehavior driven testing

管理令牌