5X 的 Codex 一天半烧完了,晒晒我的智障多 agent 工作流
充了 100 刀 codex 想做点正经东西,结果一天半就没了,项目还卡在半路,越想越亏,来吐槽一下。
我干了个挺蠢的事:一个项目塞了好几个 agent ,产品、测试、运营、后端、桌面端。本来想的是流程正规一点,学大厂那套需求评审测试验收,能少返工。

结果实际流程变成了这样——需求来了先丢给运营 agent 去”调研”,调研完产品 agent 出方案,方案出来测试 agent 要先写测试用例,都齐了后端和桌面端才开始写代码。写完你以为完事了?天真,还要挨个过审:测试审一遍,产品审一遍,UI 审一遍,UX 单独再审一遍。我当时不知道哪根筋搭错,UI 和 UX 还拆成了俩 agent 。

它们审起来一个比一个能说。产品动不动就”不符合用户心智”,UX 说交互路径太长要重做,测试说边界情况没覆盖要补用例,UI 说视觉规范不统一。最离谱的是,它们提的问题最后基本都得我自己动手改,返工不但没少,我还多了个活儿:给几个 agent 的意见当裁判。
钱主要烧在上下文上。每个 agent 都得喂历史记录,喂一次几百条 message ,光”对齐需求”就对齐了好几轮,我自己都不知道在干嘛了。

现在纠结要不要再充 100 刀。充吧,怕两天又烧没了;不充吧,东西不上不下的很难受。
就想问问,到底是我这流程本身有病——AI 干活根本不需要模拟人类团队那套官僚流程,还是我用法不对,应该让它们并行干而不是串行开会,还是单纯额度买少了,其实再充 100 刀就能成了?
我也在解决这个问题,有几个点可以优化。你可以看看 cf 和 google 怎么解决的: https://blog.cloudflare.com/ai-code-review/ https://cloud.google.com/blog/topics/threat-intelligence/staying-ahead-of-adversarial-ai-through-agentic-source-code-review
你这一套我用了半年,干个活要 1 小时才能干好一个需求,太慢了,于是我在优化这个过程。这个痛点是显而易见的,因为每个模型都喜欢扣细节,然后就对不上。越多就越扯皮。我认可 cf 和 google 的处理方式,我也在测试,不要每个角色都给最牛逼的模型,按情况用低一档的就行,比如你说的那个 ui ,说实话,这是很机械的活,用用 opus/sol 是大炮打蚊子,不要给每个角色喂重复上下文,我的处理方式是我用 pi 来做,所以每个 agent 是一个独立的 session ,这一件事不完 session 是不结束的。这样就后面的重复其实缓存命中率非常高。
效果怎么样不好说,我要解决的是干活太慢,不是干活质量的问题。目标是 review 一次 5 分钟内解决战斗。
再充 100 刀不如直接升级到 20X