GoForum🌐 V2EX

少一点 LLM 来回,多一点单回合命令: Agent 做调研时更靠谱的一种思路

yohjisakamoto · 2026-08-05 05:19 · 0 次点赞 · 0 条回复

真实 15 页任务产出

最近在试一种 Agent 工作方式:少一点 LLM 来回,多一点单回合批量命令。

测试任务是一份 15 页的东亚鱿鱼料理演示,需要同时找菜谱、图片和烹饪视频,还要确认链接、资源和多屏布局都能用。

四次运行里,直接执行组平均 10 个回合、82 次工具调用; CLI 风格组平均 13.5 个回合、10.5 次调用。某个回合一次并行做了约 20 次菜谱/视频搜索,最后核对了 10 个来源、10 个不重复视频、15 个资源和 1440 / 768 / 390 三种屏幕宽度,还修掉了一个坏地址。

只有四次运行,所以这不是“任何时候都更快”的结论;耗时有快有慢,token 的统计来源也不同。真正有用的点是:让 LLM 回合做判断,让命令做可搜索、可测试、可复查的工作。

交互任务: https://turaai.net/benchmark-task?task=east-asian-squid-recipes-slides

原始结果: https://github.com/Tura-AI/benchmark/tree/main/results/design/east-asian-squid-recipes-slides/report-20260711-design-matrix

说明:我维护 Tura 和这套 benchmark 。你们的工作流里,有哪一步适合“模型判断一次,然后批量跑可验证命令”?

0 条回复
添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: yohjisakamoto
发布: 2026-08-05
点赞: 0
回复: 0