GoForum🌐 V2EX

7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准

JoeJoeJoe · 2026-07-09 09:23 · 0 次点赞 · 0 条回复
0 条回复
添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: JoeJoeJoe
发布: 2026-07-09
点赞: 0
回复: 0