GoForum › 🌐 V2EX
7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准
JoeJoeJoe ·
2026-07-09 09:23 ·
0 次点赞 · 0 条回复
信息来源:
https://openai.com/index/separating-signal-from-noise-coding-evaluations

https://x.com/OpenAI/status/2074972179385720836

0 条回复
添加回复
你还需要 登录
后发表回复