从夯到拉锐评现存大模型
本次的评测基于个人使用的主观感受整理,结合能力,价格,速度,以及 copliot 和 open code ,claudecode ,codex 这四个 agent 来评判。
前排打个🦶先
1.minimax 拉完了
为什么把米尼麦克死老师放在第一位,是因为我至今为被 m 老师骗了 29 块钱而耿耿于怀,minimax2.5 属于是又快又烂的典范,第一次使用的人无不被他极快的生成速度惊艳,别管能不能用,你就说快不快吧。生成的代码大概率过不了编译器,这谁绷得住。
2.claude 夯
这个没啥好说的,a➗虽然犯下了包括但不限于傲慢之罪,背刺之罪,贪婪之罪,歧视之罪,10 块钱一句 hello ,封国区,封全世界各种离谱之罪 但没法否认在其他模型绕弯修不好 bug 的时候只能依靠 claude 大人力挽狂澜。模型和 agent 夯。
另外,再次致敬最尊重国人、最不会营销、最清白、最懂安全、最尊重版权、最不会蒸馏、最严于律己宽于待人、最喜欢给用户发福利、最不爱定制榜单、最不喜欢把模型降智给用户限流、最便宜、最喜欢人工维护、最不会全程让 AI 工作然后出岔子只会甩锅、最不会侵犯用户隐私然后倒打一耙限制蒸馏、最喜欢修 bug 然后补偿用户损失、最见的别人家好、最喜欢公平竞争、最讨厌装神弄鬼的 Anthropic
3.deepseek 介于顶级和夯之间
梁圣伟大无需多言 :sweat_smile:,梁叔叔跟免费发 token 其实也没有什么太大的区别,v4 出来之前只能给到 npc ,但是 v4pro 出来之后实际体验上可以替代 claudeopus4.6 ,应该是比 4.7 差一点的水平,v4flash 已经够完成日常 85% 的编码工作了,最主要的是,跟 minimax 老师一样快,效果还相当不错。高强度用一天一看账单才 5 块钱,对比 claude 一句 hello10 块钱…..不好评价。期待 v4.1 的多模态,能不能追上 gpt 。话说公司能不能发点 ds 的 token ,日常任务真的很好用啊,100 块钱能用一个月,opus4.7 高强度使用下来一天就顶不住了,然而很多时候用不到 opus4.7 ,中转站的速度还有点慢!
4.glm 顶级
glm5.2 真国模一哥了吧,速度和生成能力都是一流。但是你这 codingplan 价格对标 gpt 了几个意思,刚用没几天,实际体验跟 opus4.7 一个水平,后续深度使用再补充
5.codex 神中神
5.5 给到夯! agent 给到夯!为什么说是神中神因为这是公司免费发放的,怎么不叫人感激涕零,量大管饱,多模态能力一流,不封号不封区,是个代理就能连。心情一好重置额度,心情不好过两天再重置,谁懂连续使用 5 个小时额度耗尽后发现送了一次额度重置的救赎感。美中不足的是没有原生的远程开发能力以及编辑器登录锁地区(当然可能是我的梯子 ip 不够纯,但是我的梯子 ip 不够纯又不太可能)。奥特曼干翻 a➗好吗🥺
6.qwen 人上人
qwen 老师一直都很努力但是真的有点查无此人的意思,看在开源一哥的份上给予 qwen 老师一点尊重,谁没用 qwen3b 微调过模型呢!
7.豆包 拉完了
coding 这一块搞笑来的
8.gemini 拉完了
美国豆包,继续量化吧 g 老师,神一时鬼一时,g 老师总有一天能把自己量化到部署在手机上
9.文心一言 拉夯了
不评价了,dddd ,很难想象至今还有模型缩进能缩错的
10.kimi 没用过 code 不好评价
印象还停留在网页版的高峰期算力不足,请稍候提问
11.grok 某些方面夯,code 拉
不解释
剩余的主播不了解,不做评价,有用过的可以分享一下好用的 agent 和 model 组合!
在哪复制粘贴的这是?大清都亡了啊你还搁这 gpt5.5 、m2.5 、v4pro 、glm5.2 呢
Deepseek v4pro 比 GLM5.3 差距不小,我觉得只能给到人上人,结合价格,可以给到定级 比如两个场景:
- 指令遵从效果,比不上 GLM5.3 ,比如 Playwright-cli 场景
- Coding 能力比不上 GLM5.3 ,比如给项目增加 UT 覆盖,尝试让模型达到覆盖率的极限
是不是基座模型、Agent 、Harness 没分清?