GoForum🌐 V2EX

从夯到拉锐评现存大模型

Mroldx · 2026-08-25 11:43 · 0 次点赞 · 9 条回复

本次的评测基于个人使用的主观感受整理,结合能力,价格,速度,以及 copliot 和 open code ,claudecode ,codex 这四个 agent 来评判。

前排打个🦶先

1.minimax 拉完了

为什么把米尼麦克死老师放在第一位,是因为我至今为被 m 老师骗了 29 块钱而耿耿于怀,minimax2.5 属于是又快又烂的典范,第一次使用的人无不被他极快的生成速度惊艳,别管能不能用,你就说快不快吧。生成的代码大概率过不了编译器,这谁绷得住。

2.claude 夯

这个没啥好说的,a➗虽然犯下了包括但不限于傲慢之罪,背刺之罪,贪婪之罪,歧视之罪,10 块钱一句 hello ,封国区,封全世界各种离谱之罪 但没法否认在其他模型绕弯修不好 bug 的时候只能依靠 claude 大人力挽狂澜。模型和 agent 夯。

另外,再次致敬最尊重国人、最不会营销、最清白、最懂安全、最尊重版权、最不会蒸馏、最严于律己宽于待人、最喜欢给用户发福利、最不爱定制榜单、最不喜欢把模型降智给用户限流、最便宜、最喜欢人工维护、最不会全程让 AI 工作然后出岔子只会甩锅、最不会侵犯用户隐私然后倒打一耙限制蒸馏、最喜欢修 bug 然后补偿用户损失、最见的别人家好、最喜欢公平竞争、最讨厌装神弄鬼的 Anthropic

3.deepseek 介于顶级和夯之间

梁圣伟大无需多言 :sweat_smile:,梁叔叔跟免费发 token 其实也没有什么太大的区别,v4 出来之前只能给到 npc ,但是 v4pro 出来之后实际体验上可以替代 claudeopus4.6 ,应该是比 4.7 差一点的水平,v4flash 已经够完成日常 85% 的编码工作了,最主要的是,跟 minimax 老师一样快,效果还相当不错。高强度用一天一看账单才 5 块钱,对比 claude 一句 hello10 块钱…..不好评价。期待 v4.1 的多模态,能不能追上 gpt 。话说公司能不能发点 ds 的 token ,日常任务真的很好用啊,100 块钱能用一个月,opus4.7 高强度使用下来一天就顶不住了,然而很多时候用不到 opus4.7 ,中转站的速度还有点慢!

4.glm 顶级

glm5.2 真国模一哥了吧,速度和生成能力都是一流。但是你这 codingplan 价格对标 gpt 了几个意思,刚用没几天,实际体验跟 opus4.7 一个水平,后续深度使用再补充

5.codex 神中神

5.5 给到夯! agent 给到夯!为什么说是神中神因为这是公司免费发放的,怎么不叫人感激涕零,量大管饱,多模态能力一流,不封号不封区,是个代理就能连。心情一好重置额度,心情不好过两天再重置,谁懂连续使用 5 个小时额度耗尽后发现送了一次额度重置的救赎感。美中不足的是没有原生的远程开发能力以及编辑器登录锁地区(当然可能是我的梯子 ip 不够纯,但是我的梯子 ip 不够纯又不太可能)。奥特曼干翻 a➗好吗🥺

6.qwen 人上人

qwen 老师一直都很努力但是真的有点查无此人的意思,看在开源一哥的份上给予 qwen 老师一点尊重,谁没用 qwen3b 微调过模型呢!

7.豆包 拉完了

coding 这一块搞笑来的

8.gemini 拉完了

美国豆包,继续量化吧 g 老师,神一时鬼一时,g 老师总有一天能把自己量化到部署在手机上

9.文心一言 拉夯了

不评价了,dddd ,很难想象至今还有模型缩进能缩错的

10.kimi 没用过 code 不好评价

印象还停留在网页版的高峰期算力不足,请稍候提问

11.grok 某些方面夯,code 拉

不解释

剩余的主播不了解,不做评价,有用过的可以分享一下好用的 agent 和 model 组合!

9 条回复
Rickkkkkkk · 2026-08-25 11:43
#1

是不是基座模型、Agent 、Harness 没分清?

lisia · 2026-08-25 11:43
#2

我现在基于 Claude cli 来使用 minimax 使用的 MiniMax-M3 模型,拿来做简单的代码开发还是能够胜任。之前是使用的 Codex ,由于失业了就没有续费 Codex 。

使用 M3 模型也很少出现无法过编译的问题,我主要是做 node 全栈的一些项目。

影响我使用的地方就是生成图片与 Codex 相比还是差得比较远。

siriusliangcn · 2026-08-25 11:43
#3

在哪复制粘贴的这是?大清都亡了啊你还搁这 gpt5.5 、m2.5 、v4pro 、glm5.2 呢

zturns · 2026-08-25 11:43
#4

现在用 V4F 高强度一天可不止 5 块了

deplives · 2026-08-25 11:48
#5

@Livid AI

idcidc · 2026-08-25 11:53
#6

什么东西都混在一起讲 还有 从哪复制来的 5.5 都出来了

Nitromethane · 2026-08-25 11:58
#7

Deepseek v4pro 比 GLM5.3 差距不小,我觉得只能给到人上人,结合价格,可以给到定级 比如两个场景:

  1. 指令遵从效果,比不上 GLM5.3 ,比如 Playwright-cli 场景
  2. Coding 能力比不上 GLM5.3 ,比如给项目增加 UT 覆盖,尝试让模型达到覆盖率的极限
musi · 2026-08-25 11:58
#8
  1. 怎么吹 deepseek 的自己都不用 deepseek ,一时分不清你是吹还是黑
allanwell · 2026-08-25 12:03
#9

Grok code 还真不拉,你试试 4.6

添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: Mroldx
发布: 2026-08-25
点赞: 0
回复: 0