sentinelK
人脑的上下文缓存很小,但是模型规模很大。而且模型还能自训练。 所以人做事很多时候靠的是模型规模带来的直觉。很少用上下文长度来暴力穷举。
之所以累,就是因为你用 AI 擅长的方式来和 AI 协作。导致你需要同时处理太多上下文。 我理解,要么你就利用你的模型规模,给 AI 明确的技术方向,只让…
知识量越小的模型,越是靠后训练对齐来穷举。
知识量大就有更多的基础认知,就有更多的直觉。能够预测更正确的方向。 知识量小,只能靠坚持和毅力,来磨结果。
另外还有一点,就是最新这波模型的后训练都往“百折不挠”这个性格去对齐了。 就是除非有实质性证据,否则绝对不产生结论。宁肯自己单独写个…
不要被大厂那套“职级”把自己给骗了。
1 、你的“职级”是社会硬通货吗? 2 、“职级”到了就不裁你了? 3 、你有管理岗需要的资源吗?
大厂最大的原罪,就是搞职级。包装的好像努力就能和公司一起进步。好像一套伟光正的客观标准 实际都是扯淡。
缓存命中涨了 5 倍,deepseek 缓存命中很高,基本上就约等于价格涨了 5 倍。
@defunct9 32G 的话,跑 nvfp4 量化的更合适一些,否则上下文过短了,不够实用。 但是 nvfp4 有一系列的问题: 1 、官方并没有 nvfp4 量化的模型,目前最资深的第三方就是 unsloth 家的。 2 、unsloth 家的 nvfp4 明确不支持 sglang 。 …
@privil 但是楼主押宝的是 GB10 ,他的“显存”带宽很小。如果楼主买的是 rtx pro 6000 maxQ ,4 卡集群,我都认为合理。
GB10 就注定了大模型能跑,跑不快,小模型跑不过显卡。
@sillydaddy 这个预估完全失真。
实际使用中,一定是在 harness 场景下,harness 有巨量的系统提示词,即便是计算上超高的缓存命中,prefill 和 decode 的运算占比最终接近 7:3 。如果你计算上 prefill 的速度,你就会发现大概是 15~20 年回本。
其实跟 AI 关系不大,是经济环境+硬件价格导致整个信息化产业萎缩了。
C 端买不起手机,B 端买不起电脑,软件怎么卖……