试了最新出的 Qwen3.8-27B ,吐字很慢,4token/s 。 试了 Qwen3.6-35B-A3B ,质量感觉不行,幻觉有些严重。
因为这货的带宽太低了,所以非常不适合稠密模型的推理。所以比较合适的还是两台上满血 d4f
登录后可发帖和回复
因为这货的带宽太低了,所以非常不适合稠密模型的推理。所以比较合适的还是两台上满血 d4f