i9-13900K + 128G + RTX5090 + Strata + MTP 部署 Qwen3.8-Flash-Next-GSQ-RCO-abliterated-GGUF
最高141 tok/s 最高的时候可以到150tok/s 体验还是不错!
就是不爽的是上下文长度不够,赶主流模型还是有点差距....
CPU:i9-13900K
RAM:128GB DDR5
GPU:NVIDIA RTX 5090
模型:Qwen3.8-Flash-Next-GSQ-RCO-abliterated-GGUF
环境:Strata + MTP





再➕一个5090呢
@wo66111 #1 没用 因为用了 Strata 框架 没意义了
意义不大吧,你这模型超过了RTX 5090的显存,会反复offload
这一套现在得小十万了吧
玩酒馆的效果怎么样?
@hundouluo #3 不会吧,现在都是把不需要的放到内存里,需要的时候再拿出来
IQ3_S对5090而言太残了,Strata建议试一下这个,期待性能反馈:orcarouter-qwen3.8-flash-next-uncensored-iq4_xs,在这里:https://huggingface.co/orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
管理@skysailing #6
会反复offload, cpu,gpu,ssd ,几乎都处于不可用状态(hold),自己玩玩可以。无法商用。
@pekingmine #7 我的哥 这个我 Q2_K 都跑不起来啊 没那么显存装啊
@hundouluo #3 大哥 你了解下 Strata 做了分层卸载的 还行 就是上下文不够