Hasty Briefsbeta

双语

Benchmarking Qwen 3.6 35B MoE (3B active) on an RTX 3090

4 hours ago
  • 作者在配备24GB显存的RTX 3090上,使用4位量化版本(UD-IQ4_NL_XL)和Llama.cpp测试了Qwen 3.6 35B MoE模型。
  • 仅使用GPU和UD-IQ4_NL_XL量化时,模型生成速度超过120 tok/s,提示处理速度近2800 tok/s,但上下文限制在约5万token。
  • 将12层FFN卸载到CPU后,显存得以释放以实现完整的262144 token上下文,但生成速度降至约65 tok/s,提示处理速度约600 tok/s。
  • 使用CUDA编译Llama.cpp提升了性能:完全在GPU上运行时,生成速度达140 tok/s,提示处理速度超3300 tok/s,上下文支持89600 token;卸载10层时,完整上下文下生成速度为89 tok/s。
  • 作者自动执行了跨卸载层数的基准测试,使用2457 token的提示并生成6144 token,发现Vulkan下12层卸载是最优解,CUDA下则为10层。
  • 内存使用显示显存在达到完整上下文前保持满载,随后平稳下降;而系统内存随层数卸载逐渐增加。
  • 研究强调,3B活跃参数中仅2B用于实际思考,1B用于嵌入和输出头;MoE模型需要将所有参数保留在内存中,尽管每个token只有子集活跃。
  • 文章总结称,RTX 3090虽能运行该模型,但24GB显存存在局限性,且CUDA在此模型上的性能显著优于Vulkan。