模型与实验室 4.0 · 优秀 2026-07-27 · 文章

Qwen 3.6 35B MoE on RTX 3090: 本地 MoE 推理的 VRAM 和后端取舍

扎实的本地推理 lab notes作者在 RTX 3090 上测试 Qwen 3.6 35B MoE 的 Unsloth UD-IQ4_NL_XL quant:Vulkan 全 GPU 约 120 tok/sprompt 约 2800 tok/s,上下文只能到约 50k;自编 CUDA 后全 GPU 约 140 tok/sprompt 超 3300 tok/s,上下文约 89.6k为了跑满 262k 上下文,需要把部分 FFN offload 到 CPU,速度会明显下降,但能换回 VRAM 空间文章把 4-bit quantLlama.cpp Vulkan/CUDA上下文长度FFN offloadMoE 内存占用讲成可复查的工程取舍

打开原文回到归档

Qwen 3.6 35B MoE on RTX 3090: 本地 MoE 推理的 VRAM 和后端取舍

中文摘要

扎实的本地推理 lab notes。作者在 RTX 3090 上测试 Qwen 3.6 35B MoE 的 Unsloth UD-IQ4_NL_XL quant:Vulkan 全 GPU 约 120 tok/s、prompt 约 2800 tok/s,上下文只能到约 50k;自编 CUDA 后全 GPU 约 140 tok/s、prompt 超 3300 tok/s,上下文约 89.6k。为了跑满 262k 上下文,需要把部分 FFN offload 到 CPU,速度会明显下降,但能换回 VRAM 空间。文章把 4-bit quant、Llama.cpp Vulkan/CUDA、上下文长度、FFN offload、MoE 内存占用讲成可复查的工程取舍。

English Summary

Practical lab notes benchmarking Qwen 3.6 35B MoE on RTX 3090 with Unsloth UD-IQ4_NL_XL quantization: Vulkan achieves ~120 tok/s (prompt ~2800 tok/s, ~50k context), custom CUDA reaches ~140 tok/s (~3300+ tok/s prompt, ~89.6k context). Full 262k context requires FFN CPU offloading with notable speed tradeoff.

推荐语

RTX 3090 跑 Qwen 3.6 35B MoE 实测:Vulkan vs CUDA 后端的 VRAM/速度/上下文长度三角取舍

来源: AK-RSS-Digest / X书签消化 2026-07-27