Qwen 3.6 35B MoE on RTX 3090: 本地 MoE 推理的 VRAM 和后端取舍
- ID: c3ca8c18
- 原文链接: https://www.gilesthomas.com/2026/07/benchmarking-qwen-3-6-35b-moe-rtx-3090
- 作者: Giles Thomas
- 日期: 2026-07-27
- 分类: infra
- 标签: qwen, moe, llama-cpp, local-inference, vram, cuda, vulkan, quantization
- 质量评分: 4/5
中文摘要
扎实的本地推理 lab notes。作者在 RTX 3090 上测试 Qwen 3.6 35B MoE 的 Unsloth UD-IQ4_NL_XL quant:Vulkan 全 GPU 约 120 tok/s、prompt 约 2800 tok/s,上下文只能到约 50k;自编 CUDA 后全 GPU 约 140 tok/s、prompt 超 3300 tok/s,上下文约 89.6k。为了跑满 262k 上下文,需要把部分 FFN offload 到 CPU,速度会明显下降,但能换回 VRAM 空间。文章把 4-bit quant、Llama.cpp Vulkan/CUDA、上下文长度、FFN offload、MoE 内存占用讲成可复查的工程取舍。
English Summary
Practical lab notes benchmarking Qwen 3.6 35B MoE on RTX 3090 with Unsloth UD-IQ4_NL_XL quantization: Vulkan achieves ~120 tok/s (prompt ~2800 tok/s, ~50k context), custom CUDA reaches ~140 tok/s (~3300+ tok/s prompt, ~89.6k context). Full 262k context requires FFN CPU offloading with notable speed tradeoff.
推荐语
RTX 3090 跑 Qwen 3.6 35B MoE 实测:Vulkan vs CUDA 后端的 VRAM/速度/上下文长度三角取舍
来源: AK-RSS-Digest / X书签消化 2026-07-27