Qwen3.8-Flash-Next Day-0 NVFP4 + dual DGX Spark deployment math
- 原文链接: https://x.com/wei_wang/status/2092618570114994389
- 作者: @wei_wang
- 日期: 2026-08-26
- 分类: models
- 来源类型: x_post
- 标签: quantization, nvfp4, local-llm, dgx-spark, qwen, inference
- 质量评分: 4/5
- 抓取时间: 2026-08-28T23:55:00+08:00
中文导读
RadixArk 放出 Qwen3.8-Flash-Next 的 Day-0 NVFP4 量化版:约 180B 总参数、48 层 MoE、512 个 Experts,原生支持文本/图片/视频输入与 262K 上下文;BF16 全精度约 360GB,NVFP4 压到 135GB(约 1/2.7)。单台 DGX Spark 128GB Unified Memory 装不下,双机合计 256GB 才进入舒适运行区间,还能给 KV Cache 与推理框架留余量。路线是 RadixArk + SGLang + NVIDIA Blackwell 原生 NVFP4,不必等 GGUF 社区逐步适配。这条硬件账意味着 180B 量级模型在桌面级双机上可舒服运行,本地 token 自由跨过新的硬件门槛;NVFP4 在 Blackwell 上 Day-0 与开源模型同框,正在追平 BF16→GGUF→社区量化通常落后 1-2 周的节奏。作者预告将与 DeepSeek V4 Flash 做同硬件、同 Harness、同任务对比。
为什么值得关注
端到端可核验的部署测算(参数量、显存、量化比、双机拓扑),是本地部署选型与量化生态观察的一手参照。
原文(抓取存档·节选)
---
title: "Qwen3.8-Flash-Next Day-0 NVFP4 + dual DGX Spark deployment math"
author: "@wei_wang"
date: 2026-08-26
source_url: https://x.com/wei_wang/status/2092618570114994389
captured_at: "2026-08-28 1249 +08:00"
---
# Qwen3.8-Flash-Next Day-0 NVFP4 + dual DGX Spark deployment math
Original tweet thread (verbatim):
这就是我为什么要买两台 DGX Spark。
RadixArk 已经放出 Qwen3.8-Flash-Next 的 Day-0 NVFP4 版本。
约 180B 总参数、48 层 MoE、512 个 Experts,支持文本、图片和视频输入,原生 262K 上下文。
BF16 版本约 360GB,NVFP4 压缩到 135GB,体积缩小约 2.7 倍。
单台 DGX Spark 只有 128GB Unified Memory,刚好差一点装不下。
双 DGX Spark 合计 256GB,终于进入这个模型真正舒服的运行区间,还能给 KV Cache、长上下文和推理框架留出空间。
而且这是 RadixArk + SGLang + NVIDIA Blackwell 的原生路线,不需要先等 GGUF 慢慢适配。
本地 Token 自由新阶段的门票已经到了。
接下来直接部署,然后和 DeepSeek V4 Flash 同硬件、同 Harness、同任务正面对比。
本地备份
- Obsidian 源文件:
X 文章/2026-08-28-1249-wei_wang-Qwen3.8-Flash-Next-NVFP4-DGX-Spark.md