模型与实验室 4.0 · 优秀 2026-08-26 · 文章

Qwen3.8-Flash-Next: GDN+QSA Hybrid, 125B/A6B, Qwen4 Architecture Preview

Qwen 团队发布 Qwen3.8-Flash-Next 开源权重,作为 Qwen4 所用模型结构的先导预览:125B 总参数加 51B N-gram Embedding,每 token 激活 6B,训练开销约为 Qwen3.7-Plus 的 1/9,原生 262K 上下文YaRN 可扩到 1M结构升级集中在四块Attention 用 Gated DeltaNet + Qwen Sparse Attention 混合(QSA 在 micro-block 粒度筛选重要上下文,压低长序列开销);Residual 扩成 4 分支 Gated Residual 用动态 Gate 控制信息读写;Embedding 引入可卸载到 host 内存的 N-gram Embedding(异步预取与计算重叠)...

打开原文回到归档

Qwen3.8-Flash-Next: GDN+QSA Hybrid, 125B/A6B, Qwen4 Architecture Preview

原文(抓取存档)

# Qwen Studio
> 作者: Qwen Team
> 发布时间: 2026-08-03T10:00:00+08:00
> 原文链接: https://qwen.ai/blog?id=qwen3.8-flash-next

---


[HUGGING FACE](https://huggingface.co/Qwen/Qwen3.8-Flash-Next)[MODELSCOPE](https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next)[TECH REPORT](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)[FLASHQLA](https://github.com/QwenLM/FlashQLA)[DISCORD](https://discord.gg/yPEP2vHTu4)

## 引言[#](#引言)

我们此次发布 **Qwen3.8-Flash-Next** 的开源权重,这是一个开源权重的多模态 MoE 模型,同时作为 **Qwen4** 所用模型结构的先导预览。它承担的角色与 [Qwen3-Next](https://qwen.ai/blog?id=qwen3-next) 对 Qwen3.5 的角色一致:当时引入的 **Gated DeltaNet + Gated Attention** 混合结构,此后被用于 Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。我们这次提前释出结构上的改动,以便在其上构建 Qwen4 完整模型家族之前,先让社区对其进行检验。

Qwen3.8-Flash-Next 围绕 **Attention、Residual、Embedding 和 Optimization** 四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:

-   **Attention**:采用 **GDN + QSA Hybrid 架构**。Gated DeltaNet(GDN)高效压缩历史信息;**Qwen Sparse Attention(QSA)** 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。
-   **Residual**:引入 **Gated Residual(GR)**,将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。
-   **Embedding**:引入 **N-gram Embedding**,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。
-   **Optimization**:采用 **Muon Optimizer**,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。

Qwen3.8-Flash-Next 的主模型参数量为 **125B**,额外配备 **51B** 的 N-gram Embedding,每 token 激活 **6B** 参数。 相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,训练开销仅约为前者的 **1/9**,但在编码和办公任务上却具有更强的能力。

它原生支持 **262,144** token 上下文,并可通过 YaRN 扩展至 **1,000,000** token。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的[技术报告](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)。

Qwen3.8-Flash-Next 权重已在 [Hugging Face](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) 与 [ModelScope](https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next) 发布。默认 1M 上下文并内置官方工具的生产版本,以 **Qwen3.8-Flash** 名称在 [千问AI平台](https://www.qianwenai.com/models/qwen3.8-flash) 提供服务,**每百万 Tokens 输入仅1元、输出3元**。

## 模型表现[#](#模型表现)

### 纯文本[#](#纯文本)

|  | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
| --- | --- | --- | --- | --- | --- |
|
\# Params

 | 125B | 27B | 397B | 284B | \-- |
|

\# Activated params

 | 6B | 27B | 17B | 13B | \-- |
|

\# N-gram embedding params

 | 51B | \-- | \-- | \-- | \-- |
| Coding |
|

Agentic coding

DeepSWE 1.1

 | **58.7** | 42.2 | 16.5 | 54.4 | \-- |
|

Agentic coding

SWE-bench Pro

 | **62.5** | 61.7 | 55.8 | 56.0 | 53.4 |
|

Multilingual software engineering

SWE-bench Multilingual

 | **81.0** | 73.8 | 75.8 | \-- | 77.5 |
|

Repo-level code generation

NL2Repo-Bench

 | 48.1 | 42.3 | 41.1 | **54.2** | 47.6 |
| Agent |
|

Long-horizon office work

CoWorkBench

 | **73.9** | 70.7 | 65.1 | 45.1 | 68.2 |
|

Professional job tasks

JobBench

 | **55.7** | 33.4 | 27.6 | 41.3 | 36.6 |
|

Frontier agentic tasks

Agents' Last Exam

 |

Pass@1

24.3

Score

**51.2**

 |

Pass@1

20.4

Score

42.9

 |

Pass@1

13.2

Score

33.6

 |

Pass@1

**25.2**

Score

\--

 | \-- |
|

Real-world tool use

Toolathlon Verified (Pass@1)

 | **73.5** | 67.1 | 50.6 | 70.3 | \-- |
| General |
|

Instruction following

IFBench

 | **81.3** | 79.5 | 79.1 | 79.2 | 62.5 |
|

Scientific reasoning

GPQA Diamond

 | **91.7** | 89.2 | 90.3 | 90.8 | 91.3 |
|

Multidisciplinary reasoning

HLE

 | 35.9 | 30.8 | 34.7 | 33.8 | **40.0** |
|

Competitive coding

LiveCodeBench v6

 | **91.9** | 90.3 | 89.6 | 90.6 | 88.8 |

1\. DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。我们报告两个框架中的最高分;值得注意的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
2\. SWE-bench Pro:除 Claude-Opus-4.6 (Max) 采用官方报告分数外,其余模型均使用 Claude Code 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。已修正存在问题的任务,并在修正后的基准上重新评估所有基线模型。
3\. SWE-bench Multilingual:使用 mini-SWE-agent 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。
4\. NL2Repo-Bench:使用 Claude Code 评测框架评估。为防止奖励黑客攻击,我们禁用了试图访问特定仓库的 Bash 命令,如 pip download、pip install 和 git clone。
5\. CoWorkBench:内部 Cowork 基准,用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长周期办公与生产力智能体任务。
6\. HLE:由 GPT-4o 评判。
7\. 每行最优结果加粗。
8\. 空白单元格(--):分数尚不可用或不适用。

### 多模态[#](#多模态)

|  | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude-Opus-4.6 (Max) |
| --- | --- | --- | --- | --- |
| Agentic Multimodal Intelligence |
|
Multimodal tool use

ClawEval-MM

 |

Pass@3

**64.4**

Average

**60.4**

 |

Pass@3

57.4

Average

56.9

 |

Pass@3

57.4

Average

60.1

 |

Pass@3

52.5

Average

54.7

 |
|

Application recreation

RecreationBench

 | **49.9** | 47.1 | 30.2 | \-- |
|

Mobile use

AndroidWorld

 | **84.5** | 81.9 | 81.0 | 62.0 |
|

Computer use

OSWorld 2.0

 |

Binary

**19.4**

Partial

**52.3**

 |

Binary

19.4

Partial

48.0

 |

Binary

2.8

Partial

21.5

 | \-- |
|

Visual web development

Vision2Web

 | **64.0** | 62.9 | 42.1 | \-- |
| General Multimodal Intelligence |
|

Embodied intelligence

ERQA

 | **72.3** | 65.5 | 69.8 | 40.8 |
|

Long video understanding

LVBench

 | **76.6** | 72.4 | 76.2 | 63.0 |
|

Real-world perception

RealWorldQA

 | **88.5** | 85.9 | 86.9 | 73.9 |
|

Visual math problem solving

MathVision

 |

Without CI

**90.6**

With CI

**95.7**

 |

Without CI

90.0

With CI

94.6

 |

Without CI

90.3

With CI

88.7

 |

Without CI

65.5

 |
|

Scientific chart analysis

CharXiv (RQ)

 |

Without CI

84.6

With CI

**90.6**

 |

Without CI

83.7

With CI

90.2

 |

Without CI

**85.8**

With CI

85.9

 |

Without CI

66.0

 |

1\. ClawEval-MM:分数以「pass@3 / 平均分」的形式给出。pass@3 为三次试验中至少通过一次的比例,平均分为三次试验得分的均值。
2\. RecreationBench:内部的长程应用复现 benchmark,用于评估覆盖五个平台的混合智能体能力——桌面(Ubuntu、macOS、Windows)、移动(Android)与网页。
3\. OSWorld 2.0:分数以「binary / partial」的形式给出。binary 为获得完整任务奖励的任务占比,partial 为在所有任务上取得的部分奖励的汇总。
4\. Vision2Web:取 frontend、webpage 与 website 三类的平均,使用 Claude Code harness,由 gpt-5.4-2026-03-05 评判。
5\. MathVision、CharXiv (RQ):分数以「不含 CI / 含 CI」的形式给出。MathVision 中少量标注有误的 ground truth 已在人工核对后修正。我们的分数使用固定 prompt 评测,例如「Please reason step by step, and put your final answer within \\boxed{}.」;对其他模型,我们取带与不带 \\boxed{} 指令两次结果中的较高者。
6\. 每行最优结果加粗。
7\. 空白单元格(--):分数尚不可用或不适用。

## 模型结构[#](#模型结构)


### Attention:GDN + QSA,高效记忆与精准检索[#](#attentiongdn--qsa高效记忆与精准检索)

传统 Full Attention 可以直接访问所有历史 token,但上下文越长,计算和 KV Cache 访存成本越高。

延续 Qwen3.5 的架构设计,Qwen3.8-Flash-Next 采用 **GDN [\[1\]](#ref1) + Attention 的 Hybrid 架构**:每四层中三层使用 Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。

对于全局 Attention,我们进一步引入 **Qwen Sparse Attention(QSA)**。Sparse Attention 通过只关注重要上下文来减少长序列下的计算,但现有方案如 DSA [\[2\]](#ref2) 通常仍需要一个 token 级 indexer 来寻找重要位置;随着上下文增长,indexer 本身的计算也会逐渐成为不可忽略的开销。

QSA 将这一过程进一步压缩:轻量 indexer 先把序列聚合成 **micro-block**,在 block 粒度上估计上下文重要性,再选出最相关的区域执行 Attention。这样不仅减少了实际 Attention 的计算量,也显著降低了“寻找重要上下文”本身的 indexing 成本。相比跨层共享索引[\[3\]](#ref3)的方法,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,也更适合 GDN 与 Attention 交替出现的 Hybrid 架构。


可以简单理解为:**GDN 负责高效“记住”,QSA 负责精准“查找”。**

在 **1M token** 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 **7.6×** 和 **4.9×** 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 **90%**),Qwen3.8-Flash-Next 在 **1M 上下文**下的 Prefill 吞吐达到 Qwen3.7-Plus 的 **8.6 倍**。


### Gated Residual:给信息更多传递路径[#](#gated-residual给信息更多传递路径)

传统 Transformer 中,各层持续在同一条 Residual Stream 上读写信息。随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。

**Gated Residual(GR)** 可以看作两种思路的结合:一方面延续 **Hyper-Connection**[\[4\]](#ref4) 将 residual stream 扩展为多分支的设计,另一方面将 **GatedNorm**[\[5\]](#ref5) 的逐元素动态门控融入 residual read。最终,原本单一的 residual stream 被扩展成 4 条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。

可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。实际分析中也观察到,其中一条 branch 会自然形成连接第一层 Attention 和大部分中后层的长距离通道。

GR 还进一步简化了 Hyper-Connection:当 read/write 足够灵活后,额外的 branch mixing 已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的 Gate 同时能够有效抑制 **activation outlier**、提升训练稳定性;Residual State 支持使用 **FP8** 存储,进一步降低访存开销。

### N-gram Embedding:低成本扩展模型容量[#](#n-gram-embedding低成本扩展模型容量)

受到 Gemma 3n 中 Per-Layer Embedding 和 DeepSeek Engram[\[6\]](#ref6) 等工作的启发,我们进一步引入 **N-gram Embedding**,从 Transformer 参数之外的维度扩展模型容量。

普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。

它的核心优势是: **可以增加大量参数,同时几乎不增加每个 token 的计算量。**

Qwen3.8-Flash-Next 额外引入了 **51B N-gram Embedding 参数**。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。

最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 **“局部模式记忆库”**。

### Optimization:架构和优化协同设计[#](#optimization架构和优化协同设计)

Qwen3.8-Flash-Next 使用 **Muon Optimizer**[\[7\]](#ref7) 训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:**正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分**。

对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,我们使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。

针对新的模型结构和 Optimizer,我们重新拟合了 Scaling Law。结果显示,模型可以稳定使用 **更大的 Learning Rate 和 Batch Size**,进一步提升收敛效率和大规模并行训练吞吐。

实验还发现,过去大模型训练中常见的 **Batch Size Warmup 已经不再必要**:从小 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 **18.8% 的 optimizer steps**。因此,在最终训练配置中,我们直接从目标 Batch Size 开始训练。

### 其他架构优化[#](#其他架构优化)

此外,其余组件沿用 Qwen3-Next 所确立、并在 Qwen3.5–Qwen3.8 系列中不断打磨的设计。

-   **极致稀疏 MoE**: 在全局负载均衡 [\[8\]](#ref8) 下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。
-   **Multi-Token Prediction**: MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下 speculative decoding 的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。
-   **训练稳定性**: 保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制 [\[9\]](#ref9),以及 MoE router 参数初始化的归一化。这些设计使小规模消融结果更为可靠,也有助于大规模训练平稳进行。

## Base 模型表现[#](#base-模型表现)

我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型进行比较。

|  | Qwen3.8-Flash-Next-Base | Qwen3.8-27B-Base | Qwen3.7-Plus-Base |
| --- | --- | --- | --- |
|
\# Params

 | 125B | 27B | 397B |
|

\# Activated params

 | 6B | 27B | 17B |
|

\# N-gram embedding params

 | 51B | \-- | \-- |
| General tasks |
|

MMLU

 | 90.36 | 87.51 | **90.43** |
|

MMLU-Redux

 | 90.68 | 87.26 | **91.47** |
|

MMLU-Pro

 | **73.23** | 68.60 | 70.90 |
|

SuperGPQA

 | **51.36** | 44.86 | 48.42 |
|

BBH

 | **90.87** | 89.56 | 89.41 |
| Math & STEM tasks |
|

GPQA

 | 51.42 | 45.01 | **51.52** |
|

GSM8K

 | **93.29** | 93.18 | 92.95 |
|

MATH

 | 72.78 | 60.54 | **74.38** |
| Coding tasks |
|

EvalPlus

 | **78.76** | 76.05 | 78.06 |
|

MultiPL-E

 | 79.09 | 74.50 | **81.68** |
|

SWEBench-Pretrain

 | **50.99** | 41.66 | 49.24 |
| Multilingual tasks |
|

MGSM

 | **89.33** | 86.37 | 85.42 |
|

MMMLU

 | **84.86** | 79.74 | 84.53 |
|

INCLUDE

 | 78.40 | 74.37 | **78.90** |

1\. 每行最优结果加粗。
2\. 空白单元格(--):分数尚不可用或不适用。

在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 与 MMMLU;在 MMLU、MMLU-Redux、GPQA、MATH 与 MultiPL-E 上与 Qwen3.7-Plus-Base 接近。其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。

## 开始使用 Qwen3.8-Flash-Next[#](#开始使用-qwen38-flash-next)

Qwen3.8-Flash-Next 已作为开放模型在 [HuggingFace](https://huggingface.co/collections/Qwen/qwen38-flash-next) 和 [ModelScope](https://www.modelscope.cn/collections/Qwen/Qwen38-Flash-Next) 公开,并在 [千问AI平台](https://www.qianwenai.com/models/qwen3.8-flash) 提供官方托管 API。 该模型在能力、延迟和成本之间取得了出色的平衡,非常适用于高并发应用、工具驱动的工作流以及编程与协同办公助手。 在下文中,您可以了解如何调用千问AI平台API,并将 Qwen3.8-Flash-Next 集成到智能体系统和编程助手中。

### API 使用[#](#api-使用)

Qwen3.8-Flash-Next 可通过 API 访问:

#### 千问AI平台[#](#千问ai平台)

在[千问AI平台](https://www.qianwenai.com/)上,该模型以 [`qwen3.8-flash`](https://www.qianwenai.com/models/qwen3.8-flash) 的名称提供服务。 千问AI平台支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口。

python

`""" Environment variables:   DASHSCOPE_API_KEY: Your API Key from https://platform.qianwenai.com/home  DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.    - Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1    - Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1    - US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1 """from openai import OpenAIimport os api_key = os.environ.get("DASHSCOPE_API_KEY")if not api_key:    raise ValueError(        "DASHSCOPE_API_KEY is required. "        "Set it via: export DASHSCOPE_API_KEY='your-api-key'"    ) client = OpenAI(    api_key=api_key,    base_url=os.environ.get(        "DASHSCOPE_BASE_URL",        "https://dashscope.aliyuncs.com/compatible-mode/v1",    ),) messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}] completion = client.chat.completions.create(    model="qwen3.8-flash",    messages=messages,    extra_body={        "enable_thinking": True,        # "preserve_thinking": True,    },    reasoning_effort="xhigh",  # supported levels are xhigh, medium, and low    stream=True,) reasoning_content = ""answer_content = ""is_answering = Falseprint("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n") for chunk in completion:    if not chunk.choices:        print("\nUsage:")        print(chunk.usage)        continue     delta = chunk.choices[0].delta     if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:        if not is_answering:            print(delta.reasoning_content, end="", flush=True)        reasoning_content += delta.reasoning_content     if hasattr(delta, "content") and delta.content:        if not is_answering:            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")            is_answering = True        print(delta.content, end="", flush=True)        answer_content += delta.content`

### 智能体框架与编程助手[#](#智能体框架与编程助手)

Qwen3.8-Flash-Next 可无缝集成主流的智能体框架与编程助手:

#### 千问办公(即将上线) [#](#千问办公即将上线-----coming-soon-remove-at-qwenwork-release---)

[千问办公](https://qwenwork.cn/) 是阿里巴巴旗下的旗舰级 AI 生产力平台,旨在帮助个人与企业实现日常任务的自动化与业务运转效率的加速。

千问办公现已接入 **Qwen3.8-Flash-Next**,驱动其全新推出的“标准”模式。依托模型的前沿能力,这一模式将为用户带来 Agent 智能水平、推理效率、成本控制三位一体的极致体验,重新定义 AI 办公场景新“标准”。


了解更多详情请参阅[官方文档](https://qwenwork.cn/docs/product-introduction)!

#### Claude Code[#](#claude-code)

Qwen API 支持 Anthropic API 协议,可直接配合 **Claude Code** 使用:

bash

`npm install -g @anthropic-ai/claude-code export ANTHROPIC_MODEL="qwen3.8-flash"export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash"export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic export ANTHROPIC_AUTH_TOKEN=<your_api_key> claude`

#### Codex[#](#codex)

Qwen API 支持 OpenAI Responses 协议,可配合 **Codex** 使用:

在 `~/.codex/model-catalog.local.json` 中配置:

json

`{  "models": [    {      "slug": "qwen3.8-flash",      "display_name": "qwen3.8-flash",      "description": "千问AI平台: Qwen3.8-Flash",      "default_reasoning_level": "xhigh",      "supported_reasoning_levels": [        {          "effort": "low",          "description": "Fast responses with lighter reasoning"        },        {          "effort": "medium",          "description": "Greater reasoning depth for complex problems"        },        {          "effort": "xhigh",          "description": "Extra high reasoning depth for complex problems"        }      ],      "context_window": 1000000,      "effective_context_window_percent": 95,      "supports_parallel_tool_calls": true,      "supports_image_detail_original": true,      "input_modalities": ["text", "image"],      "shell_type": "default",      "visibility": "list",      "supported_in_api": true,      "priority": 1,      "base_instructions": "",      "support_verbosity": false,      "supports_reasoning_summaries": false,      "experimental_supported_tools": [],      "truncation_policy": {        "mode": "bytes",        "limit": 10000      }    }  ]}`

在 `~/.codex/config.toml` 中配置:

toml

`model_catalog_json = "~/.codex/model-catalog.local.json" model_provider = "QwenCloud"model = "qwen3.8-flash" [model_providers.QwenCloud]name = "千问AI平台"base_url = "https://dashscope.aliyuncs.com/compatible-mode/v1"env_key = "OPENAI_API_KEY"wire_api = "responses"`

bash

`npm install -g @openai/codex export OPENAI_API_KEY=<your_api_key> codex`

#### Qoder CLI[#](#qoder-cli)

[Qoder](https://qoder.com/) 与 Qwen 协同演进,专为智能体编程(Agentic Coding)打造:

bash

`curl -fsSL https://qoder.com/install | bash qoder`

#### Qwen Code[#](#qwen-code)

[Qwen Code](https://qwen.ai/qwencode) 针对 Qwen 系列模型进行了深度优化:

bash

`npm install -g @qwen-code/qwen-code@latest qwen`

#### OpenClaw[#](#openclaw)

通过 [千问AI平台](https://platform.qianwenai.com/docs/developer-guides/clients-and-developer-tools/openclaw) 连接 [OpenClaw](https://openclaw.ai/):

bash

`curl -fsSL https://openclaw.ai/install.sh | bash export DASHSCOPE_API_KEY=<your_api_key> openclaw dashboard`

配置 `~/.openclaw/openclaw.json`:

json

`{  "models": {    "mode": "merge",    "providers": {      "qwencloud": {        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",        "apiKey": "DASHSCOPE_API_KEY",        "api": "openai-completions",        "models": [          {            "id": "qwen3.8-flash",            "name": "qwen3.8-flash",            "reasoning": true,            "input": ["text", "image"],            "contextWindow": 1000000,            "maxTokens": 65536          }        ]      }    }  },  "agents": {    "defaults": {      "model": {        "primary": "qwencloud/qwen3.8-flash"      }    }  }}`

## 总结[#](#总结)

Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。

我们像发布 Qwen3-Next 时一样提前释出这批权重,以便该结构能够被社区独立评测;我们也将继续朝 Qwen4 的方向对其进行完善。

## 引用[#](#引用)

bibtex

`@techreport{qwen2026design,    title       = {On the Design of {Qwen3.8-Next} Architecture: Evaluation, Efficiency, and Training Stability},    author      = {{Qwen Team}},    institution = {Alibaba Group},    month       = {August},    year        = {2026}} @misc{qwen3.8flashnext,    title  = {{Qwen3.8-Flash-Next}: A New Architecture, Towards Ultimate Cost-Efficiency},    author = {{Qwen Team}},    month  = {August},    year   = {2026},    url    = {https://qwen.ai/blog?id=qwen3.8-flash-next}}`

# 参考文献[#](#参考文献)

\[1\] Gated Delta Networks: Improving Mamba2 with Delta Rule

\[2\] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

\[3\] IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse

\[4\] Hyper-Connections

\[5\] A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

\[6\] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

\[7\] Muon: An Optimizer for Hidden Layers in Neural Networks

\[8\] Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models

\[9\] Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free

中文导读

Qwen 团队发布 Qwen3.8-Flash-Next 开源权重,作为 Qwen4 所用模型结构的先导预览:125B 总参数加 51B N-gram Embedding,每 token 激活 6B,训练开销约为 Qwen3.7-Plus 的 1/9,原生 262K 上下文、YaRN 可扩到 1M。结构升级集中在四块——Attention 用 Gated DeltaNet + Qwen Sparse Attention 混合(QSA 在 micro-block 粒度筛选重要上下文,压低长序列开销);Residual 扩成 4 分支 Gated Residual 用动态 Gate 控制信息读写;Embedding 引入可卸载到 host 内存的 N-gram Embedding(异步预取与计算重叠);优化器换 Muon 并围绕正交化精度、Muon/AdamW 参数分工重新拟合 scaling law。基准:DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、JobBench 55.7;以 Qwen3.8-Flash 名义服务时每百万 token 输入 1 元、输出 3 元。不像普通模型迭代,更像把下代大模型的结构赌注提前放出来让社区检验。

为什么值得关注

Qwen4 结构先导:GDN+QSA 混合注意力、4 分支 Gated Residual、N-gram Embedding、Muon 四赌注一次性放出,125B/A6B 训练成本 1/9

English Summary

Qwen3.8-Flash-Next open-weights release previews the Qwen4 architecture: 125B total parameters plus a 51B N-gram Embedding table with 6B active per token, training cost ~1/9 of Qwen3.7-Plus, native 262K context (YaRN to 1M). Four structural bets: Gated DeltaNet + Qwen Sparse Attention hybrid attention, a 4-branch Gated Residual with dynamic gates, an offloadable N-gram Embedding with async prefetch, and a Muon optimizer with refitted scaling laws. Benchmarks: DeepSWE 1.1 58.7, SWE-bench Pro 62.5, CoWorkBench 73.9, JobBench 55.7; served as Qwen3.8-Flash at CNY 1/M input and 3/M output tokens.

Obsidian Notes