Qwen3.8-Flash-Next: GDN+QSA Hybrid, 125B/A6B, Qwen4 Architecture Preview
- 原文链接: https://qwen.ai/blog?id=qwen3.8-flash-next
- 作者: Qwen Team
- 日期: 2026-08-26
- 分类: models
- 来源类型: article
- 标签: models, qwen, hybrid-attention, moe, long-context
- 质量评分: 4/5
原文(抓取存档)
# Qwen Studio
> 作者: Qwen Team
> 发布时间: 2026-08-03T10:00:00+08:00
> 原文链接: https://qwen.ai/blog?id=qwen3.8-flash-next
---
[HUGGING FACE](https://huggingface.co/Qwen/Qwen3.8-Flash-Next)[MODELSCOPE](https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next)[TECH REPORT](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)[FLASHQLA](https://github.com/QwenLM/FlashQLA)[DISCORD](https://discord.gg/yPEP2vHTu4)
## 引言[#](#引言)
我们此次发布 **Qwen3.8-Flash-Next** 的开源权重,这是一个开源权重的多模态 MoE 模型,同时作为 **Qwen4** 所用模型结构的先导预览。它承担的角色与 [Qwen3-Next](https://qwen.ai/blog?id=qwen3-next) 对 Qwen3.5 的角色一致:当时引入的 **Gated DeltaNet + Gated Attention** 混合结构,此后被用于 Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。我们这次提前释出结构上的改动,以便在其上构建 Qwen4 完整模型家族之前,先让社区对其进行检验。
Qwen3.8-Flash-Next 围绕 **Attention、Residual、Embedding 和 Optimization** 四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:
- **Attention**:采用 **GDN + QSA Hybrid 架构**。Gated DeltaNet(GDN)高效压缩历史信息;**Qwen Sparse Attention(QSA)** 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。
- **Residual**:引入 **Gated Residual(GR)**,将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。
- **Embedding**:引入 **N-gram Embedding**,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。
- **Optimization**:采用 **Muon Optimizer**,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。
Qwen3.8-Flash-Next 的主模型参数量为 **125B**,额外配备 **51B** 的 N-gram Embedding,每 token 激活 **6B** 参数。 相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,训练开销仅约为前者的 **1/9**,但在编码和办公任务上却具有更强的能力。
它原生支持 **262,144** token 上下文,并可通过 YaRN 扩展至 **1,000,000** token。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的[技术报告](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)。
Qwen3.8-Flash-Next 权重已在 [Hugging Face](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) 与 [ModelScope](https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next) 发布。默认 1M 上下文并内置官方工具的生产版本,以 **Qwen3.8-Flash** 名称在 [千问AI平台](https://www.qianwenai.com/models/qwen3.8-flash) 提供服务,**每百万 Tokens 输入仅1元、输出3元**。
## 模型表现[#](#模型表现)
### 纯文本[#](#纯文本)
| | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
| --- | --- | --- | --- | --- | --- |
|
\# Params
| 125B | 27B | 397B | 284B | \-- |
|
\# Activated params
| 6B | 27B | 17B | 13B | \-- |
|
\# N-gram embedding params
| 51B | \-- | \-- | \-- | \-- |
| Coding |
|
Agentic coding
DeepSWE 1.1
| **58.7** | 42.2 | 16.5 | 54.4 | \-- |
|
Agentic coding
SWE-bench Pro
| **62.5** | 61.7 | 55.8 | 56.0 | 53.4 |
|
Multilingual software engineering
SWE-bench Multilingual
| **81.0** | 73.8 | 75.8 | \-- | 77.5 |
|
Repo-level code generation
NL2Repo-Bench
| 48.1 | 42.3 | 41.1 | **54.2** | 47.6 |
| Agent |
|
Long-horizon office work
CoWorkBench
| **73.9** | 70.7 | 65.1 | 45.1 | 68.2 |
|
Professional job tasks
JobBench
| **55.7** | 33.4 | 27.6 | 41.3 | 36.6 |
|
Frontier agentic tasks
Agents' Last Exam
|
Pass@1
24.3
Score
**51.2**
|
Pass@1
20.4
Score
42.9
|
Pass@1
13.2
Score
33.6
|
Pass@1
**25.2**
Score
\--
| \-- |
|
Real-world tool use
Toolathlon Verified (Pass@1)
| **73.5** | 67.1 | 50.6 | 70.3 | \-- |
| General |
|
Instruction following
IFBench
| **81.3** | 79.5 | 79.1 | 79.2 | 62.5 |
|
Scientific reasoning
GPQA Diamond
| **91.7** | 89.2 | 90.3 | 90.8 | 91.3 |
|
Multidisciplinary reasoning
HLE
| 35.9 | 30.8 | 34.7 | 33.8 | **40.0** |
|
Competitive coding
LiveCodeBench v6
| **91.9** | 90.3 | 89.6 | 90.6 | 88.8 |
1\. DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。我们报告两个框架中的最高分;值得注意的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
2\. SWE-bench Pro:除 Claude-Opus-4.6 (Max) 采用官方报告分数外,其余模型均使用 Claude Code 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。已修正存在问题的任务,并在修正后的基准上重新评估所有基线模型。
3\. SWE-bench Multilingual:使用 mini-SWE-agent 评测框架评估,temp=1.0,top\_p=0.95,上下文窗口 256K。
4\. NL2Repo-Bench:使用 Claude Code 评测框架评估。为防止奖励黑客攻击,我们禁用了试图访问特定仓库的 Bash 命令,如 pip download、pip install 和 git clone。
5\. CoWorkBench:内部 Cowork 基准,用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长周期办公与生产力智能体任务。
6\. HLE:由 GPT-4o 评判。
7\. 每行最优结果加粗。
8\. 空白单元格(--):分数尚不可用或不适用。
### 多模态[#](#多模态)
| | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude-Opus-4.6 (Max) |
| --- | --- | --- | --- | --- |
| Agentic Multimodal Intelligence |
|
Multimodal tool use
ClawEval-MM
|
Pass@3
**64.4**
Average
**60.4**
|
Pass@3
57.4
Average
56.9
|
Pass@3
57.4
Average
60.1
|
Pass@3
52.5
Average
54.7
|
|
Application recreation
RecreationBench
| **49.9** | 47.1 | 30.2 | \-- |
|
Mobile use
AndroidWorld
| **84.5** | 81.9 | 81.0 | 62.0 |
|
Computer use
OSWorld 2.0
|
Binary
**19.4**
Partial
**52.3**
|
Binary
19.4
Partial
48.0
|
Binary
2.8
Partial
21.5
| \-- |
|
Visual web development
Vision2Web
| **64.0** | 62.9 | 42.1 | \-- |
| General Multimodal Intelligence |
|
Embodied intelligence
ERQA
| **72.3** | 65.5 | 69.8 | 40.8 |
|
Long video understanding
LVBench
| **76.6** | 72.4 | 76.2 | 63.0 |
|
Real-world perception
RealWorldQA
| **88.5** | 85.9 | 86.9 | 73.9 |
|
Visual math problem solving
MathVision
|
Without CI
**90.6**
With CI
**95.7**
|
Without CI
90.0
With CI
94.6
|
Without CI
90.3
With CI
88.7
|
Without CI
65.5
|
|
Scientific chart analysis
CharXiv (RQ)
|
Without CI
84.6
With CI
**90.6**
|
Without CI
83.7
With CI
90.2
|
Without CI
**85.8**
With CI
85.9
|
Without CI
66.0
|
1\. ClawEval-MM:分数以「pass@3 / 平均分」的形式给出。pass@3 为三次试验中至少通过一次的比例,平均分为三次试验得分的均值。
2\. RecreationBench:内部的长程应用复现 benchmark,用于评估覆盖五个平台的混合智能体能力——桌面(Ubuntu、macOS、Windows)、移动(Android)与网页。
3\. OSWorld 2.0:分数以「binary / partial」的形式给出。binary 为获得完整任务奖励的任务占比,partial 为在所有任务上取得的部分奖励的汇总。
4\. Vision2Web:取 frontend、webpage 与 website 三类的平均,使用 Claude Code harness,由 gpt-5.4-2026-03-05 评判。
5\. MathVision、CharXiv (RQ):分数以「不含 CI / 含 CI」的形式给出。MathVision 中少量标注有误的 ground truth 已在人工核对后修正。我们的分数使用固定 prompt 评测,例如「Please reason step by step, and put your final answer within \\boxed{}.」;对其他模型,我们取带与不带 \\boxed{} 指令两次结果中的较高者。
6\. 每行最优结果加粗。
7\. 空白单元格(--):分数尚不可用或不适用。
## 模型结构[#](#模型结构)
### Attention:GDN + QSA,高效记忆与精准检索[#](#attentiongdn--qsa高效记忆与精准检索)
传统 Full Attention 可以直接访问所有历史 token,但上下文越长,计算和 KV Cache 访存成本越高。
延续 Qwen3.5 的架构设计,Qwen3.8-Flash-Next 采用 **GDN [\[1\]](#ref1) + Attention 的 Hybrid 架构**:每四层中三层使用 Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。
对于全局 Attention,我们进一步引入 **Qwen Sparse Attention(QSA)**。Sparse Attention 通过只关注重要上下文来减少长序列下的计算,但现有方案如 DSA [\[2\]](#ref2) 通常仍需要一个 token 级 indexer 来寻找重要位置;随着上下文增长,indexer 本身的计算也会逐渐成为不可忽略的开销。
QSA 将这一过程进一步压缩:轻量 indexer 先把序列聚合成 **micro-block**,在 block 粒度上估计上下文重要性,再选出最相关的区域执行 Attention。这样不仅减少了实际 Attention 的计算量,也显著降低了“寻找重要上下文”本身的 indexing 成本。相比跨层共享索引[\[3\]](#ref3)的方法,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,也更适合 GDN 与 Attention 交替出现的 Hybrid 架构。
可以简单理解为:**GDN 负责高效“记住”,QSA 负责精准“查找”。**
在 **1M token** 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 **7.6×** 和 **4.9×** 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 **90%**),Qwen3.8-Flash-Next 在 **1M 上下文**下的 Prefill 吞吐达到 Qwen3.7-Plus 的 **8.6 倍**。
### Gated Residual:给信息更多传递路径[#](#gated-residual给信息更多传递路径)
传统 Transformer 中,各层持续在同一条 Residual Stream 上读写信息。随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。
**Gated Residual(GR)** 可以看作两种思路的结合:一方面延续 **Hyper-Connection**[\[4\]](#ref4) 将 residual stream 扩展为多分支的设计,另一方面将 **GatedNorm**[\[5\]](#ref5) 的逐元素动态门控融入 residual read。最终,原本单一的 residual stream 被扩展成 4 条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。
可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。实际分析中也观察到,其中一条 branch 会自然形成连接第一层 Attention 和大部分中后层的长距离通道。
GR 还进一步简化了 Hyper-Connection:当 read/write 足够灵活后,额外的 branch mixing 已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的 Gate 同时能够有效抑制 **activation outlier**、提升训练稳定性;Residual State 支持使用 **FP8** 存储,进一步降低访存开销。
### N-gram Embedding:低成本扩展模型容量[#](#n-gram-embedding低成本扩展模型容量)
受到 Gemma 3n 中 Per-Layer Embedding 和 DeepSeek Engram[\[6\]](#ref6) 等工作的启发,我们进一步引入 **N-gram Embedding**,从 Transformer 参数之外的维度扩展模型容量。
普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。
它的核心优势是: **可以增加大量参数,同时几乎不增加每个 token 的计算量。**
Qwen3.8-Flash-Next 额外引入了 **51B N-gram Embedding 参数**。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。
最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 **“局部模式记忆库”**。
### Optimization:架构和优化协同设计[#](#optimization架构和优化协同设计)
Qwen3.8-Flash-Next 使用 **Muon Optimizer**[\[7\]](#ref7) 训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:**正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分**。
对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,我们使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。
针对新的模型结构和 Optimizer,我们重新拟合了 Scaling Law。结果显示,模型可以稳定使用 **更大的 Learning Rate 和 Batch Size**,进一步提升收敛效率和大规模并行训练吞吐。
实验还发现,过去大模型训练中常见的 **Batch Size Warmup 已经不再必要**:从小 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 **18.8% 的 optimizer steps**。因此,在最终训练配置中,我们直接从目标 Batch Size 开始训练。
### 其他架构优化[#](#其他架构优化)
此外,其余组件沿用 Qwen3-Next 所确立、并在 Qwen3.5–Qwen3.8 系列中不断打磨的设计。
- **极致稀疏 MoE**: 在全局负载均衡 [\[8\]](#ref8) 下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。
- **Multi-Token Prediction**: MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下 speculative decoding 的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。
- **训练稳定性**: 保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制 [\[9\]](#ref9),以及 MoE router 参数初始化的归一化。这些设计使小规模消融结果更为可靠,也有助于大规模训练平稳进行。
## Base 模型表现[#](#base-模型表现)
我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型进行比较。
| | Qwen3.8-Flash-Next-Base | Qwen3.8-27B-Base | Qwen3.7-Plus-Base |
| --- | --- | --- | --- |
|
\# Params
| 125B | 27B | 397B |
|
\# Activated params
| 6B | 27B | 17B |
|
\# N-gram embedding params
| 51B | \-- | \-- |
| General tasks |
|
MMLU
| 90.36 | 87.51 | **90.43** |
|
MMLU-Redux
| 90.68 | 87.26 | **91.47** |
|
MMLU-Pro
| **73.23** | 68.60 | 70.90 |
|
SuperGPQA
| **51.36** | 44.86 | 48.42 |
|
BBH
| **90.87** | 89.56 | 89.41 |
| Math & STEM tasks |
|
GPQA
| 51.42 | 45.01 | **51.52** |
|
GSM8K
| **93.29** | 93.18 | 92.95 |
|
MATH
| 72.78 | 60.54 | **74.38** |
| Coding tasks |
|
EvalPlus
| **78.76** | 76.05 | 78.06 |
|
MultiPL-E
| 79.09 | 74.50 | **81.68** |
|
SWEBench-Pretrain
| **50.99** | 41.66 | 49.24 |
| Multilingual tasks |
|
MGSM
| **89.33** | 86.37 | 85.42 |
|
MMMLU
| **84.86** | 79.74 | 84.53 |
|
INCLUDE
| 78.40 | 74.37 | **78.90** |
1\. 每行最优结果加粗。
2\. 空白单元格(--):分数尚不可用或不适用。
在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 与 MMMLU;在 MMLU、MMLU-Redux、GPQA、MATH 与 MultiPL-E 上与 Qwen3.7-Plus-Base 接近。其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。
## 开始使用 Qwen3.8-Flash-Next[#](#开始使用-qwen38-flash-next)
Qwen3.8-Flash-Next 已作为开放模型在 [HuggingFace](https://huggingface.co/collections/Qwen/qwen38-flash-next) 和 [ModelScope](https://www.modelscope.cn/collections/Qwen/Qwen38-Flash-Next) 公开,并在 [千问AI平台](https://www.qianwenai.com/models/qwen3.8-flash) 提供官方托管 API。 该模型在能力、延迟和成本之间取得了出色的平衡,非常适用于高并发应用、工具驱动的工作流以及编程与协同办公助手。 在下文中,您可以了解如何调用千问AI平台API,并将 Qwen3.8-Flash-Next 集成到智能体系统和编程助手中。
### API 使用[#](#api-使用)
Qwen3.8-Flash-Next 可通过 API 访问:
#### 千问AI平台[#](#千问ai平台)
在[千问AI平台](https://www.qianwenai.com/)上,该模型以 [`qwen3.8-flash`](https://www.qianwenai.com/models/qwen3.8-flash) 的名称提供服务。 千问AI平台支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口。
python
`""" Environment variables: DASHSCOPE_API_KEY: Your API Key from https://platform.qianwenai.com/home DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API. - Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1 - Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1 - US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1 """from openai import OpenAIimport os api_key = os.environ.get("DASHSCOPE_API_KEY")if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" ) client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope.aliyuncs.com/compatible-mode/v1", ),) messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}] completion = client.chat.completions.create( model="qwen3.8-flash", messages=messages, extra_body={ "enable_thinking": True, # "preserve_thinking": True, }, reasoning_effort="xhigh", # supported levels are xhigh, medium, and low stream=True,) reasoning_content = ""answer_content = ""is_answering = Falseprint("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n") for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content`
### 智能体框架与编程助手[#](#智能体框架与编程助手)
Qwen3.8-Flash-Next 可无缝集成主流的智能体框架与编程助手:
#### 千问办公(即将上线) [#](#千问办公即将上线-----coming-soon-remove-at-qwenwork-release---)
[千问办公](https://qwenwork.cn/) 是阿里巴巴旗下的旗舰级 AI 生产力平台,旨在帮助个人与企业实现日常任务的自动化与业务运转效率的加速。
千问办公现已接入 **Qwen3.8-Flash-Next**,驱动其全新推出的“标准”模式。依托模型的前沿能力,这一模式将为用户带来 Agent 智能水平、推理效率、成本控制三位一体的极致体验,重新定义 AI 办公场景新“标准”。
了解更多详情请参阅[官方文档](https://qwenwork.cn/docs/product-introduction)!
#### Claude Code[#](#claude-code)
Qwen API 支持 Anthropic API 协议,可直接配合 **Claude Code** 使用:
bash
`npm install -g @anthropic-ai/claude-code export ANTHROPIC_MODEL="qwen3.8-flash"export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash"export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic export ANTHROPIC_AUTH_TOKEN=<your_api_key> claude`
#### Codex[#](#codex)
Qwen API 支持 OpenAI Responses 协议,可配合 **Codex** 使用:
在 `~/.codex/model-catalog.local.json` 中配置:
json
`{ "models": [ { "slug": "qwen3.8-flash", "display_name": "qwen3.8-flash", "description": "千问AI平台: Qwen3.8-Flash", "default_reasoning_level": "xhigh", "supported_reasoning_levels": [ { "effort": "low", "description": "Fast responses with lighter reasoning" }, { "effort": "medium", "description": "Greater reasoning depth for complex problems" }, { "effort": "xhigh", "description": "Extra high reasoning depth for complex problems" } ], "context_window": 1000000, "effective_context_window_percent": 95, "supports_parallel_tool_calls": true, "supports_image_detail_original": true, "input_modalities": ["text", "image"], "shell_type": "default", "visibility": "list", "supported_in_api": true, "priority": 1, "base_instructions": "", "support_verbosity": false, "supports_reasoning_summaries": false, "experimental_supported_tools": [], "truncation_policy": { "mode": "bytes", "limit": 10000 } } ]}`
在 `~/.codex/config.toml` 中配置:
toml
`model_catalog_json = "~/.codex/model-catalog.local.json" model_provider = "QwenCloud"model = "qwen3.8-flash" [model_providers.QwenCloud]name = "千问AI平台"base_url = "https://dashscope.aliyuncs.com/compatible-mode/v1"env_key = "OPENAI_API_KEY"wire_api = "responses"`
bash
`npm install -g @openai/codex export OPENAI_API_KEY=<your_api_key> codex`
#### Qoder CLI[#](#qoder-cli)
[Qoder](https://qoder.com/) 与 Qwen 协同演进,专为智能体编程(Agentic Coding)打造:
bash
`curl -fsSL https://qoder.com/install | bash qoder`
#### Qwen Code[#](#qwen-code)
[Qwen Code](https://qwen.ai/qwencode) 针对 Qwen 系列模型进行了深度优化:
bash
`npm install -g @qwen-code/qwen-code@latest qwen`
#### OpenClaw[#](#openclaw)
通过 [千问AI平台](https://platform.qianwenai.com/docs/developer-guides/clients-and-developer-tools/openclaw) 连接 [OpenClaw](https://openclaw.ai/):
bash
`curl -fsSL https://openclaw.ai/install.sh | bash export DASHSCOPE_API_KEY=<your_api_key> openclaw dashboard`
配置 `~/.openclaw/openclaw.json`:
json
`{ "models": { "mode": "merge", "providers": { "qwencloud": { "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1", "apiKey": "DASHSCOPE_API_KEY", "api": "openai-completions", "models": [ { "id": "qwen3.8-flash", "name": "qwen3.8-flash", "reasoning": true, "input": ["text", "image"], "contextWindow": 1000000, "maxTokens": 65536 } ] } } }, "agents": { "defaults": { "model": { "primary": "qwencloud/qwen3.8-flash" } } }}`
## 总结[#](#总结)
Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。
我们像发布 Qwen3-Next 时一样提前释出这批权重,以便该结构能够被社区独立评测;我们也将继续朝 Qwen4 的方向对其进行完善。
## 引用[#](#引用)
bibtex
`@techreport{qwen2026design, title = {On the Design of {Qwen3.8-Next} Architecture: Evaluation, Efficiency, and Training Stability}, author = {{Qwen Team}}, institution = {Alibaba Group}, month = {August}, year = {2026}} @misc{qwen3.8flashnext, title = {{Qwen3.8-Flash-Next}: A New Architecture, Towards Ultimate Cost-Efficiency}, author = {{Qwen Team}}, month = {August}, year = {2026}, url = {https://qwen.ai/blog?id=qwen3.8-flash-next}}`
# 参考文献[#](#参考文献)
\[1\] Gated Delta Networks: Improving Mamba2 with Delta Rule
\[2\] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
\[3\] IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
\[4\] Hyper-Connections
\[5\] A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training
\[6\] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
\[7\] Muon: An Optimizer for Hidden Layers in Neural Networks
\[8\] Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models
\[9\] Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
中文导读
Qwen 团队发布 Qwen3.8-Flash-Next 开源权重,作为 Qwen4 所用模型结构的先导预览:125B 总参数加 51B N-gram Embedding,每 token 激活 6B,训练开销约为 Qwen3.7-Plus 的 1/9,原生 262K 上下文、YaRN 可扩到 1M。结构升级集中在四块——Attention 用 Gated DeltaNet + Qwen Sparse Attention 混合(QSA 在 micro-block 粒度筛选重要上下文,压低长序列开销);Residual 扩成 4 分支 Gated Residual 用动态 Gate 控制信息读写;Embedding 引入可卸载到 host 内存的 N-gram Embedding(异步预取与计算重叠);优化器换 Muon 并围绕正交化精度、Muon/AdamW 参数分工重新拟合 scaling law。基准:DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、JobBench 55.7;以 Qwen3.8-Flash 名义服务时每百万 token 输入 1 元、输出 3 元。不像普通模型迭代,更像把下代大模型的结构赌注提前放出来让社区检验。
为什么值得关注
Qwen4 结构先导:GDN+QSA 混合注意力、4 分支 Gated Residual、N-gram Embedding、Muon 四赌注一次性放出,125B/A6B 训练成本 1/9
English Summary
Qwen3.8-Flash-Next open-weights release previews the Qwen4 architecture: 125B total parameters plus a 51B N-gram Embedding table with 6B active per token, training cost ~1/9 of Qwen3.7-Plus, native 262K context (YaRN to 1M). Four structural bets: Gated DeltaNet + Qwen Sparse Attention hybrid attention, a 4-branch Gated Residual with dynamic gates, an offloadable N-gram Embedding with async prefetch, and a Muon optimizer with refitted scaling laws. Benchmarks: DeepSWE 1.1 58.7, SWE-bench Pro 62.5, CoWorkBench 73.9, JobBench 55.7; served as Qwen3.8-Flash at CNY 1/M input and 3/M output tokens.
Obsidian Notes
- Body fetched via
opencli web read --url https://qwen.ai/blog?id=qwen3.8-flash-next --download-images false -f md(2026-08-27). - 原文全文存档于上方代码块;导读锚定正文事实。