通义千问发布 Qwen3.8-2.4T-A95B,是后训练后的 MoE 权重,兼容 vLLMSGLangTokenSpeed 等服务器官方业务版 Qwen3.8-Max 默认开启 1M 上下文视觉与非思考模式,并内置官方工具
Qwen3.8-2.4T-A95B
通义千问发布 Qwen3.8-2.4T-A95B,是后训练后的 MoE 权重,兼容 vLLMSGLangTokenSpeed 等服务器官方业务版 Qwen3.8-Max 默认开启 1M 上下文视觉与非思考模式,并内置官方工具
继续阅读
Qwen 团队发布 Qwen3.8-Flash-Next 开源权重,作为 Qwen4 所用模型结构的先导预览:125B 总参数加 51B N-gram Embedding,每 token 激活 6B,训练开销约为 Qwen3.7-Plus 的 1/9,原生 262K 上下文YaRN 可扩到 1M结构升级集中在四块Attention 用 Gated DeltaNet + Qwen Sparse Attention 混合(QSA 在 micro-block 粒度筛选重要上下文,压低长序列开销);Residual 扩成 4 分支 Gated Residual 用动态 Gate 控制信息读写;Embedding 引入可卸载到 host 内存的 N-gram Embedding(异步预取与计算重叠)...
扎实的本地推理 lab notes作者在 RTX 3090 上测试 Qwen 3.6 35B MoE 的 Unsloth UD-IQ4_NL_XL quant:Vulkan 全 GPU 约 120 tok/sprompt 约 2800 tok/s,上下文只能到约 50k;自编 CUDA 后全 GPU 约 140 tok/sprompt 超 3300 tok/s,上下文约 89.6k为了跑满 262k 上下文,需要把部分 FFN offload 到 CPU,速度会明显下降,但能换回 VRAM 空间文章把 4-bit quantLlama.cpp Vulkan/CUDA上下文长度FFN offloadMoE 内存占用讲成可复查的工程取舍
Qwen 首个以 agentic 能力为核心的原生全模态模型 Qwen3.8-Omni-Flash 上线,集本地理解/推理/工具调用于一身;以音频为中心的场景包括视频剪辑音视频剪辑音视频转图文摘要与对话重点指标:WildClawBench-MM 上提升 36.5 分AgenticVBench 上提升 22.3 分UniClawBench 69.6;OmniGAIA 未使用 harness1M token 上下文环境里 OmniVideoBench 以比静态理解少 51.8% 的 token 获得更高准确率...
@xiaogaifun(高师傅)8月31日精读 Qwen3.8-Flash Tech Report:125B 主干 + 每 token 激活 6B + 51B n-gram Embedding,激活参数与训练 token 都约为 Qwen3.7-Plus 的 1/3,整体训练 FLOPs 1/9,14 项 Benchmark 8 项超上代剩 6 项最大差 2.6 分四次手术分别是 GDN(替换 Attention 降长上下文计算成本)QSA(深层信息冲淡缓解)Gated Residual(4 条并行 Residual Stream 让模型自动分工出长程通道)n-gram Embedding(Backbone 外 51B 参数...