近日,阿里千问团队正式推出多模态稀疏专家混合(moe)模型qwen3.8-flash,并同步开源其底层新架构qwen3.8-flash-next——该架构亦为即将发布的qwen4系列模型的技术基石。
Qwen3.8-Flash整体参数规模达1250亿(125B),额外集成510亿(51B)N-gram Embedding模块,但单token仅激活约60亿(6B)参数。模型原生支持长达26万token的上下文长度,结合YaRN插值技术后,可无缝扩展至100万token。在工程效率与部署成本方面表现突出:训练资源消耗仅为上一代Qwen3.7-Plus的约1/9;API服务定价为每百万Tokens输入1元、输出3元;目前已全面接入千问AI平台,并同步上线全新“千问办公”智能协作功能。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在架构设计上,团队实现了四大关键演进:
从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力
- 注意力机制升级:引入GDN(Global Dynamic Normalization)与QSA(Query-Sensitive Attention)协同架构,前者高效压缩长程历史状态,后者精准聚焦当前任务相关上下文,在百万token场景下,Prefill与Decode阶段分别实现最高7.6倍与4.9倍加速;
- 残差结构革新:采用Gated Residual设计,将传统单路残差流拓展为4条并行通路,通过动态门控机制自适应调控跨层信息流动,显著增强训练收敛性与稳定性;
- 嵌入层增强:N-gram Embedding模块基于局部上下文查表机制扩充表征容量,新增的51B参数几乎不带来额外计算开销;
- 优化策略创新:训练阶段融合Muon与AdamW双优化器,重新校准模型缩放规律(Scaling Law),取消传统批次预热(batch warmup)流程,进一步提升训练效率。
多项权威基准测试表明:仅依赖6B激活参数的基础模型,在14项主流评测中斩获8项SOTA成绩;经针对性微调后的版本,在代码生成、智能体决策及多模态理解等复杂任务中持续领跑——SWE-bench Pro得分达62.5分;在CoWorkBench、Toolathlon等前沿智能体评测榜单中大幅超越同级别竞品。
目前,Qwen3.8-Flash-Next完整权重已同步发布于Hugging Face与ModelScope平台,配套技术白皮书亦已公开。千问团队提前开放下一代架构,旨在联合全球开发者共同验证前沿设计,加速技术迭代进程,为Qwen4系列模型的稳健演进夯实基础。










