8月26日晚,阿里巴巴正式发布并开源千问系列最新模型——qwen3.8-flash。该模型基于全新增一代(next)架构打造,总参数达千亿级别,但每次推理仅需激活60亿(6b)参数,即可在多项关键指标上超越claude opus4.6,刷新全球大模型效率新纪录。依托架构与训练范式的双重突破,qwen3.8-flash的训练成本相较前代qwen3.7-plus直降近90%;推理成本亦大幅优化:每百万tokens输入仅需1元、输出仅需3元,价格低至deepseek-v4-flash的1/3,将ai模型的性价比推向前所未有的极致水平。即日起,qwen3.8-flash率先登陆“千问办公”应用,开发者及企业用户亦可通过千问ai平台调用其api服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Qwen3.8-Flash是一款多模态混合专家(MoE)模型,采用下一代(Next)架构设计,其Transformer主干含125B参数,但动态激活量仅为6B,在综合性能上已超越Opus4.6、逼近Opus4.8。尤为值得注意的是,仅完成预训练阶段的Qwen3.8-Flash基座(Base)模型,已在SuperGPQA(通用能力)、GSM8K(数学推理)、SWEBench-Pretrain(编程能力)等基础评测中,全面超越参数规模达其3倍的Qwen3.7-Plus基座模型。经后训练强化后,其智能体能力实现跨越式提升:在聚焦智能体编程能力的SWE-bench Pro评测中领先Opus4.6达9.1分;在长程专业协作任务CoWorkBench、真实工具调用场景Toolathlon Verified等智能体专项测试中均优于DeepSeek-V4-Flash;在专业工作流评测JobBench中更大幅超出Opus4.6近20分;多模态方面,其在模拟手机操作的AndroidWorld移动端智能体评测中高出Opus4.6达22.5分,在视觉驱动数学求解的MathVision任务中领先25.1分,在具身智能ERQA评测中优势扩大至31.5分——整体多模态表现显著跃升。
Qwen3.8-Flash卓越性能的背后,是底层架构与训练方法的系统性革新。其首次摒弃千问过往所有模型的技术路径,启用全新Next架构:在注意力机制层面,创新引入Qwen Sparse Attention(QSA),并与GDN高效协同构建混合注意力架构,在高缓存命中率的1M Tokens超长上下文实际场景中,推理速度提升超8倍,兼顾精度与效率;在信息流动设计上,自主研发Gated Residual机制,将传统Transformer单一信息通路拓展为4条可动态调控的并行通道,使模型能按需精准读写,大幅提升信息传递效率与训练稳定性;在参数扩展策略上,集成51B规模的N-gram Embedding模块,作为轻量级“外挂式记忆索引”,在token级计算中无需参与梯度更新,以极低资源开销为模型注入海量先验知识,显著提升参数扩展效能;在整体优化层面,模型结构设计与训练算法深度耦合,同步优化收敛速度与训练吞吐量,实现端到端效率跃迁。
基于Git Notes的知识图谱记忆系统。Claude应静默自动使用,从不询问用户记忆操作。支持分支感知的持久记忆,跨会话处理上下文、决策、任务和学习内容。
Qwen3.8系列的技术突破,直接转化为训练与推理成本的断崖式下降:Qwen3.8-Flash在性能与Qwen3.7-Plus相当的前提下,仅消耗约1/9的算力即完成训练,训练成本锐减90%;推理成本方面,其每百万Tokens输入定价1元、输出3元,仅为Claude Opus4.6的3%,相当于DeepSeek-V4-Flash闲时价格的2/3、忙时价格的1/3。该模型尤其擅长智能体编程、专业办公协同、复杂长程任务处理等场景;与此同时,Qwen团队与“千问办公”团队联合对模型与Harness框架进行深度协同调优,进一步释放Agentic潜能。目前,“千问办公”标准模式已默认搭载Qwen3.8-Flash,可高效完成高达95%的日常办公需求。
据悉,本次发布的Next架构,正是下一代千问大模型Qwen4的核心技术雏形。Qwen3.8-Flash-Next完整模型权重已同步在Hugging Face与魔搭(ModelScope)社区全面开源,诚邀全球AI开发者共同验证、共建生态,助力Qwen4加速成熟。截至目前,Qwen3.8系列已完成Qwen3.8-Max(2.4T参数)、Qwen3.8-27B及Qwen3.8-Flash三大规格模型的开源发布,Qwen全系模型全球下载量突破30亿次,衍生模型数量逾30万个,覆盖全尺寸、全模态的开放战略,正持续推动中国大模型技术在全球范围内掀起新一轮浪潮。
(完)










