阿里正式发布并开源了其最新大模型Qwen3.8-Flash,标志着全球模型效率迈入全新阶段。这款基于多模态混合专家(MoE)架构的模型,通过仅激活60亿参数(总参数达千亿级),实现了超越Claude Opus4.6的性能表现,同时在训练和推理成本上实现革命性突破。据官方披露,Qwen3.8-Flash的训练成本较前代Qwen3.7-Plus骤降90%,推理价格低至每百万Tokens输入1元、输出3元,仅为DeepSeek-V4-Flash忙时价格的1/3,成为当前全球性价比最高的智能模型之一。
在技术架构层面,Qwen3.8-Flash创新性地引入了QSA(Qwen Sparse Attention)稀疏注意力机制,与GDN(Gated Dynamic Network)高效融合,形成混合注意力架构。这一设计使模型在处理1M Tokens长上下文时,计算速度提升8倍以上,同时保持高精度。模型通过自研的Gated Residual方法,将传统Transformer的信息传递通道从1条扩展至4条,实现动态信息读写,显著提升了训练稳定性和参数扩展效率。为进一步优化性能,团队还引入了51B规模的N-gram Embedding参数,作为模型的“外挂记忆指南”,在不影响推理效率的前提下,大幅提升了参数扩展能力。
基准测试数据显示,Qwen3.8-Flash在多项核心能力上表现卓越。未经过微调的基座模型,在通用知识(SuperGPQA)、数学推理(GSM8K)和编程预训练(SWEBench-Pretrain)等任务中,已超越参数规模3倍于己的Qwen3.7-Plus。经过后训练优化后,模型在智能体编程评测SWE-bench Pro中领先Opus4.6达9.1分,在长程专业任务CoWorkBench和真实工具调用Toolathlon Verified中均超越DeepSeek-V4-Flash,并在专业工作评测JobBench中超出Opus4.6近20分。多模态能力方面,该模型在模拟手机操作的AndroidWorld评测中高出Opus4.6 22.5分,在视觉数学推理MathVision任务中超出25.1分,具身智能ERQA任务领先31.5分,展现出全面领先的多模态处理能力。
成本优势是Qwen3.8-Flash的另一大亮点。尽管性能与Qwen3.7-Plus接近,但其训练资源消耗仅为前代的1/9,推理成本更是低至Claude Opus4.6的3%。这一突破得益于模型架构与训练方案的协同优化,包括注意力机制革新、信息传递通道扩展和参数效率提升等技术。目前,Qwen3.8-Flash已优先集成至“千问办公”标准模式,可完成95%的日常办公任务,同时为开发者提供API服务,支持智能体编程、专业办公和长程任务等场景。
作为Qwen4的雏形,Qwen3.8-Flash-Next的模型权重已在Hugging Face和魔搭社区全面开源,接受全球开发者检验。截至目前,Qwen3.8系列已发布包括2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash在内的三大尺寸模型,全球下载量突破30亿次,衍生模型超过30万个。这一全尺寸、全模态的开源策略,正在全球范围内推动中国大模型技术的广泛应用与创新发展。










