8月26日晚,阿里正式推出并开源其最新的模型Qwen3.8-Flash。该模型采用了前沿的下一代架构,具备的总参数达到了千亿级别,但在实际应用中仅需激活60亿个参数便可实现超越Claude Opus4.6的顶尖性能,从而为模型效率设立了全球新标杆。根据相关信息,得益于架构与训练方法的全面创新,Qwen3.8-Flash的训练成本较前一版本Qwen3.7-Plus下降了近90%;推理成本也大幅缩减,输入每百万Tokens仅需1元,输出费用为3元,价格仅是DeepSeek-V4-Flash的三分之一。Qwen3.8-Flash首次发布即在“千问办公”平台上线,开发者和企业也可以通过相关AI平台获取该模型的API服务。
Qwen3.8-Flash是一款多模态混合专家(MoE)模型,采用了新一代(Next)架构。在其125B的Transformer参数中,仅激活6B便已能在表现上超越Opus4.6,并接近Opus4.8。经过预训练的Qwen3.8-Flash基座模型在多个基础能力测试中,如通用(SuperGPQA)、数学推理(GSM8K)及编程(SWEBench-Pretrain),均展现出超过其体量三倍的Qwen3.7-Plus基座模型的性能。经过进一步训练,Qwen3.8-Flash的性能获得质的飞跃:在考核智能体编程能力的SWE-bench Pro评测中,其成绩领先Opus4.6多达9.1分;在长程专业任务CoWorkBench、真实工具调用Toolathlon Verified等智能体任务中也均超越了DeepSeek-V4-Flash,并在JobBench智能体评测中超出Opus4.6近20分。在多模态能力方面,模拟手机操作的移动智能体AndroidWorld评测中,Qwen3.8-Flash比Opus4.6高出22.5分,而在利用视觉推理解决数学问题的MathVision测试中,其成绩超出25.1分,具身智能ERQA任务中也领先31.5分,整体多模态能力显著提升。
Qwen3.8-Flash的卓越表现源于其创新的模型架构和训练方案,这也直接导致了训练和推理成本的显著降低。虽然其性能接近于前一代Qwen3.7-Plus,但训练所需资源仅为其九分之一,训练成本下降达到90%;在推理方面,Qwen3.8-Flash每百万Tokens的输入成本低至1元,输出成本为3元,分别是一代产品Claude Opus4.6的3%以及DeepSeek-V4-Flash闲时费用的2/3和忙时的1/3。此外,Next新架构将成为全新一代千问大模型Qwen4的基础,Qwen3.8-Flash-Next模型的权重已经在Hugging Face与魔搭社区全面开源,以便全球AI开源社区能够进行验证,共同推动Qwen4的开发。截至目前,Qwen3.8系列已经开源了包括2.4T参数的Qwen3.8-Max、Qwen3.8-27B以及Qwen3.8-Flash在内的三种不同规模的模型。