架构与性能突破
阿里巴巴于8月27日发布并开源Qwen3.8-Flash-Next,这是千问系列首款采用GDN(门控DeltaNet)与QSA(量子稀疏注意力)混合注意力架构的模型。125B总参数中仅激活6B,在多项基准测试中超越Claude Opus 4.6,创下「用最少算力办最多事」的全球新纪录。
该模型支持262K原生上下文窗口,可扩展至100万tokens,原生支持图文多模态输入。在Terminal-Bench代理编程测试中得分73.0,DeepSWE 1.1达42.2,较上代提升超200%。阿里将其定位为Qwen4架构的预览版,暗示下一代旗舰模型将沿用此架构路线。
成本与效率
- 定价0.16美元/百万输入tokens、0.47美元/百万输出tokens
- 仅为Claude Opus 4.6成本的3%,企业部署成本大幅降低
- 单张消费级GPU即可运行本地推理,无需数据中心
- 开源权重已上线Hugging Face,支持Apache 2.0协议
- API已同步上线QwenCloud,开发者可即开即用
战略意义
Qwen3.8-Flash-Next的发布标志着阿里在「模型效率」赛道上取得领先。当行业还在追逐参数规模时,阿里转向用架构创新降低推理成本——这对大规模部署AI代理的企业尤为关键,因为代理系统单次任务可能需要数十甚至数百次模型调用,延迟和成本会快速叠加。
结合本周发布的千问办公国际版(QwenWork),阿里正在构建从模型到应用的完整AI生态。对企业用户而言,这意味着可以用极低门槛获得前沿AI能力。

