返回行业动态
研究前沿

阿里披露 Qwen3.8-Max 零人工干预完成 33 轮自我迭代,Qwen4 已进入训练

在 2026 云栖大会上,阿里巴巴披露 Qwen3.8-Max 在人类零参与的情况下自主搭建训练流程、构造数据、设计实验并定位缺陷,持续迭代逾一个月、完成 33 轮有效迭代,Artificial Analysis 得分由 40 升至 45。该能力已外溢至推理优化与芯模协同:在未见过的平头哥新 GPU 上自主适配,单实例吞吐提升 96%;凭总线模块规范完成芯片物理实现,面积减少 42%。Qwen4 已进入训练。

来源:阿里巴巴云栖大会官方发布(Alizila):全栈 AI 路线图与 Qwen 进展原标题:Alibaba Cloud's 2026 Apsara Conference: Full-Stack AI Roadmap Along with Global Market Expansion Plan查看原文
深夜数据中心内的推理计算集群,前景悬浮着由同心光环与发光节点构成的抽象递归迭代结构,青色与紫色光线交错,机柜在景深中虚化,顶部居中有一行中文字标题

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

在 2026 云栖大会(9 月 22 日至 24 日,杭州)上,阿里巴巴披露了通义千问在递归自我改进方向上的进展:Qwen3.8-Max 在人类零参与的情况下,自主搭建训练流程、构造训练数据、设计实验并定位缺陷,持续迭代超过一个月,完成 33 轮有效迭代。叠加后训练等技术后,该版本在 Artificial Analysis 上的得分由 40 提升至 45。阿里巴巴同时确认,基于新一代架构的 Qwen4 已进入训练阶段,后续 Qwen4.5 与 Qwen5 系列计划把参数规模扩展至 5 至 10 万亿。

关键数据

  • 迭代规模:连续一个多月全自动运行,完成 33 轮有效迭代,Artificial Analysis 得分由 40 提升至 45;
  • 能力外溢:在尚未见过的一款平头哥新 GPU 上自主适配并优化下一代架构 Qwen3.8-Flash 的推理框架,单实例推理吞吐提升 96%;
  • 芯片协同:仅凭一份真实总线模块规范,自主完成前端、验证、后端全链路迭代,运行超过 60 小时、调用 EDA 工具逾万次,物理实现面积减少 42%;
  • 训练成本:Qwen3.8-Flash 提前开源下一代架构,通过注意力机制与模型内信息传递机制创新,激活参数约为 Qwen3.7-Plus 的三分之一,训练开销降至约九分之一;
  • 路线图:Qwen4 在训,Qwen4.5 与 Qwen5 规划扩展至 5 至 10 万亿参数。

这项披露的真正分量不在于分数提升的幅度,而在于零人类参与这一条件。模型自己设计实验、自己构造数据、自己判断缺陷,意味着改进循环的瓶颈从人力转向算力与评判标准。阿里巴巴给出的三个例子恰好覆盖三种不同的闭环:算法层面体现为自我改进训练流程,系统层面体现为为陌生芯片适配推理框架,硬件设计层面体现为用 EDA 工具完成芯片模块的物理实现。第三种尤其值得注意,它把模型的能力扩展到了自身训练堆栈之外的工程环节。

从工程组织的角度看,值得关注的还有评测方法的变化。当模型自己产生实验、自己判定结果时,判断标准就成了新的瓶颈:如果实验设计和结果判定都由同一个模型完成,那么自我改进的上限就会受制于它自身的偏好与盲区。这也是行业讨论递归自我改进时最常被追问的一点——自动化的效率提升是确定的,但改进方向是否正确,仍需要外部基准与人工抽查来兜底。

不确定之处

三点需要保留判断。第一,45 分与得分提升 12.5% 均为厂商自述数据,公告中未提供独立验证,Qwen3.8-Flash 吞吐提升 96%、芯片面积减少 42% 同样属于公司自报结果。第二,零人类参与描述的是迭代过程本身,训练目标、评测集与验收标准仍由人类设定,因此它更接近自动化的实验循环,而非完全自主的研究。第三,参数规模路线图属于前瞻规划而非已发布产品:Qwen4 没有公布参数量、许可与发布时间,5 至 10 万亿参数目前只是目标区间。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。