发生了什么
在 2026 云栖大会(9 月 22 日至 24 日,杭州)上,阿里巴巴披露了通义千问在递归自我改进方向上的进展:Qwen3.8-Max 在人类零参与的情况下,自主搭建训练流程、构造训练数据、设计实验并定位缺陷,持续迭代超过一个月,完成 33 轮有效迭代。叠加后训练等技术后,该版本在 Artificial Analysis 上的得分由 40 提升至 45。阿里巴巴同时确认,基于新一代架构的 Qwen4 已进入训练阶段,后续 Qwen4.5 与 Qwen5 系列计划把参数规模扩展至 5 至 10 万亿。
关键数据
- 迭代规模:连续一个多月全自动运行,完成 33 轮有效迭代,Artificial Analysis 得分由 40 提升至 45;
- 能力外溢:在尚未见过的一款平头哥新 GPU 上自主适配并优化下一代架构 Qwen3.8-Flash 的推理框架,单实例推理吞吐提升 96%;
- 芯片协同:仅凭一份真实总线模块规范,自主完成前端、验证、后端全链路迭代,运行超过 60 小时、调用 EDA 工具逾万次,物理实现面积减少 42%;
- 训练成本:Qwen3.8-Flash 提前开源下一代架构,通过注意力机制与模型内信息传递机制创新,激活参数约为 Qwen3.7-Plus 的三分之一,训练开销降至约九分之一;
- 路线图:Qwen4 在训,Qwen4.5 与 Qwen5 规划扩展至 5 至 10 万亿参数。
这项披露的真正分量不在于分数提升的幅度,而在于零人类参与这一条件。模型自己设计实验、自己构造数据、自己判断缺陷,意味着改进循环的瓶颈从人力转向算力与评判标准。阿里巴巴给出的三个例子恰好覆盖三种不同的闭环:算法层面体现为自我改进训练流程,系统层面体现为为陌生芯片适配推理框架,硬件设计层面体现为用 EDA 工具完成芯片模块的物理实现。第三种尤其值得注意,它把模型的能力扩展到了自身训练堆栈之外的工程环节。
从工程组织的角度看,值得关注的还有评测方法的变化。当模型自己产生实验、自己判定结果时,判断标准就成了新的瓶颈:如果实验设计和结果判定都由同一个模型完成,那么自我改进的上限就会受制于它自身的偏好与盲区。这也是行业讨论递归自我改进时最常被追问的一点——自动化的效率提升是确定的,但改进方向是否正确,仍需要外部基准与人工抽查来兜底。
不确定之处
三点需要保留判断。第一,45 分与得分提升 12.5% 均为厂商自述数据,公告中未提供独立验证,Qwen3.8-Flash 吞吐提升 96%、芯片面积减少 42% 同样属于公司自报结果。第二,零人类参与描述的是迭代过程本身,训练目标、评测集与验收标准仍由人类设定,因此它更接近自动化的实验循环,而非完全自主的研究。第三,参数规模路线图属于前瞻规划而非已发布产品:Qwen4 没有公布参数量、许可与发布时间,5 至 10 万亿参数目前只是目标区间。

