品玩

科技创新者的每日必读

打开APP
关闭

当Qwen开始训练Qwen

5—10T参数之外,阿里更想让Qwen学会自我进化。

Yoky

发布于 7小时前

Qwen在一个月里,自己改了自己33次。

不是改了33次回答,也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷,再把结果送进下一轮训练。

9月22日,阿里巴巴在云栖大会上集中公布大模型进展:基于新一代架构的Qwen4已经在训练中,未来Qwen4.5、Qwen5等版本将扩展至5—10T参数;视频生成、语音、图像、世界、音乐和全模态等模型,也在当天或近期推出新版本。与此同时,递归自我改进(RSI)已初步进入模型训练、推理和芯模协同等环节。

过去,数据怎么造、实验怎么做、问题怎么找,都由研究员推动。现在,模型开始参与制造自己的下一代。

大模型竞争正在从“谁的模型更强”,走向“谁能让模型更快地继续变强”。

这也是今天整个AI行业重新讨论RSI,递归自我改进的原因。

只是,模型自己生成一点数据,再拿这些数据训练自己,还不是那个科幻叙事里的“自我进化”。更准确的边界是:当模型开始寻找改进目标、设计训练流程、调用研发工具,并验证这一轮改进有没有用,它才真正从训练对象变成研发参与者。

而且,它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统,再参与设计承载自己的芯片。

云栖中真正重要的,不只是下一代Qwen会有多大,而是下一代Qwen将如何被训练出来。

训练下一代模型的,开始包括模型自己

Chatbot时代,模型回答一次问题,任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改,一项任务可能跑几个小时,经历很多次中间决策。

阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接:AI的消费,正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多,模型留下的真实反馈就越丰富,训练系统也越有可能从使用过程中获得下一轮进化的材料。

这意味着模型每天留下的,不只是答案,还有大量失败现场:哪一步总做错,哪种工具不会用,什么任务反复卡住,用户又在哪些地方一次次推翻它。

比普通语料更有价值的是一本由真实世界写出来的错题集。

刘大一恒在演讲中披露,Qwen3.8-Max相比Qwen3.7,两个月内来自真实用户的收入增长8.5倍,Token消耗量增长12倍。收入和Token当然不等于智能,但它们说明Qwen正在进入更多真实任务,也因此看到更多真实错误。

过去的问题是缺数据。现在的问题开始变成:谁能更快从这些错误里找到值得修补的能力,再把它送回训练。

对模型公司来说,真实使用因此不再只是商业化的结果,也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强,只有当反馈能够被识别、筛选并重新进入训练,它才会变成能力。

RSI要接上的,就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。

如果这条链真的能够持续运转,模型发布就不再只是一次研发的终点。它进入现实世界的那一刻,反而是下一轮训练的起点。

阿里公布的RSI系统,试图让Qwen进入这个过程。

第一步,它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”,而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。

第二步,它围绕缺陷自动构造训练数据。发现错题还不够,还要给自己出一批能够补上缺口的新题。

第三步,验证这批题到底有没有用。模型生成的数据不会直接进入Max训练,而是先放到小模型上做多轮验证和迭代,筛掉无效数据,再送进旗舰模型。

简单解释一下,就是Qwen不只开始给自己出题,还要先找一个小号的自己试做一遍,看看这些题是不是真的能把模型教会。

一个月,Qwen3.8-Max的分数从40涨到了45 
一个月,Qwen3.8-Max的分数从40涨到了45 

这是整套流程里最容易被忽略,也最重要的一步。

模型自己造数据并不稀奇。难的是它会不会把错误重复一遍,会不会专挑自己已经会的题,或者干脆学会讨好评测标准。一个循环跑得很快,不代表它跑对了方向。

这套系统已经连续运行超过一个月,完成33轮有效迭代,并在相关流程中实现人类完全“零参与”。

在外界看来这已经是比较扎实的工作,但刘大一恒仍把它形容为一次“探索”,“一项实验”。不难看出,Qwen对此的野心更大。 

Qwen给这套系统设定的目标,是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里,真正关键的是“持续化”:不是等下一次大版本发布再修,而是让真实世界的反馈不断回到训练中。

它一路改到了芯片

如果故事只到自动造数据,Qwen做的仍然可以被理解成一次后训练流程升级。

真正让它变成技术战略的,是这套自动化开始向下蔓延。

Qwen面对一款此前没有见过的平头哥新款GPU,自主适配并优化Qwen3.8-Flash的SGLang推理框架,最终让单实例推理吞吐提升96%。

过去,一款新模型要在一块新芯片上跑顺,需要工程师理解硬件、修改推理框架、测试瓶颈,再一轮轮优化。

现在,模型开始参与优化运行自己的系统。

再往下,是芯片。

在真实的工业级EDA环境里,Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程,根据工具返回的结果反复修改。整个过程连续运行超过60小时,累计调用EDA工具超过1万次,最终在保证性能的同时,将芯片面积缩减42%。

刘大一恒在现场把这条关系说得更完整:“模型设计芯片,而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片,芯片再用来运行和训练模型,软硬件之间开始形成一条彼此加速的回路。

这才是“递归”真正有想象力的地方。

当然,概念不能乱装。自我训练是RSI的核心实践;推理框架适配和EDA设计,更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI,只会让这个词迅速变成又一个什么都能解释的技术黑话。

但三件事放在一起,阿里的路线已经非常清楚:

向上,让模型从真实世界获得反馈,参与训练自己;向下,让模型优化运行自己的系统,甚至参与设计承载自己的芯片。

它不是在给Qwen增加三个功能。

它是在把算法、系统和硬件,接进同一个自我改进的回路。

模型公司的下一款产品,是生产模型的能力

过去,我们习惯把一家模型公司的产品理解成模型本身。

GPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本,能力更强,价格更低,上下文更长。

但如果RSI这条路成立,模型公司真正需要生产的,会多出一样东西:一套持续生产下一代模型的系统。

它需要真实生产场景提供问题,需要模型识别值得修补的缺陷,需要数据和实验系统寻找答案,也需要可靠的评测判断答案有没有用。

最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。

还要看谁能更快获得真实反馈,谁能更快把失败变成训练,谁能用更低的成本验证一次改进,再把结果送回下一轮。

以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。

所以今天Qwen的进步,更像是一个信号:大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。

当Qwen开始训练Qwen,榜单已经不是重要的数字。

模型公司的终极产品,可能不再是某一代模型,而是一套能够持续生产下一代模型的系统。

Yoky

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测