当Qwen开始训练Qwen

  作者 | Yoky

  微信 | yokyliu617

  Qwen 在一个月里,自己改了自己 33 次。

  不是改了 33 次回答,也不是多跑了 33 次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷,再把结果送进下一轮训练。

  9 月 22 日,阿里巴巴在云栖大会上集中公布大模型进展:基于新一代架构的 Qwen4 已经在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至5—10T 参数;视频生成、语音、图像、世界、音乐和全模态等模型,也在当天或近期推出新版本。与此同时,递归自我改进(RSI)已初步进入模型训练、推理和芯模协同等环节。

  过去,数据怎么造、实验怎么做、问题怎么找,都由研究员推动。现在,模型开始参与制造自己的下一代。

  大模型竞争正在从“谁的模型更强”,走向“谁能让模型更快地继续变强”。

  这也是今天整个 AI 行业重新讨论 RSI,递归自我改进的原因。

  只是,模型自己生成一点数据,再拿这些数据训练自己,还不是那个科幻叙事里的“自我进化”。更准确的边界是:当模型开始寻找改进目标、设计训练流程、调用研发工具,并验证这一轮改进有没有用,它才真正从训练对象变成研发参与者。

  而且,它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen 参与训练自己、优化运行自己的推理系统,再参与设计承载自己的芯片。

  云栖中真正重要的,不只是下一代 Qwen 会有多大,而是下一代 Qwen 将如何被训练出来。

  训练下一代模型的,开始包括模型自己

  Chatbot 时代,模型回答一次问题,任务就结束了。Agent 不是。它要规划、调用工具、检查结果、继续修改,一项任务可能跑几个小时,经历很多次中间决策。

  阿里巴巴 ATH 事业群 Token Foundry Qwen LLM 项目负责人刘大一恒把这个变化概括得很直接:AI 的消费,正在从“一次对话”变成“一项任务”。这句话也解释了 RSI 为什么偏偏在今天变得重要——任务越长、步骤越多,模型留下的真实反馈就越丰富,训练系统也越有可能从使用过程中获得下一轮进化的材料。

  这意味着模型每天留下的,不只是答案,还有大量失败现场:哪一步总做错,哪种工具不会用,什么任务反复卡住,用户又在哪些地方一次次推翻它。

  比普通语料更有价值的是一本由真实世界写出来的错题集。

  刘大一恒在演讲中披露,Qwen3.8-Max 相比 Qwen3.7,两个月内来自真实用户的收入增长 8.5 倍,Token 消耗量增长 12 倍。收入和 Token 当然不等于智能,但它们说明 Qwen 正在进入更多真实任务,也因此看到更多真实错误。

  过去的问题是缺数据。现在的问题开始变成:谁能更快从这些错误里找到值得修补的能力,再把它送回训练。

  对模型公司来说,真实使用因此不再只是商业化的结果,也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强,只有当反馈能够被识别、筛选并重新进入训练,它才会变成能力。

  RSI 要接上的,就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。

  如果这条链真的能够持续运转,模型发布就不再只是一次研发的终点。它进入现实世界的那一刻,反而是下一轮训练的起点。

  阿里公布的 RSI 系统,试图让 Qwen 进入这个过程。

  第一步,它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”,而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。

  第二步,它围绕缺陷自动构造训练数据。发现错题还不够,还要给自己出一批能够补上缺口的新题。

  第三步,验证这批题到底有没有用。模型生成的数据不会直接进入 Max 训练,而是先放到小模型上做多轮验证和迭代,筛掉无效数据,再送进旗舰模型。

  简单解释一下,就是 Qwen 不只开始给自己出题,还要先找一个小号的自己试做一遍,看看这些题是不是真的能把模型教会。

  一个月,Qwen3.8-Max 的分数从 40 涨到了 45

  这是整套流程里最容易被忽略,也最重要的一步。

  模型自己造数据并不稀奇。难的是它会不会把错误重复一遍,会不会专挑自己已经会的题,或者干脆学会讨好评测标准。一个循环跑得很快,不代表它跑对了方向。

  这套系统已经连续运行超过一个月,完成 33 轮有效迭代,并在相关流程中实现人类完全“零参与”。

  在外界看来这已经是比较扎实的工作,但刘大一恒仍把它形容为一次“探索”,“一项实验”。不难看出,Qwen 对此的野心更大。

  Qwen 给这套系统设定的目标,是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里,真正关键的是“持续化”:不是等下一次大版本发布再修,而是让真实世界的反馈不断回到训练中。

  它一路改到了芯片

  如果故事只到自动造数据,Qwen 做的仍然可以被理解成一次后训练流程升级。

  真正让它变成技术战略的,是这套自动化开始向下蔓延。

  Qwen 面对一款此前没有见过的平头哥新款 GPU,自主适配并优化 Qwen3.8-Flash 的 SGLang 推理框架,最终让单实例推理吞吐提升 96%。

  过去,一款新模型要在一块新芯片上跑顺,需要工程师理解硬件、修改推理框架、测试瓶颈,再一轮轮优化。

  现在,模型开始参与优化运行自己的系统。

  再往下,是芯片。

  在真实的工业级 EDA 环境里,Qwen 拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程,根据工具返回的结果反复修改。整个过程连续运行超过 60 小时,累计调用 EDA 工具超过 1 万次,最终在保证性能的同时,将芯片面积缩减 42%。

  刘大一恒在现场把这条关系说得更完整:“模型设计芯片,而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片,芯片再用来运行和训练模型,软硬件之间开始形成一条彼此加速的回路。

  这才是“递归”真正有想象力的地方。

  当然,概念不能乱装。自我训练是 RSI 的核心实践;推理框架适配和 EDA 设计,更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作 RSI,只会让这个词迅速变成又一个什么都能解释的技术黑话。

  但三件事放在一起,阿里的路线已经非常清楚:

  向上,让模型从真实世界获得反馈,参与训练自己;向下,让模型优化运行自己的系统,甚至参与设计承载自己的芯片。

  它不是在给 Qwen 增加三个功能。

  它是在把算法、系统和硬件,接进同一个自我改进的回路。

  模型公司的下一款产品,是生产模型的能力

  过去,我们习惯把一家模型公司的产品理解成模型本身。

  GPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本,能力更强,价格更低,上下文更长。

  但如果 RSI 这条路成立,模型公司真正需要生产的,会多出一样东西:一套持续生产下一代模型的系统。

  它需要真实生产场景提供问题,需要模型识别值得修补的缺陷,需要数据和实验系统寻找答案,也需要可靠的评测判断答案有没有用。

  最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。

  还要看谁能更快获得真实反馈,谁能更快把失败变成训练,谁能用更低的成本验证一次改进,再把结果送回下一轮。

  以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。

  所以今天 Qwen 的进步,更像是一个信号:大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。

  当 Qwen 开始训练 Qwen,榜单已经不是重要的数字。

  模型公司的终极产品,可能不再是某一代模型,而是一套能够持续生产下一代模型的系统。