文 | 字母 AI
Hy4 preview 才刚发布 3 天,腾讯 WorkBuddy 就针对 Hy4 preview 推理集群进行了紧急扩容,官方宣称,将持续动态调配资源。
然而 WorkBuddy 表示,受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况。因此官方推荐用户在 Hy4 preview 排队期间切换至 Hy3,并且同时还把 WorkBuddy 的 Hy3 限免延长至 2026 年 9 月 30 日 23:59。
Hy4 preview 总参数 770B,激活参数 49B,上下文 1M,Terminal Bench 2.1 得分冲到 85.4,开源第一、全球第三,SWE-bench Multilingual 得分 82.9,同样是开源第一。
8 月 28 日发布当天,API 排队用户就超过了 5000 人。
为什么 Hy4 preview 这么受欢迎?
一方面是 WorkBuddy 本身的用户量增长,6 月时就有数据显示,WorkBuddy 的 MAU 突破了 2000 万。
但更重要的是,这是腾讯基础模型部成立之后的第一个新模型,也是一款从头到尾贯彻姚顺雨理念的产品。
在 Hy4 preview 的技术报告中,腾讯大大方方地标明 Hy4 preview 使用了哪家的技术,并说明了对其进行修改的具体方式。
有意思的地方是,即使用了别人的技术,Hy4 preview 却形成了独特的风格。
三种“自进化”
一切要从自进化开始说起。
Hy4 preview 的 README 里,这样写道,灵感来自于 DeepSeek 和 GLM(inspired by DeepSeek and GLM)。
Hy4 Preview 注意力模块用的是 DeepSeek 的 Gated 以及 MTP 层做投机解码;配的是智谱的 IndexCache 做跨层稀疏索引复用;残差通路用了字节的 iHC(identity Hyper-Connections)。
但如果只看到这些,就错过了 Hy4 真正反常的地方。
混元团队在论文中表示,Hy4 preview 第一次全程参与了制造自己的过程,在训练方法、数据策略、评估体系和底层算子这四个环节,全部引入了模型的自进化机制。
但有意思的是,明明说灵感来自于智谱和 DeepSeek,可在自进化的方向上,Hy4 preview 又和 DeepSeek、GLM 完全不同。
智谱的自进化,发生在训练阶段,目标是让模型本身变聪明。
智谱给 GLM-5.3 搭了一条“自己出真题自己做”的流水线,让一个“AI 研究员”去真实工程师的工作场景里观察,把实际业务提炼成训练数据。再让一个“AI 判卷员”先闭卷做一遍,只有确认真的有解,才会把题目放进题库。
配合 SAO 和 slime 框架,GLM-5.3 在不更换基座的前提下,比 GLM-5.2 的长程编码训练速度提升了约 2.3 倍。
这套逻辑的本质是生物学意义上的进化,基因在迭代中变得更适应环境。
DeepSeek 的自进化,发生在运行阶段,目标是通过 DSH 让模型的“身体”可以无限重组。
DSH 的核心设计原则是“一切皆插件”,Agent 发现缺什么,就现场补什么,用完再无痕拆下来。官方管这叫 self-modification。
这是工具学意义上的进化,人没变,只是学会使用各种工具,让自己能干更多的事情。
腾讯 Hy4 preview 的自进化,既不在训练阶段,也不在运行阶段,它发生在研发流程本身。
Hy4 既不是智谱那样“让自己变聪明”,也不是 DeepSeek 那样“让自己的工具变多”,它是在定义自己,“我作为 Hy4 Preview,我应该是什么样?”比如“我”的训练方法应该怎么设计、数据策略应该怎么定、评估体系应该怎么建。
先定义好自己是什么,再朝着自己想要的方向去发展。
要想全链路自进化,第一件事就是要统一组织。
Hy4 preview 自进化的 4 个环节,其实就是大模型研发的完整链条。从最基本的训练、数据、评估,到最后怎么把训好的模型高效地跑起来。
这也就是说,姚顺雨能完整地统筹整个大模型的研发了。
过去这些事物是分开的,腾讯将其分成了两个平行部门,分别为大语言模型部和多模态模型部。各自拥有独立的训练数据、技术框架、研发流程和评测标准。
而且当时的腾讯还有 AI Infra、AI Data 和数据计算平台部分别掌管不同的数据。
7 月合并成基础模型部,姚顺雨一个人统管之后,这条链路才第一次被打通。Hy4 preview 能参与全链路,本身就代表着组织现在是一条心了。
姚顺雨对工程化非常重视。
三家里面,只有腾讯混元把“底层算子优化”和“推理吞吐量提升”这些关乎模型实际运行的东西纳入自进化的列表里。
姚顺雨入职后第一件事就是重建基础设施,他在 6 月与汤道生对谈中提到,“我们把 Infrastructure 重建了,无论是预训练还是强化学习”。
哪怕是 OpenAI 和 Anthropic,算力都是最稀缺的资源,汤道生曾公开承认“算力严重不足拖慢了模型训练与产品发展”。姚顺雨必须把每一分算力都榨干。
一切的核心在于姚顺雨的方法论——Co-design。边训边用,让产品反馈倒逼模型迭代。
Hy3 时期,Co-design 主要发生在模型和产品之间,比如将 CodeBuddy、WorkBuddy 的用户反馈,回流到模型训练当中。
到了 Hy4 preview 这里,Co-design 的范围扩大了,整个模型研发流程都遵从这套方法论。
也就是说,姚顺雨统一了混元模型,并且让模型与腾讯的所有条线接轨,将他对 AI 的理解,完全倾注其中。
模型是姚顺雨方法论的物质化证明
之所以要将姚顺雨的理念贯彻进模型当中,是因为他本身就是语言 Agent 研究的开创者之一。
ReAct 是姚顺雨的代表作,论文于 2022 年 10 月挂出,发表在 ICLR 2023 上,被评为 notable top 5%,引用量超过 10000 次。
而 ReAct 也是如今所有 Agent 的工作原理。 它的核心是把“推理”和“行动”从两个分离的步骤放在同一个 prompt 模板里的交替循环。想一步、做一步、看结果、再想。
不管是 Claude Code 还是 Codex,底层“思考 - 调用工具 - 观察结果 - 继续思考”循环,本质上都是 ReAct 的变体。
姚顺雨的第二大代表作便是 Tree of Thoughts(ToT),这是一种增强推理的策略。
在关键决策点展开多条思路,分别评估,再选最优路径继续。
这个方法在研究层面影响很大,但在实际产品中直接用 ToT 的其实并不多,因为树搜索的 token 成本太高,产品里更多是简化版的“多路径尝试”或者“遇到岔路时多想一下”。
ToT 扩展了模型的“深度思考”能力,尤其是当 ReAct 循环中遇到关键的决策点时,ToT 提供了一种“要不你再寻思寻思呢?”的机制。
从 Hy3 到 Hy4 preview,最直观的感受就是,姚顺雨把他的论文完全搬进了模型中。
Hy3 的定位是“强 Agent 型”模型,ReAct 循环已经有了基础,能执行多步骤任务。但 Hy3 没有“过度验证” 的行为特征,说明它的推理更多是单路径的,想到一条路就走,走到黑算完,缺乏多路径探索和评估的机制。
只有模型真的在展开多个候选、逐个评估、确认无误才落笔,才会表现出一种“我必须得狠狠验证对不对”。
Hy4 preview 在推理深度上明显加强了,比如模型能反复自我验证、推理过程偏长,这些都是 ToT 思想在工程中的系统体现。
从 Hy3 到 Hy4 preview,不是简单的参数变大,是整个产品的逻辑都变了,从“单路径执行”升级到了现在的“多路径探索+深度验证”。

甚至混元官方主动在论文中承认,Hy4 preview 复杂任务上可能思考时间过长,并且有过度自我验证的倾向。
姚顺雨算是彻底吃上“老本”了,以前在实验室里捣鼓的玩意,现在可算是逮着机会工程化了。
但光有方法不行,还得有训练数据支持。
大部分大模型的训练数据是“结果导向”的,给出题目,再给出答案,可中间过程被省略了,模型只能学到“看到这个问题给出这个答案、看到那个问题给出那个答案”。
这种数据训练出来的模型,做简单题没问题,然而一旦遇到需要多步骤、需要试错、需要根据中间结果调整策略的复杂任务,就容易崩,因为它从来没学过“边做边看边调整”这件事。
可 ReAct 和 ToT 又强调的是模型边看边解答的这个循环,那该怎么办呢?
Hy4 preview 在论文中写到,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和 CodeBuddy、WorkBuddy 这些真实产品共同设计。
模型进步的每一格,都锚在真实生产力上。模型本身,就是姚顺雨方法论的物质化证明。
Hy4 preview 要远比 Hy3 更加得“姚顺雨”。Hy3 现在看来更像是姚顺雨能力的印证,到了 Hy4 preview 这里,姚顺雨“转正”了。
