街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

Hy4Preview,更“姚顺雨”了

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:字母榜)

Hy4 preview才刚发布3天,腾讯WorkBuddy就针对Hy4 preview推理集群进行了紧急扩容,官方宣称,将持续动态调配资源。

然而WorkBuddy表示,受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况。因此官方推荐用户在Hy4 preview排队期间切换至Hy3,并且同时还把WorkBuddy的Hy3限免延长至2026年9月30日23:59。

Hy4 preview总参数770B,激活参数49B,上下文1M,Terminal Bench 2.1得分冲到85.4,开源第一、全球第三,SWE-bench Multilingual得分82.9,同样是开源第一。

8月28日发布当天,API排队用户就超过了5000人。

为什么Hy4 preview这么受欢迎?

一方面是WorkBuddy本身的用户量增长,6月时就有数据显示,WorkBuddy的MAU突破了2000万。

但更重要的是,这是腾讯基础模型部成立之后的第一个新模型,也是一款从头到尾贯彻姚顺雨理念的产品。

在Hy4 preview的技术报告中,腾讯大大方方地标明Hy4 preview使用了哪家的技术,并说明了对其进行修改的具体方式。

有意思的地方是,即使用了别人的技术,Hy4 preview却形成了独特的风格。

01

三种“自进化”

一切要从自进化开始说起。

Hy4 preview的README里,这样写道,灵感来自于DeepSeek和GLM(inspired by DeepSeek and GLM)。

Hy4 Preview注意力模块用的是DeepSeek的Gated以及MTP层做投机解码;配的是智谱的IndexCache做跨层稀疏索引复用;残差通路用了字节的iHC(identity Hyper-Connections)。

但如果只看到这些,就错过了Hy4真正反常的地方。

混元团队在论文中表示,Hy4 preview第一次全程参与了制造自己的过程,在训练方法、数据策略、评估体系和底层算子这四个环节,全部引入了模型的自进化机制。

但有意思的是,明明说灵感来自于智谱和DeepSeek,可在自进化的方向上,Hy4 preview又和DeepSeek、GLM完全不同。

智谱的自进化,发生在训练阶段,目标是让模型本身变聪明。

智谱给GLM-5.3搭了一条“自己出真题自己做”的流水线,让一个“AI研究员”去真实工程师的工作场景里观察,把实际业务提炼成训练数据。再让一个“AI判卷员”先闭卷做一遍,只有确认真的有解,才会把题目放进题库。

配合SAO和slime框架,GLM-5.3在不更换基座的前提下,比GLM-5.2的长程编码训练速度提升了约 2.3 倍。

这套逻辑的本质是生物学意义上的进化,基因在迭代中变得更适应环境。

DeepSeek的自进化,发生在运行阶段,目标是通过DSH让模型的“身体”可以无限重组。

DSH的核心设计原则是“一切皆插件”,Agent发现缺什么,就现场补什么,用完再无痕拆下来。官方管这叫self-modification。

这是工具学意义上的进化,人没变,只是学会使用各种工具,让自己能干更多的事情。

腾讯Hy4 preview的自进化,既不在训练阶段,也不在运行阶段,它发生在研发流程本身。

Hy4既不是智谱那样“让自己变聪明”,也不是DeepSeek那样“让自己的工具变多”,它是在定义自己,“我作为Hy4 Preview,我应该是什么样?”比如“我”的训练方法应该怎么设计、数据策略应该怎么定、评估体系应该怎么建。

先定义好自己是什么,再朝着自己想要的方向去发展。

要想全链路自进化,第一件事就是要统一组织。

Hy4 preview自进化的4个环节,其实就是大模型研发的完整链条。从最基本的训练、数据、评估,到最后怎么把训好的模型高效地跑起来。

这也就是说,姚顺雨能完整地统筹整个大模型的研发了。

过去这些事物是分开的,腾讯将其分成了两个平行部门,分别为大语言模型部和多模态模型部。各自拥有独立的训练数据、技术框架、研发流程和评测标准。

而且当时的腾讯还有AI Infra、AI Data和数据计算平台部分别掌管不同的数据。

7月合并成基础模型部,姚顺雨一个人统管之后,这条链路才第一次被打通。Hy4 preview能参与全链路,本身就代表着组织现在是一条心了。

姚顺雨对工程化非常重视。

三家里面,只有腾讯混元把“底层算子优化”和“推理吞吐量提升”这些关乎模型实际运行的东西纳入自进化的列表里。

姚顺雨入职后第一件事就是重建基础设施,他在6月与汤道生对谈中提到,“我们把Infrastructure重建了,无论是预训练还是强化学习”。

哪怕是OpenAI和Anthropic,算力都是最稀缺的资源,汤道生曾公开承认“算力严重不足拖慢了模型训练与产品发展”。姚顺雨必须把每一分算力都榨干。

一切的核心在于姚顺雨的方法论——Co-design。边训边用,让产品反馈倒逼模型迭代。

Hy3时期,Co-design主要发生在模型和产品之间,比如将CodeBuddy、WorkBuddy的用户反馈,回流到模型训练当中。

到了Hy4 preview这里,Co-design的范围扩大了,整个模型研发流程都遵从这套方法论。

也就是说,姚顺雨统一了混元模型,并且让模型与腾讯的所有条线接轨,将他对AI的理解,完全倾注其中。

02

模型是姚顺雨方法论的物质化证明

之所以要将姚顺雨的理念贯彻进模型当中,是因为他本身就是语言Agent研究的开创者之一。

ReAct是姚顺雨的代表作,论文于2022年10月挂出,发表在ICLR 2023上,被评为notable top 5%,引用量超过10000次。

而ReAct也是如今所有Agent的工作原理。 它的核心是把“推理”和“行动”从两个分离的步骤放在同一个prompt模板里的交替循环。想一步、做一步、看结果、再想。

不管是Claude Code还是Codex,底层“思考 - 调用工具 - 观察结果 - 继续思考”循环,本质上都是ReAct的变体。

姚顺雨的第二大代表作便是Tree of Thoughts(ToT),这是一种增强推理的策略。

在关键决策点展开多条思路,分别评估,再选最优路径继续。

这个方法在研究层面影响很大,但在实际产品中直接用ToT的其实并不多,因为树搜索的token成本太高,产品里更多是简化版的“多路径尝试”或者“遇到岔路时多想一下”。

ToT扩展了模型的“深度思考”能力,尤其是当ReAct循环中遇到关键的决策点时,ToT提供了一种“要不你再寻思寻思呢?”的机制。

从Hy3到Hy4 preview,最直观的感受就是,姚顺雨把他的论文完全搬进了模型中。

Hy3的定位是“强Agent型”模型,ReAct循环已经有了基础,能执行多步骤任务。但Hy3没有“过度验证” 的行为特征,说明它的推理更多是单路径的,想到一条路就走,走到黑算完,缺乏多路径探索和评估的机制。

只有模型真的在展开多个候选、逐个评估、确认无误才落笔,才会表现出一种“我必须得狠狠验证对不对”。

Hy4 preview在推理深度上明显加强了,比如模型能反复自我验证、推理过程偏长,这些都是ToT思想在工程中的系统体现。

从Hy3到Hy4 preview,不是简单的参数变大,是整个产品的逻辑都变了,从“单路径执行”升级到了现在的“多路径探索+深度验证”。

甚至混元官方主动在论文中承认,Hy4 preview复杂任务上可能思考时间过长,并且有过度自我验证的倾向。

姚顺雨算是彻底吃上“老本”了,以前在实验室里捣鼓的玩意,现在可算是逮着机会工程化了。

但光有方法不行,还得有训练数据支持。

大部分大模型的训练数据是“结果导向”的,给出题目,再给出答案,可中间过程被省略了,模型只能学到“看到这个问题给出这个答案、看到那个问题给出那个答案”。

这种数据训练出来的模型,做简单题没问题,然而一旦遇到需要多步骤、需要试错、需要根据中间结果调整策略的复杂任务,就容易崩,因为它从来没学过“边做边看边调整”这件事。

可ReAct和ToT又强调的是模型边看边解答的这个循环,那该怎么办呢?

Hy4 preview在论文中写到,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和CodeBuddy、WorkBuddy这些真实产品共同设计。

模型进步的每一格,都锚在真实生产力上。模型本身,就是姚顺雨方法论的物质化证明。

Hy4 preview要远比Hy3更加得“姚顺雨”。Hy3现在看来更像是姚顺雨能力的印证,到了Hy4 preview这里,姚顺雨“转正”了。

未经允许不得转载: 街坊秀 » Hy4Preview,更“姚顺雨”了