闻乐 发自 凹非寺
量子位 | 公众号 QbitAI

姚顺雨空降半年,腾讯混元开进大模型第一梯队。

7月,Hy3正式版才刚出来,不到两个月,新一代旗舰模型Hy4 preview又来了。

770B总参数、49B激活参数、1M上下文,Coding、Agent、科学研究和真实生产力能力全线往上抬。

在最新的Code Arena WebDev榜单上,Hy4 preview已经冲到全球第5、开源模型第3

混元开始真正挤进第一梯队了。

跻身第一梯队

Hy4 preview继续采用MoE架构,总参数规模从Hy3的295B直接扩到了770B,每次推理激活49B参数,上下文也从256K一步拉到了1M。

规模上去了,也越来越能干活。

在软件工程和Agent相关评测里,Hy4的提升很直观。

Terminal Bench 2.1从Hy3的70.8上涨到85.4;DeepSWE则从28.0直接冲到64.3,翻了一倍还多。

在主打长链路复杂开发任务的的SWE-bench Pro拿到65.7,已经和GLM-5.3、Kimi K3、GPT-5.6 Sol这些旗舰模型挤到了同一个区间;

而且Hy4的实际落地能力,也能看出明显进步。

比如做一套国家古建筑3D数字卷宗,这是一个包含前端设计、Three.js开发、3D资产处理和交互逻辑的完整项目。

最终Hy4把故宫、布达拉宫、黄鹤楼、天坛、长城、福建土楼、莫高窟7个真实3D模型全部装进了一个可以直接操作的数字卷宗里。

还能实现三栏式卷宗界面、模型旋转缩放、自动播放演示、截图、全屏、中英文切换、多视图同步联动。

再换一个画风,让它做金融世界沙盘。

用户只需要改一个变量,比如“AI资本开支下降30%。”

然后整个系统就会自己推演这个冲击如何从宏观环境一路传导到产业链,再落到具体公司的收入、利润、现金流和估值。

它相当于搭好了一张完整的产业因果网络,把AI基建、芯片、HBM、云厂商之间盘根错节的关联全部封装进去。

只要改动一个参数,整张网络就会动态重新运转,谁受益、谁受损,各家估值跟着一起联动更新。

甚至连游戏引擎都开始直接接管。

在Unreal 5里,Hy4可以通过MCP全程程序化搭建一张500米见方的黄昏森林FPS:

地形、树木、岩石、植被、玩家属性、触发器、武器伤害、尸潮刷新逻辑,一路从环境美术搭到玩法和关卡。

但Hy4显然还没满足于“给人干活”,它开始自己搞科研了。

Hy4开始自己搞科研了

先看个最像AI研究员的,小模型后训练

这一次Hy4直接坐到了researcher的位置,同时管理多个Codex Session,让不同Agent分别尝试不同实验方向。

再根据每一轮结果判断哪些路线值得继续,哪些应该放弃,然后重新安排下一步探索。

最终在8项评测上,Hy4组织多个Codex共同探索,全部优于Codex单独干活。

配合Hyra,Hy4 preview开始挑战机器学习力场分子动力学模拟。

在一个包含32512个原子的磷脂双分子层SO3LR任务里,它在已经高度优化的JAX实现基础上,又把速度提高了2倍,达到54.9 ms/step。

单张高端GPU,甚至可以容纳30万原子。

Hy4还跑去解决了一个已经存在上百年的经典几何问题:

三维Blaschke–Lebesgue问题。

这个问题研究的是所有等宽三维凸体里,到底谁的体积最小?

数学界长期猜测答案可能是Meissner四面体,对应体积约0.41986,但一直没有得到最终证明。

配合Hyra,Hy4 preview把这个问题已经证明的体积下界,从0.380799推进到了0.41104。

距离Meissner四面体猜想,只剩大约最后2%的Gap。

姚顺雨加入大半年,混元换挡了

Hy4出来之后,一个绕不开的名字是姚顺雨

飞书文档 - 图片

他对大模型的一系列判断,正越来越具体地出现在混元的模型路线里。

今年2月,姚顺雨加入腾讯后的第一批研究成果公开。

研究抛出的最核心的问题是模型到底应该怎么继续变聪明。

过去几年,大模型最主流的进化方式是Scaling,堆更多参数、灌入更多数据、投入更多算力。

这条路线当然远没有失效,Hy4自己就是一个770B总参数的MoE大模型。

但姚顺雨此前反复讨论过一个问题:

当互联网里现成的人类高质量数据逐渐逼近上限,下一阶段的智能从哪里来?

在他的判断里,答案很大程度指向环境与经验

模型不能一直坐在题库里学习人类已经留下来的答案,它得真正进入环境做事,在执行过程中得到反馈,再从自己的成功和失败里继续学习。

把这套思考放回混元过去半年的变化里,就能看到一些对应。

今年4月,姚顺雨加入腾讯后的第一张完整模型答卷Hy3 preview,已经明显把Agent能力放到了更核心的位置。

到了Hy3正式版,这条路线继续强化。

模型发布一周后,Hy3总调用量相比上一代Hy2增长超过68倍;在WorkBuddy主动选择模型的用户里,Hy3占比已经达到60%。

这两个数字虽然不能简单等同于模型能力,但至少说明了一件事:

混元开始真正进入用户的工作环境。

模型能力起来以后,腾讯紧接着又动了组织,把原来的大语言模型部门和多模态模型部门整合为基础模型部,统一交给姚顺雨负责:

开始尝试把原本分散的资源,接到同一套基础模型研发体系里。

来自软件工程、游戏、金融、安全等业务线的腾讯专家深度参与数据与需求建设,Hy4也和WorkBuddy、CodeBuddy开展Co‑Design协同设计。

从Hy3到Hy4,混元越来越多的能力增量出现在Coding、Agent和长程任务上。

技术理念、组织架构与产品侧需求开始形成服务模型迭代的协同合力。

姚顺雨加入半年,腾讯AI开进第一梯队了。

或许再一次见面,就可以问姚顺雨:腾讯怎么快起来了?

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

内容中包含的图片若涉及版权问题,请及时与我们联系删除