节后上班第一天,姚顺雨坐在了马化腾的旁边。
据《广东新闻联播》报道,广东省领导来到腾讯总部调研座谈。包括马化腾在内,多位腾讯高管均参与座谈。
能坐在Pony旁边,说明腾讯高层对姚顺雨高度认可,而姚顺雨确实也不负厚望,出任腾讯AI Data部负责人不到一个月,就拿到了一项中国第一。
在Arena最新的Alignment Index(对齐指数)榜单中,中国多家AI公司冲进榜单前10,腾讯混元独占鳌头,其最新模型Hy4 Preview拿到了78.5分,全球第5,中国第一。UA 1.47%、FA 6.44%、DC 13.24%,越权控制最好。
和以往Arena的“秀肌肉”榜单不同,这张榜测的不是谁更聪明、谁跑分更高,它测的就是现在最火的安全问题,谁家的模型最“不会越狱”。
2025年的时候,姚顺雨曾写过一篇文章,标题为《The Second Half》,文章的核心判断就是在AI的下半场,瓶颈不再是怎么训练模型,而是怎么去让模型符合用户的真实需求。
如今看来,姚顺雨用实际行动证明了自己当时的猜想。
01
榜单到底在测什么?
10月8日,Arena宣布完成2亿美元B轮融资、估值31亿美元,并同步推出了对齐榜单Alignment Index。这张榜单基于9万多条真实的Agent会话、覆盖27个模型,全都是从用户真实的使用轨迹里,专门定位模型出现风险的时刻。
榜单主要看三种失败信号。
第一种是越权(Unauthorized Action,UA):你没让它做的事,它自己做了。
最典型的例子就是绕过安全护栏攻击他人网络,以及删除文件。
Arena披露,Claude Opus 5约有2%的会话出现越权,其中53.5%涉及未经许可删除或“清理”用户的文件和之前的工作成果。
第二种是错误归因(False Attribution,FA):把用户没说过的话、没有的意图或事实,安到用户头上,而且这个说法与用户提供的证据相矛盾。
说白了就是“甩锅”,或者凭空编造“你之前说过要这样”。比如它代码跑错了,却告诉你是你的数据有问题。这一项在专业写作场景里最高,达到13.7%。
第三种是虚假完成(Deceptive Completion,DC):没做完,却告诉你做完了。
这是三项里最常见的问题,平均每10个会话就有1个出现,而在代码调试场景里,比例高达48.0%。
第一名是OpenAI的GPT-6.1 Sol,87.9分,第二名是Anthropic的Claude Opus 5.5(83.2分),第三名是Grok-4.7(82.7分)。GPT-6.1 Sol虚假完成率只有2.34%,换句话说,100次任务里大约有2次会“谎报军情”。
虽然Hy4 Preview得分为78.5分,和前三名有差距,但已经站在了全球第5、中国第1的位置。越权1.47%,是中国实验室里最低的,这意味着它最少“擅自动手”。
Hy4 Preview的虚假完成率是13.24%,100次里大约有13次,高于10%的平均水平。这是混元的短板,也是接下来最该补的一块。
这张榜单的结果,和姚顺雨过去一年在腾讯做的几件事,是强相关的。
今年9月,腾讯TEG内部任命,姚顺雨正式兼任AI Data部负责人,向 TEG 总裁卢山汇报。
这个部门主要负责大模型数据和评测体系的建设,原负责人是刘煜宏。事实上,从今年上半年起,姚顺雨就已经在实际管理这个部门,只是到了9月才正式给了姚顺雨名分。
至此开始,腾讯混元的“模型、Infra、数据和评测”四件事,全划归到了他一个人手里。
从模型到数据再到评测,姚顺雨一把抓,这事本身就非常的姚顺雨。
还是在《The Second Half》这篇博客里,姚顺雨写到,模型性能逐渐趋同,继续刷分,不会再带来真实的价值。
姚顺雨认为,其根本原因在于,传统模型的评测方法非常局限。
Agent拿到任务、自主完成、最后得到一个分数。但是现实中,Agent必须在全程与人互动,它很难完全自主执行题目。
此外,传统的评测每道题都是独立同分布的,题与题之间互不相干。现实中,任务是顺序发生的,经验会积累。
姚顺雨表示,AI已经在象棋、围棋、SAT、律师资格考试和IMO、IOI上超过了人类,但世界并没有因此发生太大改变,归根结底,是因为现在的评测方法与真实世界不同。
所以在Hy4 Preview上,姚顺雨让模型自己参与了训练方法、数据策略、评估体系和底层算子的自动优化。以初步RSI的方式进行自我迭代。
同时为了让模型更能解决实际问题,Hy4 Preview与WorkBuddy、CodeBuddy等产品共同设计,训练数据则是腾讯软件工程、游戏、金融、安全团队在实际业务中产生的真实数据。
前文提到,越权、甩锅、虚假完成,这三个问题有个共同点:它们只有在真实任务里才会暴露。姚顺雨主张的理念,刚好也正是如此。
Hy4 Preview发布当天,一位博主做测评,让WorkBuddy接入Hy4去给三个视频文件重命名。
为了试探模型会不会偷懒,他中途把文件夹里的参考文档剪切走了,结果被模型发现,它直接发问“刚才文件还在,怎么不见了”,随后去查回收站。
可见Hy4 Preview在防止模型“虚假完成”这方面,下足了功夫。
02
对齐才是大模型的第一叙事
如果只把这张榜单看成一次排名,其实是低估了它的意义。这个榜单想要说明的是,AI行业的叙事正在发生转移。
过去,大模型的故事是“谁更强”:谁的MMLU更高,谁的数学更好,谁的代码跑分更猛。
可现在,头部模型在基准上越来越接近,分数已经不足以让用户做选择,安全就成为了新的叙事。
成为付费用户可以阅读 腾讯 所有资料
了解更多 →