• 正文
  • 相关推荐
申请入驻 产业图谱

腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代

07/22 13:24
1779
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

作者 |  陈骏达 编辑 |  云鹏

智东西7月21日报道,今天,腾讯正式发布了其首个研究智能体(Research Agent)——Hyra(Hunyuan Research Agent)。Hyra能够像科研人员一样,提出假设、完成实验、总结经验,再基于经验不断提出新的方案,最终实现递归自我改进(Recursive Self-Improvement,RSI)。

从腾讯公开的实验结果来看,Hyra已经可以在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个方向发挥作用,并在多个公开任务中刷新已有纪录。

比如,在科研领域,Hyra设计出了一个仅含15个可训练参数、即可完成10位数加法的Transformer,相比Adderboard公开纪录中的36个参数减少了58.3%。这一结果证明Hyra能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供帮助。

Hyra也可以通过观察AI模型训练日志,发现模型的Scaling Law,指导训练配方的设计。

Hyra并不仅限于科研,也可以用于3D建模、音乐创作等创意场景。比如,在拿到一段主旋律后,Hyra可以为多种乐器编写完整和声,逐步将一段原本保守的和声迭代为多乐器、灵活节奏和丰富色彩的完整音乐。

腾讯还在博客中透露,新一代Hy模型、乃至腾讯的部分产品,都会与Hyra持续共进化。

研究博客:https://hy.tencent.com/research/hyra

01.采用轻量Harness设计有效防止AI“作弊”

过去一年,递归自我改进已经成为全球AI领域最受关注的技术方向之一。Google DeepMind推出AlphaEvolve,将Gemini用于算法发现,把4×4复数矩阵乘法的标量乘法次数压缩到48次;Together AI通过Einstein Arena让多个智能体协同探索数学开放问题;Andrej Karpathy也提出autoresearch,希望让模型训练实验能够自动循环运行。

不过,上述研究主要聚焦单一方向的探索,腾讯此次发布的Hyra希望构建一套通用研究框架,让智能体能够进入AI研发、科学发现乃至工业设计等更多真实环境,不断积累经验、自主进化。

科研真正困难的地方,是在一次次实验失败之后,不断总结经验、调整方向、重新设计实验,再继续验证。这本质上是一个不断循环迭代的搜索过程,也是科研智能体区别于普通智能体最大的地方。

Hyra的核心设计,就是围绕这一循环展开。

整个系统没有设计复杂的工作流,而是采用了一套非常轻量的Harness。腾讯团队认为,这一思路遵循Rich Sutton提出的The Bitter Lesson:长期来看,真正能够持续胜出的,并不是人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥作用。

Hyra智能体的整个系统只有两个核心角色,其架构如下:

其中,一个Context Agent负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果、生成文件都会被保存下来,再不断整理成新的“灵感”,提供给下一轮探索使用。

另一侧,则是多个Proposal Agent。

它们不断领取不同的灵感上下文,提出新的方案,自动生成完整解法,并进入独立沙盒执行。程序运行结束后,系统自动打分,再将结果重新写回经验库。

整个系统则始终保持异步运行。Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,计算资源、沙盒环境、模型推理始终保持高利用率。Context Agent会将灵感准备得尽可能多样化,让Proposal Agent可以朝着多样的方向探索。

Hyra不仅优化方案,还会优化评测标准。很多科研问题并不存在天然评估其,例如设计一个世界冠军级国际象棋AI,最开始只能设计一个简单的Elo评测系统,随着越来越强的AI不断出现,评测体系本身也要不断升级,否则AI很容易“刷分”而非真正变强。

为解决上述问题,腾讯混元团队提出了一套双层循环机制。

首先,Hyra会根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化解法;当内层循环结束后,Hyra会结合当前经验中积累的经验历史进一步优化评估器,并使用升级后的评估器开启下一轮循环。味着,Hyra优化的不只是答案,而是整个科研流程本身。

02.从模型优化到药物设计Hyra展现多领域潜力

科研智能体最终还是要靠结果说话,腾讯此次展示了十多个由Hyra执行的科研任务案例。

首先是在AI for AI方向。

模型训练是最适合科研智能体发挥作用的领域之一,其中包含大量可执行、可评估、可迭代的研究循环。

腾讯选择了三项公开任务进行评测,包括NanoChat Autoresearch、NanoGPT Speedrun以及NVIDIA推出的SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU kernel优化。

在采用完全相同实验设置的情况下,腾讯将Hyra与AI初创公司Recursive打造的研究智能体进行了对比。在NanoChat任务中,Hyra将Validation BPB进一步下降至0.9015;在NanoGPT Speedrun中,Hyra将达到指定Loss所需时间缩短至76.4秒;在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771,均超过基线水平。

与此同时,腾讯也展示了科研智能体面临的问题。

随着搜索越来越强,AI开始主动寻找评估器漏洞。例如,在NanoChat实验中,Hyra曾尝试通过泄露未来Token信息,获得异常优秀BPB成绩;而在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。

这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续升级,否则所谓“进步”可能只是作弊。

Hyra还在AI for Science方向展示出不错的潜力。

腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题。最终,Hyra在其中29个问题上刷新历史最佳结果。

它还能直接从数据中寻找规律。当获得1749年至1932年的太阳黑子历史数据后,Hyra自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。

Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法在IBM Q20上相比经典SABRE将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。

在药物设计任务中,Hyra围绕精准抗癌“明星靶点”PARP1自动生成候选分子,在结合能力和成药性联合评分上超过已上市PARP抑制剂奥拉帕利(Olaparib)。当然,腾讯也强调,这一药物设计结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。

除了科研,Hyra也可以进入更多开放场景。它通过持续自博弈,把一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。

或是根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。

这些案例共同说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立反馈机制,智能体都能够持续搜索、不断演进。

03.结语:科研智能体或成下一代AI系统重要形态

随着大模型能力不断提升,如何让AI自己加速AI的发展成为不少大模型企业开始考虑的问题,芯片、药物等领域的企业也正在尝试把科研过程本身交给AI完成。

未来,科研智能体能否真正成为科学发现的新工具,还有待更多真实场景验证。但可以确定的是,AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识。而能够持续自我改进、自我研究的智能体,也很可能成为下一代AI系统的重要形态之一。

腾讯

腾讯

腾讯于1998年11月成立,是一家互联网公司,通过技术丰富互联网用户的生活,助力企业数字化升级。我们的使命是“用户为本 科技向善”。Founded in 1998, Tencent is an Internet-based platform company using technology to enrich the lives of Internet users and assist the digital upgrade of enterprises. Our mission is "Value for Users, Tech for Good".

腾讯于1998年11月成立,是一家互联网公司,通过技术丰富互联网用户的生活,助力企业数字化升级。我们的使命是“用户为本 科技向善”。Founded in 1998, Tencent is an Internet-based platform company using technology to enrich the lives of Internet users and assist the digital upgrade of enterprises. Our mission is "Value for Users, Tech for Good".收起

查看更多

相关推荐

智能产业第一媒体!聚焦智能变革,服务产业升级! 公众号:智东西