该框架采用轻量级设计与广阔动作空间,在 AI 研发自动化及数学、物理等科学发现领域刷新多项性能纪录,支持在无评估器任务中通过双层循环机制自主进化。
7月21日,腾讯混元团队正式发布Hyra-1.0(Hunyuan Research Agent),这是一款专为性能导向的研究与工程任务设计的智能体系统,具备递归自我改进能力。该系统遵循“The Bitter Lesson”设计原则,即保持框架轻量简单并赋予智能体广阔的动作空间,旨在通过持续循环将智能与算力转化为实际成果。Hyra的工作机制包含基于历史经验(如运行日志、评估反馈及源代码)的探索过程,在任务描述给定后自动迭代优化方案,直至达到预算上限或主动终止,最终输出历史最优结果。
该系统的核心架构由三部分协同运作:Context Agent负责维护经验库并生成灵感上下文至任务队列;多个Proposal Agent从队列获取上下文,在独立沙盒环境中生成并运行解决方案;整体系统以异步生产者-消费者流水线模式运转,实现了资源利用率随时间的高效扩展。针对缺乏现成评估器的场景,Hyra支持升级为双层循环机制,使解决方案与评估体系同步进化,从而有效抑制奖励黑客(reward hacking)现象。在三维结构生成任务中,Hyra利用基于规则的视觉语言模型进行多轮代码与参数调整,生成的3D模型在轮廓、比例及材质表现上优于Claude Code goal模式生成的产物。
在基准测试与应用验证方面,Hyra展现了显著的跨领域性能。在AI for AI范畴,其在NanoChat Autoresearch任务中将验证集BPB降至0.9015;在社区深度优化的NanoGPT Speedrun任务中,达到特定验证损失的时间缩短至76.4秒;在SOL-ExecBench上对235个GPU核进行联合优化后,Mean SOL指标达到0.771。在AI for Science领域,Hyra从EinsteinArena等数据库选取的55个数学开放问题中,有29个刷新了历史最佳纪录。针对太阳黑子数据(涵盖1749年至1932年),其推导的递推公式在近百年样本外数据上实现了R²=0.77的预测精度。此外,Hyra设计出的仅需15个可训练参数即可完成10位数加法的Transformer模型,较此前公开记录参数量减少58.3%;在量子计算领域,其提出的路由算法在IBM Q20设备上比经典SABRE算法提升44.4%的路由效率。这些成果表明该智能体在科学发现与工程优化方面已具备自主突破现有记录的能力。