Hyra:会持续改进方案与评估器的 AI 科研智能体

了解腾讯混元 Hyra 如何并行实验、从经验库学习、迭代评估器,并在 AI、科学研究和 3D 设计中产出可验证成果。

Hyra 官方循环图,包含经验库、Context Agent、Proposal Agent、沙盒和评估器

简短结论

Hyra 全称 Hunyuan Research Agent,是一个自主科研系统。它持续提出候选方案,在独立沙盒中执行并评分,再把代码、日志、产物和评估反馈写入经验库。多个智能体并行探索;当原有指标不够可靠时,外层循环还会改进评估器本身。

重点要点

01.

核心循环:提出方案、在全新沙盒中执行、评估结果,再把完整记录送入下一轮搜索。

02.

共享记忆:经验库保留源代码、产物、日志、分数和评估反馈,而不只是简短摘要。

03.

评估器进化:面对开放任务,Hyra 可以同时优化方案和评分机制,减少指标盲区与 reward hacking。

04.

公开证据:官方仓库以 Apache 2.0 发布 AI4AI、AI4Science 与 AI4Fun 的结果产物和可复现实验脚本。

Hyra 科研循环一览

维度输入核心工作输出
01 · 上下文任务定义与累积的经验库。选择不同的代码、产物、日志、分数与反馈,组合为灵感上下文。可供并行探索的多个研究方向队列。
02 · 提案任务队列中的一份灵感上下文。反思历史尝试,编写以 solve.sh 为入口的新可执行方案。可在隔离环境中运行的完整候选方案。
03 · 评估候选方案和任务专用评估器。在全新沙盒中执行、验证行为、计算指标并保存日志与产物。带分数和证据、重新写入经验库的尝试。
04 · 进化最佳方案与评估器缺陷的证据。提高评分速度、粒度、稳健性与抗指标利用能力。供下一轮研究使用的更强搜索环境。

Hyra 是什么

Hyra-1.0 是腾讯推出的 Hunyuan Research Agent,面向以性能结果为目标的科研与工程任务。它不会只回答一次,而是把任务变成持续搜索流程:编写方案、执行实验、测量结果、比较优劣并继续改进。

同一套 Harness 可迁移到任何能验证进步的场景,包括模型训练、系统优化、数学构造、科学数据分析、分子设计、游戏、音乐和程序化 3D 创作。

经验库如何推动递归改进

Context Agent 维护 Experience Bank,从历史源代码、文件、运行日志、产物、分数和评估意见中组合出不同的“灵感上下文”,再送入任务队列。系统保留的是可执行证据,而不是把经验压缩成一段泛化摘要。

多个 Proposal Agent 并行领取不同上下文,生成以 solve.sh 为入口的新 solution。候选方案在干净沙盒中运行并评分,随后回到经验库,形成能持续占满模型、沙盒和任务队列的异步生产者—消费者流水线。

为什么 Hyra 也要改进评估器

强搜索很快会找到指标漏洞。官方文章披露,有方案通过泄漏未来 token 异常降低语言模型损失,也有 GPU Kernel 在正确性检查时缓存答案、计时阶段空跑;它们分数很好,却没有完成真正任务。

当任务缺少可靠评估器时,Hyra 使用双层循环:内层改进方案,外层再根据经验库提高评估速度、粒度、抗作弊能力和提升空间,然后用升级后的评估器开启下一轮。

AI 工程与科学发现成果

首批公开结果中,Hyra 在三项成熟 AI 研究任务上继续推进:NanoChat validation BPB 达到 0.9015,NanoGPT 用 76.4 秒达到 3.28 validation loss,SOL-ExecBench 在公开设置下达到 0.771 Mean SOL。

官方仓库还覆盖数学优化、几何 packing、量子路由、符号预测、药物对接和极小神经网络。一个仅含 15 个可训练参数的 Transformer 达到 10 位数加法目标精度;太阳黑子公式在长期留出区间取得约 0.78 的预测 R²。

Hyra 在 EinsteinArena First Autocorrelation Inequality 基准上的官方结果
Hyra 在 First Autocorrelation Inequality 问题上刷新纪录的官方产物。

8 月新增的四项数学推进

腾讯 8 月 19 日公布四项新结果:三维 Blaschke–Lebesgue 通用下界从约 0.380799w³ 提高到 0.411040w³ 以上;Beurling–Ahlfors 一致系数从 1.575 降到 1.523958;部分 Hadamard 矩阵计数的已知幂律阈值从指数 3 推进到 2;接近单位元的交换子构造从 O(log⁴(1/ε)) 改进到 O(log³(1/ε))。

仓库提供论文手稿,并为其中三项新结果的有限或数值核心附带 Lean 4 形式化。这让公开内容不只是排行榜数字,读者可以检查论证、产物和验证代码。

Hyra 的 3D 实验说明了什么

在 3D 任务中,Hyra 接收一张 2D 参考图,编写 Blender Python、渲染结果,再由基于 rubric 的视觉语言模型从轮廓、比例、结构完整性、材质和视觉相似度等维度评分。循环会持续修改建模代码与渲染参数。

公开产物包含程序化 QQ 企鹅和混元 Logo 球体。这是代码驱动的 Blender 建模,不是通用图片转网格服务;它展示了科研智能体如何把视觉反馈转成对 3D 资产的连续、可度量改进。

Hyra 根据 2D 参考图在 Blender 中持续改进 3D 模型的官方动画
Hyra 官方 3D 实验:建模代码和渲染参数随评估轮次持续改进。

常见问题

Hyra 全称 Hunyuan Research Agent。Hyra-1.0 是腾讯面向性能导向科研与工程任务推出的自主研究框架。

Hyra 是智能体框架。它协调上下文选择、并行 Proposal Agent、沙盒执行、评估器和经验库,底层模型只是整个循环的一部分。

每次运行都会把源代码、产物、日志、分数和反馈送回经验库。新智能体从历史中选择相关内容并提出更强候选方案;开放任务的外层循环还可以重新设计评估器。

官方 Hyra-results 仓库以 Apache 2.0 公开,包含方案产物和相关可复现脚本。截至 2026 年 8 月 25 日,它是配套结果仓库,并非一键运行完整 Hyra Harness 的打包版本。

可以。官方演示中,Hyra 会编写并迭代 Blender Python,根据单张 2D 参考图重建 3D 对象。这是代码生成加视觉评估流程,不是标准图片转网格模型。

公开产物覆盖模型训练、训练加速、GPU Kernel、数学不等式、几何 packing、极小神经网络、分子对接、量子路由、符号预测、游戏、音乐和程序化 3D 设计。

把参考图变成可继续制作的 3D 起点

在浏览器中生成带纹理的角色、道具、产品或场景资产。

试用图片转 3D