简短结论
Hyra 全称 Hunyuan Research Agent,是一个自主科研系统。它持续提出候选方案,在独立沙盒中执行并评分,再把代码、日志、产物和评估反馈写入经验库。多个智能体并行探索;当原有指标不够可靠时,外层循环还会改进评估器本身。
重点要点
核心循环:提出方案、在全新沙盒中执行、评估结果,再把完整记录送 入下一轮搜索。
共享记忆:经验库保留源代码、产物、日志、分数和评估反馈,而不只是简短摘要。
评估器进化:面对开放任务,Hyra 可以同时优化方案和评分机制,减少指标盲区与 reward hacking。
公开证据:官方仓库以 Apache 2.0 发布 AI4AI、AI4Science 与 AI4Fun 的结果产物和可复现实验脚本。
Hyra 科研循环一览
| 维度 | 输入 | 核心工作 | 输出 |
|---|---|---|---|
| 01 · 上下文 | 任务定义与累积的经验库。 | 选择不同的代码、产物、日志、分数与反馈,组合为灵感上下文。 | 可供并行探索的多个研究方向队列。 |
| 02 · 提案 | 任务队列中的一份灵感上下文。 | 反思历史尝试,编写以 solve.sh 为入口的新可执行方案。 | 可在隔离环境中运行的完整候选方案。 |
| 03 · 评估 | 候选方案和任务专用评估器。 | 在全新沙盒中执行、验证行为、计算指标并保存日志与产物。 | 带分数和证据、重新写入经验库的尝试。 |
| 04 · 进化 | 最佳方案与评估器缺陷的证据。 | 提高评分速度、粒度、稳健性与抗指标利用能力。 | 供下一轮研究使用的更强搜索环境。 |
Hyra 是什么
Hyra-1.0 是腾讯推出的 Hunyuan Research Agent,面向以性能结果为目标的科研与工程任务。它不会只回答一次,而是把任务变成持续搜索流程:编写方案、执行实验、测量结果、比较优劣并继续改进。
同一套 Harness 可迁移到任何能验证进步的场景,包括模型训练、系统优化、数学构造、科学数据分析、分子设计、游戏、音乐和程序化 3D 创作。
经验库如何推动递归改进
Context Agent 维护 Experience Bank,从历史源代码、文件、运行日志、产物、分数和评估意见中组合出 不同的“灵感上下文”,再送入任务队列。系统保留的是可执行证据,而不是把经验压缩成一段泛化摘要。
多个 Proposal Agent 并行领取不同上下文,生成以 solve.sh 为入口的新 solution。候选方案在干净沙盒中运行并评分,随后回到经验库,形成能持续占满模型、沙盒和任务队列的异步生产者—消费者流水线。
为什么 Hyra 也要改进评估器
强搜索很快会找到指标漏洞。官方文章披露,有方案通过泄漏未来 token 异常降低语言模型损失,也有 GPU Kernel 在正确性检查时缓存答案、计时阶段空跑;它们分数很好,却没有完成真正任务。
当任务缺少可靠评估器时,Hyra 使用双层循环:内层改进方案,外层再根据经验库提高评估速度、粒度、抗作弊能力和提升空间,然后用升级后的评估器开启下一轮。
AI 工程与科学发现成果
首批公开结果中,Hyra 在三项成熟 AI 研究任务上继续推进:NanoChat validation BPB 达到 0.9015,NanoGPT 用 76.4 秒达到 3.28 validation loss,SOL-ExecBench 在公开设置下达到 0.771 Mean SOL。
官方仓库还覆盖数学优化、几何 packing、量子路由、符号预测、药物对接和极小神经网络。一个仅含 15 个可训练参数的 Transformer 达到 10 位数加法目标精度;太阳黑子公式在长期留出区间取得约 0.78 的预测 R²。

8 月新增的四项数学推进
腾讯 8 月 19 日公布四项新结果:三维 Blaschke–Lebesgue 通用下界从约 0.380799w³ 提高到 0.411040w³ 以上;Beurling–Ahlfors 一致系数从 1.575 降到 1.523958;部分 Hadamard 矩阵计数的已知幂律阈值从指数 3 推进到 2;接近单位元的交换子构造从 O(log⁴(1/ε)) 改进到 O(log³(1/ε))。
仓库提供论文手稿,并为其中三项新结果的有限或数值核心附带 Lean 4 形式化。这让公开内容不只是排行榜数字,读者可以检查论证、产物和验证代码。
Hyra 的 3D 实验说明了什么
在 3D 任务中,Hyra 接收一张 2D 参考图,编写 Blender Python、渲染结果,再由基于 rubric 的视觉语言模型从轮廓、比例、结构完整性、材质和视觉相似度等维度评分。循环会持续修改建模代码与渲染参数。
公开产物包含程序化 QQ 企鹅和混元 Logo 球体。这是代码驱动的 Blender 建模,不是通用图片转网格服务;它展示了科研智能体如何把视觉反馈转成对 3D 资产的连续、可度量改进。

常见问题
Hyra 全称 Hunyuan Research Agent。Hyra-1.0 是腾讯面向性能导向科研与工程任务推出的自主研究框架。
Hyra 是智能体框架。它协调上下文选择、并行 Proposal Agent、沙盒执行、评估器和经验库,底层模型只是整个循环的一部分。
每次运行都会把源代码、产物、日志、分数和反馈送回经验库。新智能体从历史中选择相关内容并提出更强候选方案;开放任务的外层循环还可以重新设计评估器。
官方 Hyra-results 仓库以 Apache 2.0 公开,包含方案产物和相关可复现脚本。截至 2026 年 8 月 25 日,它是配套结果仓库,并非一键运行完整 Hyra Harness 的打包版本。
可以。官方演示中,Hyra 会编写并迭代 Blender Python,根据单张 2D 参考图重建 3D 对象。这是代码生成加视觉评估流程,不是标准图片转网格模型。
公开产物覆盖模型训练、训练加速、GPU Kernel、数学不等式、几何 packing、极小神经网络、分子对接、量子路由、符号预测、游戏、音乐和程序化 3D 设计。
