Hyra:解法と評価器を自ら改善する AI 研究エージェント

Tencent Hunyuan Hyra が並列実験、Experience Bank、評価器の進化を通じ、AI・科学・3D で検証可能な成果を生み出す仕組みを解説します。

Experience Bank、エージェント、サンドボックス、評価器を含む Hyra 公式ループ図

短い結論

Hyra は Hunyuan Research Agent の略です。解法を提案し、独立したサンドボックスで実行・採点し、コード、ログ、成果物、評価フィードバックを Experience Bank に保存します。複数エージェントが並列探索し、外側のループは評価器そのものも改善できます。

要点

01.

基本ループ:提案を新しいサンドボックスで実行・評価し、完全な結果を次の探索へ戻します。

02.

共有メモリ:Experience Bank はソースコード、成果物、ログ、スコア、評価フィードバックを保持します。

03.

評価器の進化:解法だけでなく採点系も改善し、盲点や reward hacking を減らします。

04.

公開証拠:公式リポジトリは AI4AI、AI4Science、AI4Fun の成果物と再現スクリプトを Apache 2.0 で公開しています。

Hyra 研究ループの概要

項目入力主要処理出力
01 · Context課題定義と蓄積された Experience Bank。コード、成果物、ログ、スコア、フィードバックから多様なコンテキストを作成。並列探索する複数の研究方向キュー。
02 · Proposeキュー内の1つの発想コンテキスト。過去の試行を振り返り、solve.sh で実行できる新解法を作成。隔離実行できる完全な候補解法。
03 · Evaluate候補解法と課題専用の評価器。新しいサンドボックスで実行、検証、測定し、ログと成果物を保存。採点され Experience Bank に戻る試行。
04 · Evolve最良解法と評価器の弱点を示す証拠。評価速度、粒度、堅牢性、指標悪用への耐性を向上。次の研究サイクル向けの強い探索環境。

Hyra とは

Hyra-1.0 は、性能指標を持つ研究・工学課題向けの Tencent Hunyuan Research Agent です。一度回答するのではなく、解法の作成、実行、測定、比較、改善を継続します。

同じ Harness をモデル学習、システム最適化、数学、科学データ解析、分子設計、ゲーム、音楽、プロシージャル 3D 制作に適用できます。

Experience Bank が再帰的改善を支える仕組み

Context Agent は過去のコード、ファイル、ログ、成果物、スコア、評価コメントから多様な発想コンテキストを作ります。短い要約ではなく、実行可能な証拠が残ります。

複数の Proposal Agent が異なるコンテキストを並列処理し、solve.sh を入口とする新しい解法を書きます。候補はクリーンなサンドボックスで実行・採点され、Experience Bank に戻ります。

Hyra が評価器も改善する理由

強い探索は指標の穴をすぐ見つけます。公式記事では、未来 token の漏洩で loss を不正に下げた例や、正当性検査時に結果をキャッシュし計測時には何もしない GPU kernel の例が示されています。

評価が弱い課題では、内側ループが解法を改善し、外側ループが評価速度、精度、reward hacking 耐性、改善余地を高めます。

AI エンジニアリングと科学的発見の成果

初期成果では、NanoChat で validation BPB 0.9015、NanoGPT で validation loss 3.28 まで 76.4 秒、SOL-ExecBench で Mean SOL 0.771 を達成しました。

公式リポジトリには数学最適化、packing、量子 routing、記号予測、分子 docking、小型ネットワークもあり、15 パラメータで 10 桁加算を行う Transformer も含まれます。

First Autocorrelation Inequality における Hyra の公式成果
First Autocorrelation Inequality の記録を更新した Hyra の公式成果物。

8月に公開された4つの数学的前進

8月19日の更新では、3D Blaschke–Lebesgue 下界が 0.380799w³ から 0.411040w³ 超へ、Beurling–Ahlfors 係数が 1.575 から 1.523958 へ、部分 Hadamard 行列の既知指数が 3 から 2 へ、交換子構成が O(log⁴(1/ε)) から O(log³(1/ε)) へ改善しました。

リポジトリには原稿と、3つの新成果について有限・数値コアの Lean 4 形式化が含まれます。

Hyra の 3D 実験が示すもの

Hyra は単一の 2D 参照を受け取り、Blender Python を書いてレンダリングし、rubric ベースの視覚言語モデルで輪郭、比率、構造、材質、類似度を採点します。

公開成果物にはプロシージャル QQ ペンギンと Hunyuan ロゴ球体があります。コード駆動の Blender モデリングで、視覚フィードバックを測定可能な 3D 改善へ変換する例です。

2D 参照から Blender 3D モデルを改善する Hyra の公式アニメーション
公式 3D 実験:評価を重ねるごとにモデリングコードとレンダー設定が改善します。

よくある質問

Hyra は Hunyuan Research Agent の略です。Hyra-1.0 は性能重視の科学・工学課題向け自律研究フレームワークです。

エージェントフレームワークです。コンテキスト選択、並列提案、サンドボックス、評価器、Experience Bank を協調させます。

各実行のコード、成果物、ログ、スコア、フィードバックを Experience Bank に戻します。次のエージェントが履歴を利用し、外側ループは評価器も再設計できます。

Hyra-results は Apache 2.0 で公開され、成果物と再現スクリプトを含みます。2026年8月25日時点では結果リポジトリであり、完全な Hyra Harness のワンコマンド配布ではありません。

はい。公式デモでは 2D 参照から Blender Python を生成・改善します。一般的な image-to-mesh ではなく、コード生成と視覚評価のループです。

学習、速度、GPU kernel、数学、packing、小型ネットワーク、docking、量子 routing、予測、ゲーム、音楽、プロシージャル 3D の成果物があります。

画像から編集可能な 3D の出発点を作成

ブラウザでテクスチャ付きのキャラクター、プロップ、製品、シーン素材を生成します。

Image to 3D を試す