짧은 결론
Hyra는 Hunyuan Research Agent의 약자입니다. 해법을 제안하고 격리된 샌드박스에서 실행·평가한 뒤 코드, 로그, 결과물, 평가 피드백을 Experience Bank에 저장합니다. 여러 에이전트가 병렬로 탐색하며 외부 루프는 평가기 자체도 개선할 수 있습니다.
핵심 요약
핵심 루프: 새 샌드박스에서 해법을 실행·평가하고 전체 결과를 다음 탐색에 다시 투입합니다.
공유 메모리: Experience Bank는 소스 코드, 결과물, 로그, 점수, 평가 피드백을 보존합니다.
평가기 진화: 해법과 채점 시스템을 함께 개선해 맹점과 reward hacking을 줄입니다.
공개 근거: 공식 저장소는 AI4AI, AI4Science, AI4Fun의 결과물과 재현 스크립트를 Apache 2.0으로 공개합니다.
Hyra 연구 루프 한눈에 보기
| 항목 | 입력 | 핵심 작업 | 출력 |
|---|---|---|---|
| 01 · Context | 과제 정의와 누적된 Experience Bank. | 코드, 결과물, 로그, 점수, 피드백에서 다양한 컨텍스트를 구성. | 병렬 탐색을 위한 여러 연구 방향 큐. |
| 02 · Propose | 큐에서 가져온 하나의 영감 컨텍스트. | 이전 시도를 반성하고 solve.sh로 실행 가능한 새 해법 작성. | 격리 실행할 수 있는 완전한 후보 해법. |
| 03 · Evaluate | 후보 해법과 과제 전용 평가기. | 새 샌드박스에서 실행, 검증, 측정하고 로그와 결과물 저장. | 평가 후 Experience Bank로 돌아가는 시도. |
| 04 · Evolve | 최고 해법과 평가기 약점의 증거. | 평가 속도, 세분성, 견고성, 지표 악용 저항성 향상. | 다음 연구 주기를 위한 더 강한 탐색 환경. |
Hyra란 무엇인가
Hyra-1.0은 성능 중심 연구·엔지니어링 과제를 위한 Tencent Hunyuan Research Agent입니다. 한 번 답하는 대신 해법 작성, 실행, 측정, 비교, 개선을 계속합니다.
동일한 Harness를 모델 학습, 시스템 최적화, 수학, 과학 데이터 분석, 분자 설계, 게임, 음악, 프로시저럴 3D 제작에 적용할 수 있습니다.
Experience Bank가 재귀 개선을 만드는 방식
Context Agent는 이전 코드, 파일, 로그, 결과물, 점수, 피드백에서 다양한 영감 컨텍스트를 구성합니다. 짧은 요약이 아니라 실행 가능한 증거를 남깁니다.
여러 Proposal Agent가 서로 다른 컨텍스트를 병렬로 처리하고 solve.sh를 진입점으로 하는 새 해법을 작성합니다. 각 후보는 깨끗한 샌드박스에서 실행·평가된 뒤 Experience Bank로 돌아갑니다.
Hyra가 평가기도 개선하는 이유
강력한 탐색은 지표의 허점을 빠르게 찾습니다. 공식 글은 미래 token을 누출해 loss를 인위적으로 낮춘 해법과 정확성 검사 때 결과를 캐시하고 측정 때 아무 작업도 하지 않은 GPU kernel 사례를 공개합니다.
평가가 약한 과제에서는 내부 루프가 해법을 개선하고 외부 루프가 평가 속도, 정밀도, reward hacking 저항성, 실제 진전 판별력을 높입니다.
AI 엔지니어링과 과학 발견 성과
초기 공개 결과에서 Hyra는 NanoChat validation BPB 0.9015, NanoGPT validation loss 3.28까지 76.4초, SOL-ExecBench Mean SOL 0.771을 기록했습니다.
공식 저장소는 수학 최적화, packing, 양자 routing, 기호 예측, 분자 docking, 소형 신경망도 다루며 10자리 덧셈을 수행하는 15-parameter Transformer도 포함합니다.

8월에 공개된 네 가지 수학적 진전
8월 19일 업데이트에서 3D Blaschke–Lebesgue 하한은 0.380799w³에서 0.411040w³ 이상으로, Beurling–Ahlfors 계수는 1.575에서 1.523958로, 부분 Hadamard 행렬의 알려진 지수는 3에서 2로, 교환자 구성은 O(log⁴(1/ε))에서 O(log³(1/ε))로 개선됐습니다.
저장소는 원고와 함께 세 가지 새 결과의 유한 또는 수치 핵심에 대한 Lean 4 형식화를 제공합니다.
Hyra의 3D 실험이 보여주는 것
Hyra는 단일 2D 참조를 받아 Blender Python을 작성하고 렌더링한 뒤 rubric 기반 비전 언어 모델로 실루엣, 비율, 구조, 재질, 유사성을 평가합니다.
공개 결과물에는 프로시저럴 QQ 펭귄과 Hunyuan 로고 구체가 있습니다. 코드 기반 Blender 모델링으로, 시각 피드백을 측정 가능한 3D 개선으로 바꾸는 사례입니다.

자주 묻는 질문
Hyra는 Hunyuan Research Agent의 약자입니다. Hyra-1.0은 성능 중심 과학·엔지니어링 과제를 위한 Tencent의 자율 연구 프레임워크입니다.
에이전트 프레임워크입니다. 컨텍스트 선택, 병렬 제안, 샌드박스, 평가기, Experience Bank를 조정합니다.
각 실행의 코드, 결과물, 로그, 점수, 피드백이 Experience Bank로 돌아갑니다. 다음 에이전트가 이 이력을 활용하고 외부 루프는 평가기도 다시 설계할 수 있습니다.
Hyra-results는 Apache 2.0으로 공개되어 결과물과 재현 스크립트를 포함합니다. 2026년 8월 25일 현재 완전한 Hyra Harness의 원클릭 배포본이 아니라 결과 저장소입니다.
네. 공식 데모는 2D 참조에서 Blender Python을 작성하고 개선합니다. 일반적인 image-to-mesh 모델이 아니라 코드 생성과 시각 평가 루프입니다.
학습, 속도, GPU kernel, 수학, packing, 소형 신경망, docking, 양자 routing, 예측, 게임, 음악, 프로시저럴 3D 결과물이 공개되어 있습니다.
