출처
- source_url: https://discuss.pytorch.kr/t/enpire-feat-nvidia/11068
- author: 9bow
- published: Mon, 27 Jul 2026 03:30:49 +0000
- raw: raw source:
2026-07-27-pytorchkr-topic-11068-enpire-feat-nvidia
개요
ENPIRE는 코딩 에이전트가 실제 로봇에서 조작 정책을 학습하고 개선할 수 있도록 설계된 물리적 자율연구(physical autoresearch) 프레임워크입니다. 연구팀은 자동 검증, 자동 리셋, 정책 개선, 다중 로봇 병렬 평가를 연결해 사람이 반복적으로 실험을 관리하던 과정을 폐루프 시스템으로 구성했습니다. ENPIRE는 먼저 사람의 피드백으로 실험 환경을 구축하는 EN 단계와, 이후 실세계 피드백만으로 정책을 개선하는 PIRE 단계로 나뉩니다. Push-T, 핀 삽입, GPU 삽입, 케이블 타이 자르기 등의 과제에서 코딩 에이전트가 휴리스틱·행동 복제·강화학습 등을 조합해 정책을 개선했습니다. 원문은 일부 과제에서 최대 99% 성공률과 핀 삽입 정책의 100% 수렴 사례를 보고하며, 로봇 함대 확장 시 목표 성능까지의 벽시계 시간이 단축된 결과를 제시합니다.
핵심 포인트
- 실세계 피드백 루프 추상화: ENPIRE는 환경 리셋(Environment), 정책 개선(Policy Improvement), 롤아웃(Rollout), 진화(Evolution)를 결합해
리셋 → 실행 → 검증 → 개선과정을 자동화합니다. - 자동 검증과 보상 함수 합성: 코딩 에이전트가 영상, 고유수용성, 토크 등 여러 센서 신호를 조합해 이진 보상 함수를 만들고, 성공·실패를 사람이 직접 판정하지 않도록 합니다.
- 자동 리셋과 하드 안전 제약: SAM3, BundleSDF, cuRobo 등의 도구를 조합해 실패한 환경을 특정 시작 상태로 복구하며, 구성 공간과 힘의 한계를 넘으면 실패 처리와 리셋을 수행합니다.
- 두 단계 자율연구: EN 단계에서는 사람의 시연과 요구사항을 바탕으로 환경 API를 만들고, PIRE 단계에서는 에이전트가 문헌 검토·가설 수립·코드 수정·실세계 평가를 반복합니다.
- 다양한 정책 개선 방식: 행동 복제, 실세계 강화학습, 휴리스틱 학습, 코드 기반 정책 합성 등을 과제에 따라 선택하거나 조합합니다.
- Git 기반 멀티 에이전트 협업: 8개의 양팔 로봇 스테이션과 에이전트가 각자의 브랜치에서 실험하고, 코드·설정·결과를 커밋과 병합으로 공유합니다.
- 시뮬레이션과 실세계의 차이: 시뮬레이션에서는 쉽게 해결된 Push-T가 실세계에서는 일부 에이전트에게 어려웠으며, 비결정적인 동역학·마찰·접촉이 물리적 자율연구의 주요 난점으로 나타났습니다.
왜 중요한가
ENPIRE의 핵심 의미는 로봇 학습에서 사람이 담당하던 데이터 수집, 환경 복구, 성공 판정, 알고리즘 수정의 반복 작업을 에이전트가 실행 가능한 인터페이스로 전환했다는 데 있습니다. 특히 실제 로봇의 실패와 회복을 정책 개선 과정의 일부로 포함하고, 여러 로봇을 병렬로 운용해 물리적 실험의 처리량을 높이려는 접근을 제시합니다. 다만 실세계의 비결정성, 로봇 하드웨어 안전성, 에이전트의 로봇 활용률과 실험 자원 효율은 여전히 해결해야 할 과제로 남아 있습니다.
후속으로 볼 링크 및 키워드
- 원문: https://discuss.pytorch.kr/t/enpire-feat-nvidia/11068
- ENPIRE 프로젝트: https://research.nvidia.com/labs/gear/enpire/
- The AI Scientist: https://arxiv.org/abs/2408.06292
- Andrej Karpathy의 autoresearch: https://github.com/karpathy/autoresearch
- Voyager: https://arxiv.org/abs/2305.16291
- Eureka: https://arxiv.org/abs/2310.12931
- CaP-X: https://arxiv.org/abs/2603.22435
- cuRobo: https://curobo.org/
- 관련 키워드:
physical autoresearch,coding agent,robot policy learning,real-world reinforcement learning,automatic reset,automatic reward verification,multi-robot fleet,code-as-policy,SERL
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-07-27-pytorchkr-topic-11068-enpire-feat-nvidia에 source_url 및 HTML 원문과 함께 저장되어 있습니다.