출처
- 원문 URL: https://discuss.pytorch.kr/t/llm-anthropic-embody/11261
- 작성자: 9bow
- 원문 게시일: 2026-07-15
- raw: 2026-07-16-pytorchkr-embody-robot-control-benchmark
개요
Anthropic의 Embody는 언어 모델이 로봇을 얼마나 잘 제어하는지와 그 성능을 좌우하는 요인을 여러 모델·몸체·제어 인터페이스에서 비교한 벤치마크다. 연구는 직접 제어, 프로그래밍 제어, 사전 학습 정책 제어, 강화학습 감독을 고전 제어·보행/내비게이션·로봇 조작 영역에 적용했다. 최신 모델로 갈수록 성능은 개선됐지만, 관절 토크를 직접 다루는 저수준 제어는 여전히 어렵고 사전 학습 제어기·VLA·나침반 같은 도구를 붙이면 성능이 크게 상승했다. 이 결과는 LLM의 물리적 능력을 모델 단독 점수로 판단하기보다 로봇 몸체와 접근 가능한 정보·도구·제어 스택을 포함해 평가해야 함을 보여준다.
핵심 포인트
- Embody는 같은 모델을 네 가지 인터페이스로 비교한다: 관절 토크·힘을 매 스텝 출력하는 직접 제어,
controller(obs) -> action형태의 Python 프로그래밍 제어, 사전 학습 정책에 고수준 명령을 주는 정책 제어, 보상·정책·학습 일정을 설계하는 강화학습 감독. - 고전 제어에서는 최신 Claude 계열의 세대별 개선이 관찰됐고, 특히 첫 시도보다 실패 뒤 전략을 수정하는 반복·맥락 내 학습 능력에서 차이가 커졌다. 반면 RL 감독은 대부분 Python 제어기 작성보다 성능이 낮았다.
- 전체 물리 과제 정규화 평균은 게시글 기준 Claude Mythos Preview 0.389, Opus 4 0.115였다. 이는 세대별 향상을 보여주지만, 절대 점수가 아직 낮고 고수준 보행 점수는 이 평균에서 제외된다는 점을 함께 봐야 한다.
- 저수준 보행·조작은 여전히 취약했다. Go2 균형에서는 일부 모델이 프로그래밍 제어로 약 2초 가까이 버텼지만, G1 휴머노이드를 넘어진 상태에서 일으킨 모델은 없었고, LIBERO 직접 조작 전체 성공률도 0~5.5%에 머물렀다.
- 사전 학습 정책을 사용하면 성능이 크게 올라갔다. 고수준 Go2 보행에서는 Mythos Preview가 설정별 49~54점을 기록했고, MolmoAct VLA를 LLM이 감독하는 LIBERO-40에서는 모든 모델의 성공·진척이 직접 제어보다 증가했지만 VLA 단독보다 성능이 낮은 경우가 많았다.
- 도구의 형태가 중요했다. 보행에서는 로봇의 방위를 알려주는 나침반이 다른 시각 보조보다 크게 효과적이었고, 조작에서는 커서 도구가 Mythos Preview의 하위 집합 성공률을 6%에서 32%로 높였다. 반면 깊이 지도·분할 오버레이는 대체로 중립적이었다.
- 병목은 단순한 추론량보다 시각·공간 방향 감각과 짧은 시간 범위의 경험 활용에 가까웠다. 추가 추론은 많은 실험에서 효과가 작거나 오히려 방해가 됐고, 실물 Go2에서는 십자선 오판·깊이 정보 혼란·유리문 반사에 비친 목표를 추적하는 실패도 관찰됐다.
왜 중요한가
- 이 연구는 로봇 벤치마크의 결과가 모델 자체뿐 아니라 몸체, 관찰 입력, 액션 추상화 수준, 사전 학습 정책, 보조 도구의 조합에 크게 의존한다는 점을 분리해 보여준다.
- LLM이 저수준 관절 제어를 직접 잘하지 못해도 기존 정책을 감독하거나 로봇용 도구를 조합하는 방식으로 물리 세계에 영향을 줄 수 있다. 따라서 배포·안전 평가에서는 모델의 추상적 능력보다 실제 접근 권한과 제어 인터페이스를 함께 제한하고 측정해야 한다.
- 동시에 성공률이 낮고 실패 양상이 불균일하므로, 이 결과를 범용 로봇 제어 달성으로 해석해서는 안 된다. 연구가 제시하는 현재의 활용 가능성은 제어기 감독, 실패 디버깅, 학습 데이터 생성 쪽에 더 가깝다.
후속으로 볼 링크와 키워드
- 관련 위키: anthropic, 2026-06-19-anthropic-project-fetch-phase-two, 2026-07-08-pytorchkr-topic-11111-sonic-humanoid-whole-body-control-nvidia
- Anthropic Project Fetch: https://www.anthropic.com/research/project-fetch-phase-two
- 로봇·시뮬레이션: Unitree G1, Unitree Go2, MuJoCo
- 조작·VLA: LIBERO, MolmoAct
- 키워드:
Embody,embodied AI,physical AI,robot control,direct control,policy control,VLA,LIBERO,TwinFlipper,in-context learning,sim-to-real,robot safety