출처

원문

개요

Google DeepMind가 2026년 7월 30일 전신 제어, 정교한 조작, 멀티 로봇 협업을 지원하는 Gemini Robotics 2 제품군을 공개했다. 모델은 행동을 수행하는 VLA, 작업을 계획·오케스트레이션하는 ER 2, 로봇 내부에서 실행되는 On-Device 2의 세 가지 구성으로 나뉜다. ER 2는 비디오·오디오·텍스트를 바탕으로 여러 단계의 작업을 계획하고 진행 상황과 실패 여부를 추적한다. On-Device 2는 200개 미만의 예제와 몇 시간의 적응만으로 새로운 양팔 로봇에 적용할 수 있다고 소개됐다.

핵심 포인트

  • 세 가지 모델 스택: Gemini Robotics 2는 시각·언어 입력을 행동으로 변환하는 VLA, 고수준 작업 계획과 도구 오케스트레이션을 담당하는 ER 2, 네트워크 없이 로봇 하드웨어에서 실행되는 On-Device 2로 구성된다.
  • 전신 지능: 휴머노이드가 걷고, 몸을 굽히고, 쪼그려 앉고, 물건을 집는 등 발끝부터 손끝까지 전신을 함께 제어하는 작업을 목표로 한다. Apollo 로봇의 전신 조작 정확도는 테이블·바닥·선반에서 각각 68.4%, 45.7%, 76.3%로 제시됐다.
  • 정교한 조작: SharpaWave 5손가락·22자유도 핸드와 Franka FR3 Duo의 2지 그리퍼를 대상으로 매듭 묶기, 지퍼백 밀봉, 정밀 삽입, 도구 키팅 등의 작업을 수행했다.
  • 에이전틱 추론과 시간적 지능: ER 2는 VLA나 내비게이션 API를 도구로 호출하고, 작업 진행률·실패 여부·완료 시점을 비디오에서 판단해 필요한 단계만 재시도하도록 설계됐다. 원문에 따르면 진행률 분류 정확도는 57.4%, 순간 포착 정확도는 91.3%였다.
  • 멀티 로봇 협업: Apollo 2와 Franka 모바일 FR3 Duo처럼 서로 다른 로봇이 공유된 의미 이해를 바탕으로 작업을 나누고 협업하는 기능이 처음 도입됐다.
  • 온디바이스 실행과 안전성: On-Device 2는 새로운 로봇에 적은 예제로 적응하는 것을 목표로 하며, ER 2에는 안전하지 않은 도구 호출 거부와 인간 근접 감지 등을 평가하는 ASIMOV-Agentic 벤치마크가 적용됐다. 모델 카드에서는 의료·교통 등 안전 필수 환경에서 사용하지 말 것을 명시한다.

왜 중요한가

이번 발표는 로봇 AI의 범위를 고정된 탁상 조작에서 이동·균형·전신 조작·다단계 작업·멀티 로봇 협업으로 확장하려는 시도를 보여준다. 특히 추론 모델과 행동 모델, 온디바이스 모델을 분리해 구성함으로써 고수준 계획과 저수준 제어, 네트워크 연결이 제한된 환경을 각각 다루려는 구조가 제시됐다. 다만 성능 수치는 원문에서 소개한 벤치마크 결과이며, 이동 속도 개선 필요성과 안전 필수 환경에서의 사용 제한도 함께 고려해야 한다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-01-pytorchkr-topic-11488-google-deepmind-gemini-robotics-2source_url 및 HTML 원문과 함께 저장되어 있습니다.