한 줄 요약
anthropic의 Project Fetch 2단계는 claude-opus-4.7이 Claude Code 환경에서 기성 사족보행 로봇의 센서 연결·제어 프로그램 작성·공 탐지 같은 고수준 로봇 사용 과제를, 2025년 인간+Claude 팀보다 훨씬 빠르게 수행했지만 정밀한 폐루프 물리 제어에는 아직 실패했다는 연구 노트다.
한국어 번역 요지
2025년 8월의 1단계 Project Fetch에서 anthropic은 로봇공학 전문가가 아닌 직원들에게 사족보행 로봇(robodog)을 다루게 했다. 한 팀은 Claude를 쓸 수 있었고, 다른 팀은 인터넷과 자체 역량만 사용할 수 있었다. Claude 사용 팀은 훨씬 더 빠르고 많은 일을 해냈지만, 당시 Claude Opus 4.1 단독으로는 로봇 연결이라는 초기 단계부터 막혀 완전 자율 수행이 불가능했다.
2단계에서는 같은 문제를 최신 모델로 다시 실험했다. 연구팀은 claude-opus-4.7을 Claude Code 안에서 maximum effort의 adaptive thinking으로 실행하고, 물리 컨트롤러 직접 조작을 제외한 과제들을 세 차례 반복했다. 연구자는 노트북을 로봇에 연결하고 초기 프롬프트를 입력하며 명령과 다음 단계 진행을 승인하는 역할만 맡았다.
결과는 뚜렷했다. 1단계에서 적어도 한 인간 팀이 완료했던 모든 과제에서 Opus 4.7은 같은 과제를 최소 10배 빠르게 완료했다. 두 인간 팀이 모두 완료한 네 가지 과제만 보면, Opus 4.7은 Claude가 없던 팀보다 평균 37배 이상, Claude를 쓰던 팀보다 평균 18배 이상 빨랐다. 네 과제 총 시간은 Claude-less 팀 361분, Claude 팀 181분, Opus 4.7 단독 9분 35초였다.
5개 테스트 과제 전체 기준으로도 Claude 팀은 264분이 걸렸고, Opus 4.7은 세 번 평균 12분 7초가 걸렸다. 모델은 센서 인터페이스 선택에서 빠르게 유효한 경로를 찾았고, 작성한 코드 상당수가 첫 시도에 작동했다. 코드량도 Claude 팀의 10,309줄에 비해 Opus 4.7은 1,045줄로 훨씬 적었다.
다만 이 결과가 로봇공학의 해결을 뜻하지는 않는다. 모델은 오래된 객체 탐지 알고리즘을 고르는 등 완벽하지 않았고, 해변공을 정밀하게 밀어 출발 지점으로 되돌리는 마지막 “fetch” 과제에는 실패했다. 이 과제는 공이 빗나갔는지 즉시 보고, 이전 명령과 오차의 관계를 해석하고, 다음 입력을 미세하게 조정하는 폐루프 제어 능력이 필요했다.
Anthropic의 해석은 모델 능력의 단계 변화다. 먼저 모델이 인간을 돕고, 다음에는 인간이 모델을 돕다가, 제한된 범위에서는 모델이 스스로 수행하게 된다. 이 패턴은 이미 사이버보안과 소프트웨어 도구 사용에서 관찰되었고, 이제 물리 세계의 기성 도구 사용에서도 초기 형태가 보이기 시작한다.
핵심 수치
| 항목 | 값 |
|---|---|
| 원문 공개일 | 2026-06-18 |
| 실험 모델 | Claude Opus 4.7 |
| 실행 환경 | Claude Code, adaptive thinking, maximum effort |
| 반복 횟수 | 3회 |
| 네 공통 과제 총 시간 — Claude-less 팀 | 361분 |
| 네 공통 과제 총 시간 — Claude 팀 | 181분 |
| 네 공통 과제 총 시간 — Opus 4.7 | 9분 35초 |
| 5개 테스트 과제 — Claude 팀 | 264분 |
| 5개 테스트 과제 — Opus 4.7 평균 | 12분 7초 |
| 작성 코드량 — Claude 팀 | 10,309 LOC |
| 작성 코드량 — Claude-less 팀 | 1,136 LOC |
| 작성 코드량 — Opus 4.7 | 1,045 LOC |
의미
- 고수준 도구 사용의 자동화: 모델이 저수준 actuation policy를 직접 학습한 것이 아니라, 기존 로봇·센서·코딩 도구를 연결하고 사용하는 능력이 크게 향상되었다.
- Claude Code의 범용 하네스화: Claude Code는 코딩 도구를 넘어 물리 시스템을 다루는 운영 하네스처럼 쓰였다.
- 에이전트 전환 패턴: “인간 보조 → 인간이 모델 보조 → 제한된 자율 수행”이라는 흐름이 소프트웨어에서 물리 도구로 확장되는 신호다.
- 남은 병목은 폐루프 제어: 공을 정밀하게 밀어 목표 지점으로 보내는 작업처럼, 빠른 지각-행동 피드백과 물리적 오차 보정이 필요한 과제는 아직 약하다.
위키 연결
- moc-ai-agents — 에이전트가 소프트웨어 도구를 넘어 물리 도구를 사용하는 사례로 분류.
- moc-claude-code — Claude Code가 로컬 코드 실행뿐 아니라 외부 하드웨어 실험의 하네스로 쓰인 사례.
- anthropic — Anthropic의 Frontier Red Team 연구.
- claude-opus-4.7 — 실험에서 강조된 모델.
내 해석
Project Fetch Phase Two의 핵심은 “로봇 지능”보다는 “도구 결합 능력”이다. 모델은 로봇을 몸처럼 제어한 것이 아니라, 센서·SDK·네트워크·코드 작성·실행 승인 흐름을 빠르게 조립했다. 따라서 이 결과는 물리 에이전트의 완성보다, harness가 물리 세계로 확장될 때 어떤 작업부터 자동화되는지 보여주는 사례에 가깝다.
반대로 실패한 fetch 과제는 현재 LLM 기반 에이전트의 경계도 잘 보여준다. 문서·코드·API처럼 느린 피드백과 명시적 상태를 다루는 영역에서는 빠르게 인간을 추월하지만, 물리 오차가 즉시 누적되고 센서-행동 루프를 안정적으로 닫아야 하는 영역에서는 별도의 제어 계층이나 더 강한 scaffolding이 필요하다.