출처

AI 에이전트 명령 승인, 사람은 위협 3건 중 1건을 놓쳤다

개요

코딩 에이전트의 명령 승인 브라우저 게임에서 약 4만 판, 40만 9천 건의 승인·거부 판단이 수집됐으며, 위협 명령의 통과율은 유형별로 달랐다. 게임 참가자들은 rm -rf /처럼 파괴적인 명령은 비교적 잘 차단했지만, 자격증명 탈취나 데이터 유출처럼 조용히 실행되는 명령은 더 자주 승인했다. 전체 명령 중 위협 비중이 34%였고 참가자들이 시험 상황을 알고 있었으므로, 평균 정확도 66.3%를 실제 사고율로 해석해서는 안 된다. 이 결과는 사람의 승인 판단만으로 에이전트의 실행 안전성을 보장하기 어렵고, 샌드박스나 서버 측 권한 통제 같은 별도 경계가 필요하다는 점을 보여준다.

핵심 포인트

  • 파괴형 명령의 통과율은 11.7%였지만, 지속형 변조는 23.8%, 유출·코드 실행 계열은 33.4%, 권한 범위를 벗어난 파일 읽기는 35.0%였다.
  • npm run analyze는 64.7%가 승인했으며, package.json에 정의된 실제 스크립트가 외부 전송이나 악성 동작을 포함할 수 있다는 점이 충분히 반영되지 않았다.
  • 에이전트가 이미 package.json을 수정할 수 있는 상황에서는 개별 명령 승인만으로 실행 결과를 통제하기 어렵다.
  • 세션이 길어질수록 승인 피로로 인해 명령 검토 집중도가 떨어지는 경향이 나타났으며, 반대로 정상적인 명령도 차단되는 오탐 비용이 발생했다.
  • Zed는 터미널과 fetch 도구에 운영체제 수준의 샌드박싱을 적용해 프로젝트 외부 쓰기, .git 쓰기, 네트워크 요청 등을 기본 차단하는 방향을 택했다.
  • Cloudflare의 WriteGuard는 MCP 도구별 위험 등급을 서버에서 관리해 기록 또는 차단 여부를 결정하는 방식으로, 클라이언트 확인 프롬프트의 한계를 보완하려 했다.

왜 중요한가

승인 창에 표시된 명령만으로는 파일 내용, 환경변수, 스크립트 내부 동작, 네트워크 목적지까지 판단하기 어렵다. 따라서 사람의 주의력을 높이는 것만으로는 한계가 있으며, 에이전트가 실수하거나 악성 지시를 따르더라도 피해 범위를 제한할 수 있는 운영체제·프로토콜 수준의 권한 경계가 중요하다. 다만 이 게임 결과는 실제 개발 환경의 사고율을 측정한 자료가 아니라, 위협 유형별로 사람이 어떤 명령을 놓치기 쉬운지 비교한 참고 데이터로 보는 것이 적절하다.

원문 및 참고 링크

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-08-aisparkup-post-15071-ai-3-1source_url 및 HTML 원문과 함께 저장되어 있습니다.