출처
- source_url: https://aisparkup.com/posts/14841
- author: Spark
- published: Thu, 30 Jul 2026 02:15:13 +0000
- raw: raw source:
2026-07-30-aisparkup-post-14841-ai-metr
개요
METR은 AI 에이전트와 사람이 같은 문제를 개선하는 데 필요한 비용을 비교하는 ‘지출 지평선(expenditure horizon)’ 지표를 제안했습니다. 이 지표는 단순한 성공·실패가 아니라, 추가 비용에 따라 성능이 얼마나 개선되는지를 달러 기준으로 비교합니다. NanoGPT 스피드런에 적용한 결과, AI 에이전트의 지출 지평선은 모델과 조건에 따라 0~3,300달러로 측정됐습니다. 반면 해당 프로젝트에서 사람들의 누적 노력은 약 25만 달러 규모로 추정됐습니다. 다만 METR은 사람의 작업 시간 추정과 AI 에이전트 결과 모두에 상당한 불확실성이 있다고 설명합니다.
핵심 포인트
- ‘지출 지평선’은 AI와 사람이 동일한 문제를 개선하는 데 필요한 비용 곡선을 비교해, 두 비용이 같아지는 지점을 측정하는 지표입니다.
- 기존의 합격·불합격식 벤치마크와 달리, 비용을 추가했을 때 성능이 얼마나 개선되는지를 연속적인 곡선으로 분석합니다.
- AI 실행 비용, 실험에 필요한 연산 비용, 사람의 노동 시간을 모두 달러로 환산해 비교합니다.
- NanoGPT 스피드런에서는 2024년 5월 이후 82단계의 개선을 통해 훈련 시간이 45분에서 2분 미만으로 단축됐습니다.
- 사람의 개선 비용은 1%포인트당 평균 16시간, 시급 150달러 기준 약 2,500달러로 추정됐습니다.
- 6개 AI 에이전트 모델을 평가한 결과, 지출 지평선은 0~3,300달러 범위였습니다.
- 사람의 작업 시간 대부분이 실패한 아이디어에 사용됐다는 점도 인터뷰에서 확인됐지만, 이 비용 추정치는 불확실성을 포함합니다.
왜 중요한가
AI를 도입할 때는 작업을 수행할 수 있는지뿐 아니라, 어느 수준까지 비용을 투입하는 것이 경제적인지도 판단해야 합니다. 지출 지평선은 AI의 성능을 고정된 점수로 평가하기보다, 비용 증가에 따른 개선 폭과 사람의 대체 비용을 함께 분석할 수 있는 관점을 제공합니다. 다만 이번 NanoGPT 사례만으로 모든 업무에서 AI가 사람보다 저렴하다고 일반화할 수는 없으며, 작업 난이도·모델 성능·사람의 비용 산정 방식에 따라 결과가 달라질 수 있습니다.
참고 링크
- 원문: https://aisparkup.com/posts/14841
- METR: Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT
- The Decoder: METR introduces a new metric to calculate exactly when AI agents become more expensive than humans
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-07-30-aisparkup-post-14841-ai-metr에 source_url 및 HTML 원문과 함께 저장되어 있습니다.