출처

개요

Anthropic은 코딩·지식 노동·에이전트 작업을 위한 Claude Opus 5를 공개했으며, 게시글은 Fable 5에 가까운 성능을 절반 수준의 비용으로 제공한다고 소개합니다. Anthropic이 제시한 벤치마크에서 Opus 5는 Opus 4.8보다 대부분의 평가에서 크게 향상되었고, Frontier-Bench·GDPval-AA·ARC-AGI 3·OSWorld 2.0·AutomationBench 등에서 높은 점수를 기록했습니다. 특히 장시간 작업에서 스스로 결과를 검증하고 반복 수정하는 에이전틱 특성이 강조됩니다. 다만 벤치마크는 Anthropic이 공개한 결과이며, 일부 평가에서는 안전 분류기에 의한 거부 응답을 처리하는 방식이 결과에 영향을 줄 수 있습니다.

핵심 포인트

  • 비용 대비 성능: Frontier-Bench v0.1에서 Opus 5는 43.3%로 제시되었고, CursorBench 3.2에서는 Fable 5 최고 점수에 0.5% 이내로 접근하면서 비용은 절반 수준이라고 설명됩니다.
  • 주요 벤치마크 성과: Opus 5는 GDPval-AA v2 1861점, ARC-AGI 3 30.2%, OSWorld 2.0 70.6%, AutomationBench 26.0%를 기록했습니다. 게시글의 수치는 Anthropic이 제시한 비교 결과입니다.
  • 에이전트 작업 능력: 복잡한 코딩·디버깅 작업에서 근본 원인을 찾고, 테스트 하네스를 직접 만들며, 성공할 때까지 결과를 검증하고 반복하는 능력이 개선되었다고 소개됩니다.
  • 과학·시각 작업 개선: 구조 생물학·유기화학·생물정보학 평가가 Opus 4.8보다 향상되었으며, 코드 기반 그래픽·다이어그램·인터랙티브 결과물의 품질도 개선되었다고 설명됩니다.
  • 정렬과 안전성: Anthropic의 행동 감사에서 공개 모델 중 가장 낮은 비정렬 점수를 기록했다고 주장되지만, 공격적 사이버보안과 생물학 관련 위험 능력은 Mythos 5보다 낮게 유지되었다고 밝힙니다.
  • 가격과 이용: 입력은 100만 토큰당 5달러, 출력은 100만 토큰당 25달러이며, Fast 모드는 기본 가격의 2배입니다. API 모델 식별자는 claude-opus-5입니다.

왜 중요한가

Opus 5는 최고 성능 모델과 비용 효율적인 실무 모델 사이의 간극을 줄이려는 제품으로 볼 수 있습니다. 장시간 코딩, 디버깅, 업무 자동화처럼 단순 응답보다 계획 수립·도구 사용·검증·반복 실행이 중요한 에이전트 워크로드에서 비용과 안정성을 함께 고려할 선택지를 제공한다는 점이 핵심입니다. 다만 실제 도입 시에는 Anthropic 자체 평가와 파트너 사례만으로 판단하기보다, 사용하려는 작업의 성공률·토큰 비용·안전 분류기 동작·폴백 정책을 별도로 검증해야 합니다.

이용 및 후속 자료

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-27-pytorchkr-topic-11435-anthropic-fable-5-claude-opus-5source_url 및 HTML 원문과 함께 저장되어 있습니다.