출처
- source_url: https://discuss.pytorch.kr/t/value-axes-claude-feat-anthropic/11260
- author: 9bow
- published: Tue, 21 Jul 2026 09:30:03 +0000
- raw: 2026-07-21-pytorchkr-topic-11260-value-axes-claude-feat-anthropic
요약
원문 URL: https://discuss.pytorch.kr/t/value-axes-claude-feat-anthropic/11260
Hermes CLI 요약 생성에 실패하여 원문 앞부분 기반의 임시 요약을 저장합니다.
원문 발췌
모델과 언어에 따라 달라지는 Claude의 가치관1536×1024 179 KB 가치 축(Value Axes)이라는 렌즈로 본 Claude 친구와의 갈등을 어떻게 풀지, 새 직장으로 옮겨야 할지처럼 보편적인 정답이 없는 질문을 던졌을 때, 답하는 쪽은 좋든 싫든 어떤 가치관을 드러내게 됩니다. 사람도 그렇고, 대규모 언어 모델(Large Language Model)도 마찬가지입니다. 문제는 그 가치관을 어떻게 눈으로 확인하고 비교하느냐입니다. 이 연구는 Anthropic이 실제 Claude.ai 대화 수십만 건을 분석해서, Claude가 대화에서 드러내는 가치(value)가 모델 버전과 대화 언어에 따라 어떻게 달라지는지를 측정한 실증 연구입니다. 핵심 도구는 수천 개나 되는 가치를 네 개의 가치 축(Value Axes) 으로 압축하는 방법입니다. 각 축은 서로 대비되는 두 가치 무리를 양 끝에 둔 수직선이고, Claude가 그 선 위 어디에 놓이는지가 곧 어느 쪽 가치로 기우는지를 알려줍니다. 여기서 ‘가치’란 정직이나 신중함처럼 Claude의 응답에 나타나거나 드러나는 규범적 고려사항을 가리킬 뿐, Claude가 그것을 인간처럼 내면에 지니고 있다는 뜻은 아닙니다. 3,000개가 넘는 가치를 어떻게 다룰 것인가 Anthropic이 Claude에게 심어주려는 가치는 Claude의 헌법(Constitution)에 큰 틀로 적혀 있습니다. 하지만 매일 수백만 건씩 일어나는 대화에서 어떤 가치가 튀어나올지를 문서 하나로 미리 다 규정할 수는 없습니다. 그래서 Anthropic은 규칙을 촘촘히 못박기보다 “맥락에 맞게 적용할 수 있는 좋은 판단력과 건전한 가치관” 을 Claude 안에 …
관련 위키
원문 보존 위치
원문 전체는 2026-07-21-pytorchkr-topic-11260-value-axes-claude-feat-anthropic에 source_url 및 HTML 원문과 함께 저장되어 있습니다.