출처

핵심 요약

Sujin Kang의 게시물은 Anthropic의 연구를 바탕으로, Claude가 같은 질문에 답하더라도 사용 언어와 모델에 따라 표현하는 가치의 조합이 달라질 수 있다고 설명한다. 게시물의 제목인 “클로드는 한국어로 답할 때 따뜻해진다”는 한국어 응답에서 느껴지는 친근함·배려·간결함을 Anthropic의 가치 프로파일 연구와 연결한 해석이다.

다만 이 연구가 측정한 것은 모델이 실제로 어떤 내면적 가치를 가진다는 뜻이 아니라, 대화 응답에 어떤 가치가 표현되는지다. Anthropic도 이를 expressed values 또는 관찰 가능한 행동 경향으로 정의한다.

Anthropic 연구의 범위

Anthropic은 Claude.ai의 주관적 과제 대화 309,815건을 분석했다. 표본은 Sonnet 4.6, Opus 4.6, Opus 4.7 세 모델과 Claude.ai에서 많이 사용되는 20개 언어를 균등하게 구성해 모델·언어 조합당 약 5,000건의 대화를 포함했다. 대화의 과제·주제·사용자가 표현한 가치를 통제한 뒤, Claude 응답에서 표현된 가치의 변동을 비교했다.

분석은 선행 연구 2026-07-18-linkedin-sujin-claude-values-models-languages가 아니라 Anthropic의 Values in the Wild에서 발견한 3,307개 세부 가치를 339개 고수준 가치로 묶고, 함께 나타나는 경향을 차원 축으로 압축하는 방식이다. 네 개의 축이 통제 후 가치 변동의 15%를 설명한다는 것이 연구의 핵심 정량 결과다.

네 가지 가치 축

한쪽 경향반대쪽 경향
Deference ↔ Caution사용자의 요구·선호를 수용위험·오용 가능성을 경계
Warmth ↔ Rigor긍정·배려·격려·유머정확성·정밀성·투명성
Depth ↔ Brevity맥락·추론·깊이 있는 설명요청한 범위만 간결하게 수행
Candor ↔ Execution불확실성·한계·솔직함을 드러냄결과물 완성·실행을 우선

이 축들은 서로 배타적인 성격 유형이 아니다. 한 응답이 따뜻하면서도 엄밀할 수 있지만, 대규모 대화에서 어느 쪽 가치가 더 자주 전면에 나타나는지를 비교하는 도구다.

모델별 차이

Anthropic의 공식 연구는 모델에 대한 사용자의 인상과 측정된 가치 프로파일이 대체로 맞아떨어진다고 보고한다.

  • Sonnet 4.6: 사용자 요구에 더 맞추고, 따뜻함·유머·격려·판단 없는 위로를 더 표현하며, 상대적으로 간결한 편이다.
  • Opus 4.6: 엄밀함·수용·간결 쪽으로 기울고, 요청 범위 안에서 곧바로 답하는 경향이 나타난다.
  • Opus 4.7: 신중함·엄밀함·깊이·솔직함 쪽으로 기울며, 전제에 이의를 제기하거나 위험을 먼저 지적하고, 한계와 오류를 인정하며 이유를 더 자세히 설명하는 경향이 있다.

이는 claude-opus-4.7에서 다뤄온 “더 깊고 신중한 Opus 계열”이라는 사용자 경험을, 행동 데이터 기반 가치 축으로 관찰하려는 시도다.

언어별 차이

언어별로 가장 큰 차이는 Warmth ↔ RigorCandor ↔ Execution 축에서 나타났다.

  • 힌디어: 가장 따뜻한 쪽
  • 러시아어: 가장 엄밀한 쪽
  • 아랍어: 더 수용적이고 간결한 쪽
  • 영어: 더 신중하고 깊이 있는 쪽
  • 인도네시아어: 실행 쪽
  • 네덜란드어: 솔직함 쪽

게시물은 한국어 표본을 15,570건으로 소개하며, 한국어 Claude가 전체 평균보다 수용·따뜻함·간결함 쪽으로 기울고, 사용자의 말투·격식 맞추기, 판단 없는 위로, 유머가 특징적 행동으로 관찰됐다고 정리한다. 이 수치는 LinkedIn 게시물의 요약이며, 해석과 원 연구의 세부 방법은 Anthropic의 공식 글과 부록을 기준으로 확인해야 한다.

“영어로 프롬프트를 써야 더 정확한가?”에 대한 해석

게시물의 결론을 “영어 프롬프트가 항상 더 정확하다”로 읽으면 과도하다. 연구가 보여주는 것은 언어별로 응답의 가치 표현 스타일과 행동 경향이 달라진다는 것이지, 어느 언어가 모든 작업에서 객관적으로 더 높은 정답률을 보인다는 뜻은 아니다.

작업별로는 다음처럼 분리해 보는 편이 안전하다.

  • 정확성·정밀성·비판적 검토가 중요한 작업: 영어 또는 명시적으로 정확성·근거·불확실성 우선을 요구하는 프롬프트를 비교해 볼 수 있다.
  • 상담·아이디어 발산·창작·학습 동기 부여: 한국어의 따뜻함·격식 맞춤·간결함이 오히려 유용할 수 있다.
  • 실제 업무: 언어를 바꾸기 전에 동일한 입력을 언어별로 실행하고 정확성, 누락, 과도한 확신, 설명 깊이를 별도 eval로 측정해야 한다.

2026-07-03-pytorchkr-topic-11062-anthropic-claude-fable-5-prompting-guide의 프롬프팅 원칙과 결합하면, 단순히 영어를 선택하기보다 원하는 가치 축을 프롬프트에 명시하는 접근이 더 재현 가능하다. 예를 들어 “따뜻하게 답하되 정확성과 반례 검토를 우선하고, 모르는 내용은 명확히 표시하라”처럼 원하는 축을 직접 지정할 수 있다.

방법론과 한계

  • 네 축은 전체 가치 변동의 15%만 설명하므로 Claude의 행동을 완전히 설명하는 성격 모델이 아니다.
  • 가치 라벨링은 Claude 기반의 privacy-preserving 분석 도구로 수행되므로 라벨러의 관점이 분석 결과에 영향을 줄 수 있다.
  • 분석 대상은 주관적 과제 대화이며, 모든 지식·코딩·도구 사용 작업의 정확성을 평가한 결과가 아니다.
  • 언어별 차이가 문화적 맥락, 학습 데이터, 번역·표현 차이, 사용자 집단 차이 중 무엇에서 비롯되는지는 아직 분리되지 않았다.
  • 연구는 사용자가 선호하는 언어별 가치 프로파일을 말해주지 않는다. 따뜻함이 항상 더 좋은 것도, 엄밀함이 항상 더 좋은 것도 아니다.
  • 연구는 가치 표현을 측정했지만, 그것이 사용자의 신뢰·웰빙·의사결정 품질에 어떤 결과를 만드는지는 후속 연구 과제로 남겼다.

정석님 관점의 메모

이 연구는 “모델 성격”을 고정된 속성으로 보는 대신, 모델 × 언어 × 사용자 표현 × 과제 맥락이 만드는 실행 스타일로 보는 데 의미가 있다. 따라서 모델 선택과 프롬프트 설계를 다음처럼 분리할 수 있다.

  1. 원하는 결과의 품질 기준을 정확성·깊이·따뜻함·간결함·솔직함으로 분해한다.
  2. 모델과 언어를 바꿀 때 정답률뿐 아니라 가치 축별 행동 차이를 기록한다.
  3. 영어가 더 정확하다는 일반화를 하지 말고, 동일 과제의 언어별 paired eval을 만든다.
  4. 배포 프롬프트에는 원하는 가치 축과 금지할 실패 모드(과도한 확신, 불필요한 장황함, 무비판적 동조)를 명시한다.

관련 노트

검증 정보

  • LinkedIn 원문 캡처 SHA-256: 2022f228cc4488aa6665afab570648f0d21d3ac9543233ba30f8563ab5934f19
  • 해시 대상: raw/articles/2026-07-18-linkedin-sujin-claude-values-models-languages.md의 frontmatter 아래 원문 본문
  • LinkedIn 공개 페이지는 로그인 유도 영역을 포함하므로, 게시물 본문과 공개 댓글까지 Jina Reader로 캡처했다.
  • 연구의 모델·언어별 결과와 방법론은 Anthropic 공식 연구 페이지를 교차 확인했다.