출처

요약

원문 URL: https://discuss.pytorch.kr/t/jacobian-lens/11341

Hermes CLI 요약 생성에 실패하여 원문 앞부분 기반의 임시 요약을 저장합니다.

원문 발췌

Jacobian Lens: 언어 모델 내부 표현을 어휘 토큰으로 읽어내는 해석 도구1536×1024 275 KB Jacobian Lens 소개 언어 모델은 하나의 답을 내놓기까지 내부에서 방대한 계산을 수행하지만, 그 중간 활성화(activation)는 고차원 벡터라서 사람이 곧바로 읽을 수 없습니다. 어떤 레이어의 어떤 표현이 무엇을 담고 있는지 확인하려면 별도의 해석 도구가 필요합니다. 기존에는 로짓 렌즈(logit lens) 처럼 중간 활성화를 곧장 모델의 출력 어휘로 사영해 보는 방법이 쓰였지만, 이 방식은 모든 레이어가 같은 좌표계를 쓴다고 가정하기 때문에 초반 레이어에서는 해석하기 어려운 결과를 냅니다. Jacobian Lens(J-lens)는 Anthropic이 공개한 해석 도구로, 중간 레이어의 잔차 스트림(residual stream) 벡터를 최종 레이어의 기저로 선형 전송한 뒤 모델 자신의 언임베딩(unembedding)으로 디코딩 합니다. 이렇게 하면 특정 활성화가 모델이 앞으로 말하려는 어떤 토큰과 연결되어 있는지를 어휘 순위로 읽어낼 수 있습니다. 저자들은 이를 로짓 렌즈를 원칙적으로 다듬은 기법이라고 설명하며, 레이어마다 달라지는 표현 좌표계를 보정하기 때문에 로짓 렌즈가 실패하던 초반 레이어에서도 의미 있는 정보를 끌어낸다고 밝히고 있습니다. 이 저장소는 Anthropic의 “Verbalizable Representations Form a Global Workspace in Language Models” 연구의 동반 코드(companion code)입니다. 오픈 웨이트(open-weight) 디코더 트랜스…

관련 위키

원문 보존 위치

원문 전체는 2026-07-22-pytorchkr-topic-11341-jacobian-lenssource_url 및 HTML 원문과 함께 저장되어 있습니다.