출처

개요

GRAM(Gradient-Routed Auxiliary Modules)은 이중용도 지식을 별도 보조 모듈에 학습시켜, 배포 시 특정 능력 모듈만 활성화하거나 제거할 수 있도록 설계한 사전학습 접근 제어 기법입니다. 기존의 거부 학습·분류기는 지식 자체를 제거하지 않아 탈옥에 취약할 수 있고, 데이터 필터링은 강력하지만 능력 프로파일마다 별도의 사전학습이 필요하다는 비용 문제가 있습니다. GRAM은 하나의 모델 안에 항상 활성인 코어 MLP와 도메인별 보조 모듈을 두고, 데이터 라벨에 따라 그래디언트가 업데이트되는 파라미터를 제한합니다. 논문은 통제된 동화 데이터셋 실험과 50M~5B 파라미터 규모의 분석을 통해, 한 번의 학습으로 여러 데이터 필터링 모델에 가까운 능력 프로파일을 구성할 수 있는지 평가했습니다. 다만 글에서 소개한 결과는 특정 실험 설정에 기반하므로, 실제 대규모·다양한 도메인에서의 일반화와 보안성은 추가 검증이 필요합니다.

핵심 포인트

  • 지식의 저장 위치를 학습 전에 지정: 바이러스학, 사이버보안 등 특정 도메인의 데이터가 모델 전체로 퍼지는 것을 줄이고, 해당 도메인 전용 보조 모듈에 주로 축적되도록 합니다.
  • 그래디언트 라우팅 사용: 순전파에서는 코어와 보조 모듈이 함께 예측에 참여할 수 있지만, 역전파에서는 데이터 유형에 따라 업데이트할 파라미터를 분리합니다.
  • MoE와의 차이: 학습된 라우터가 토큰별 전문가를 선택하는 방식이 아니라, 사전에 부여된 데이터 라벨로 모듈 활성화와 그래디언트 업데이트를 결정합니다.
  • 두 가지 주요 하이퍼파라미터: p_as는 보조 데이터가 공유 코어를 업데이트할 확률로, 높을수록 공유 표현과 일반 성능은 좋아지지만 제거 대상 능력이 코어에 다시 섞일 수 있습니다. p_cr은 코어 데이터 학습 중 보조 모듈을 함께 활성화할 확률로, 모듈 조합 변화에 대한 코어의 안정성을 조절합니다.
  • 하나의 모델에서 여러 프로파일 구성: 보조 모듈을 켜거나 끄는 방식으로 여러 능력 조합을 제공할 수 있으며, 실험 설정에서는 보조 모듈 4개로 최대 16가지 구성을 만들 수 있습니다.
  • 연속적인 능력 조절 가능성: 부록의 적정 실험에서는 보조 모듈의 기여도를 0~1 사이의 연속값으로 조정해, 능력을 이진적으로만 켜고 끄는 것보다 세밀한 접근 수준을 시험했습니다.
  • 실험 결과: SimpleStories 실험에서 GRAM은 유지 능력과 코어 성능을 데이터 필터링 방식에 가깝게 보존하면서, 제거 대상 능력의 성능을 낮추는 균형을 보였습니다. 글에 제시된 집계값은 GRAM의 Core 0.938, Retain 0.952, Forget 0.766, Elicited Forget 0.855입니다.

왜 중요한가

GRAM은 위험한 지식을 모델에서 완전히 제거하거나 모델의 행동 계층에서만 거부하는 대신, 사전학습 단계에서 지식의 파라미터 위치를 분리해 배포 시 접근 권한을 조절하려는 접근입니다. 이 방식이 충분히 검증된다면 동일한 기반 모델에서 일반 사용자용, 연구자용, 특정 전문기관용 능력 프로파일을 구성하면서 프로파일별 전체 모델 재학습과 다중 체크포인트 배포 비용을 줄일 가능성이 있습니다. 특히 논문은 데이터 필터링의 강한 망각 특성을 하나의 학습 과정으로 근사하려는 점을 주요한 비교 기준으로 삼습니다. 반면 도메인 라벨의 품질, 모듈 간 지식 누수, 적대적 미세조정 이후의 능력 회복, 실제 프론티어 모델 규모에서의 성능은 별도로 확인해야 할 쟁점입니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-29-pytorchkr-topic-11443-gram-dual-use-feat-anthropicsource_url 및 HTML 원문과 함께 저장되어 있습니다.