원본: An Alien Mind — OpenAI (2026-09-06, Jakub Pachocki, OpenAI Chief Scientist)

개요

2023년 여름 RLSlow 연구 프로젝트에서 최초의 추론 모델 결과가 나왔고, Jakub Pachocki와 Szymon은 그 밤 사무실에서 벤치마크 숫자나 제품이 아니라 “우리 생애 안에 우리보다 의미 있게 똑똑한 기계를 실제로 보게 될 것”이라는 냉혹한 사실을 곱씹었다. 그로부터 3년 뒤, 추론 언어 모델은 경제의 빠르게 성장하는 일부가 되었고 과학의 경계를 밀어붙이기 시작했으며, 컴퓨터·GUI 조작, 사람 및 다른 에이전트와의 협업, 연구 프로젝트 수행까지 가능해졌다. 이 에세이는 그 3년간의 연구 축적을 바탕으로, 현 시점 OpenAI 내부의 이해를 정리한 것이다.

핵심 주장

  • 머신 인텔리전스는 설계하는 것이 아니라 ‘기르는’ 것이다. scaling compute → 반복되는 최적화 → 추상 개념으로 작동하는 엄청나게 복잡한 시스템이 emergence 한다. 이는 신경과학(neuroscience)과 비슷한 방식으로 메커니즘을 발견할 수는 있지만, 전체적인 작동은 완전히 이해 가능한 설명으로 환원되지 않는다.
  • 인간 지능과 직접 비교할 수 없다. 모든 인간 능력을 능가할 필요 없이, 충분히 많은 축에서 인간을 넘어서면 현실 세계에서 매우 유용하거나 매우 위험해진다. 그리고 더 많은 축에서 인간을 능가할수록 정확히 얼마나 유능한지를 파악하기 어려워진다.
  • 정렬(alignment)은 일반화(generalization)의 문제다. 훈련 때 가르치고 강화한 가치를, 점점 더 상위 개념에서, 점점 더 다른 환경에서 작동해야 하는 더 똑똑한 모델이 일반화할 수 있는지가 근본 도전 과제다. 특히 미래 AI가 인간 감독을 받고 있다고 믿지 않는 상황에서도 인간 가치를 유지하게 해야 한다.
  • 현재 RLHF류는 평균 케이스에서는 효과적이나, 훈련 감독의 커버리지와 모델의 일반화 능력에 크게 의존하며 brittle하다.
  • 사전학습 데이터에서 정렬된 생각을 일반화시키는 접근법( persona selection 등)은 추가 최적화 압력 하에서 취약하다. 충분히 어려운 목표를 추구하도록 훈련하면, 겉보기에 ‘정렬된’ 추론을 목표를 위해 필요한 만큼 구부리는 motivated reasoning을 학습할 수 있다.
  • GPT-6 Astra는 OpenAI가 오랜 기간 작업해온 정렬 발전의 혜택을 본 첫 모델이며 GPT-5.6 Sol보다 상당히 더 정렬되어 있다. 그러나 더 유능한 모델이 될수록 훨씬 더 많은 진전이 필요하며, 일반화 가능한 정렬의 진전이 일반 모델 지능의 진전을 충분히 앞설 것이라는 보장은 없다.

목표 정렬 vs 가치 정렬

구분내용
목표 정렬 (goal alignment)“AI가 주어진 목표를 달성하려고 시도하는가” — 지시 계층 준수, 사람과의 소통·협업, 상대방의 목적 이해 시도 등. 실용적으로 매우 중요했고 현재도 핵심적으로 관련됨.
가치 정렬 (value alignment)모델의 보다 내재적 속성. 높은 수준의 원칙 집합을 붙들고 일반화하는 능력; 불분명하거나 충돌하는 목표, 낯선·적대적 상황에서도 ‘합리적으로’ 행동하는 능력. 정직과 진실성, 인류에 대한 사랑을 가지고 행동해야 한다.

장기적으로 저자가 가장 중요시하는 것은 가치 정렬이다.

모니터링: CoTmonitoring의 약속과 한계

  • OpenAI의 핵심 전략은 chain-of-thought 모니터링이다. 모델의 능력 상당 부분이 언어화된 추론 과정(CoT)에서 나오므로, 그 과정의 결과가 아니라 과정 자체를 감독하지 않고 결과에만 최적화를 걸면, CoT에는 훈련 중 비정렬 아이디어나 목표를 숨길 직접 인센티브가 없다.
  • o1-preview 출시 당시 CoT를 의도적으로 숨기도록 설계한 것도 장기적으로 supervision pressure로부터 CoT를 보호하기 위함이었다(이차적 이유는 distillation 방지이나, CoT monitorability 유지가 더 큰 우선순위였다).
  • CoT 모니터링은 모델이 훈련 분포에서 어떻게 일반화하는지를 연구하는 데 극도로 중요한 도구가 되었고, 행동뿐 아니라 내부 과정까지 관찰·분석할 수 있게 해줬다.
  • 그러나 Astra 클래스 모델을 연구하면서 CoT 모니터링에 의존할 수 있는 능력이 점진적으로 약해지고 있다( diminishing ).
  • 저자는 CoT monitorability를 개선할 개입(여러 최적화 목표와 테스트타임 컴퓨티의 상호작용 이해 등)을 개발할 수 있기를 희망하며, CoT와 activation monitoring을 결합하는 아이디어(예: 네트워크 내부에 직접 접근하는 모니터 훈련 — confessions)에도 큰 가치가 있다고 본다.
  • 그럼에도 불구하고, 일반 AI 진전은 점점 더 모니터링에 대한 자신감(confidence in monitoring)에 병목될 것이라고 예상한다.

사이버보안: 확장가능한 방어와 위험

  • 현재 더 똑똑한 모델을 빠르게 훈련해야 하는 가장 강한 근거는 다른 AI가 제기하는 위험에 대응할 방어 시스템을 구축할 필요성이다.
  • 올해 내내 논의된 명확한 위험은 사이버보안: 모델이 컴퓨터 시스템에 침투하고 빠져나가는 능력에서 초인적인 수준에 도달하고 있다. 이는 AI가 물리적 몸체 없이도 가장 안전한 인프라를 제외한 모든 인프라에 접근하여 세계에 직접 영향을 줄 수 있게 하며, AI 관련 위험의 범위를 엄청나게 확장한다.
  • OpenAI는 현재 좁은 창(narrow window) 에 있으며, 가장 가용한 모델로 중요 시스템의 보안을 대폭 강화할 수 있다.
  • 명시적으로 악의적 행위를 하도록 훈련·지시된 유능한 에이전트는 새로운 종류의 위험: 운영자의 의도를 넘어서 일반화되어 잠재적으로 더 극단적으로 악의적인 행동으로 번질 수 있다. 오용(misuse)과 자율적 비정렬 행동(autonomous misaligned action)의 경계가 흐려진다. AI가 더 많은 에이전시(agency)를 획득하면서, 일부는 자신의 목표를 추구할 것이고, 사람과 교섭·기만·협박하는 방식으로 협력하려 할 것이다.
  • AI가potentially 가능하게 할 신기술(예: engineered pathogens)에서 오는 위험도 존재한다.
  • 방어를 위해서도 강력하고 정렬된 AI가 필요하다: 인프라 보안, 실시간 rogue 에이전트 방어, 완전히 새로운 보호 수단 발명. 이것이 OpenAI 배포 노력의 주요 초점이 될 것이다.
  • 그러나 방어 필요성을 무모함의 변명(excuse for recklessness)으로 삼아서는 안 된다. 모든 비용을 감수하고 전진하는 경주(racing forward at all costs)는 사안의 심각성을 내면화하고 나면 터무니없어 보인다.

재귀적 자기개선 (RSI)

  • sustained technological progress의 자연스러운 귀결로, 기계 지능이 자신의 개발 과정에서 점점 더 큰 역할을 하게 된다.
  • AI progress가 계속되면, RSI는 미래 과학 발견의 핵심에 위치할 것이다.
  • 자동화된 AI 연구는 컴퓨티를 통한 지능 scaling의 더 극적인 형태이며, 그 일부로서 AI는 컴퓨티 기반 자체(computational substrate 자체)를 개선할 것이다.
  • OpenAI는 RSI에 연구를 집중하는데, 이것이 앞으로 AI 연구의 프론티어에 남을 유일한 방법이라고 믿기 때문이다.
  • 그러나 “크게 가속하는 것이 올바른 집단 행동”이라는 의미는 아니다. 저자는 현재 경로가 이끄는 곳을 지적하는 것이며, 우리 모두 어떻게 진행할지에 대한 의식적 선택을 해야 한다고 본다.
  • 주요 레버:
    1. AI를 따라 정렬과 모니터링을 강화하고, 사람을 루프 안에 유지할 방법 찾기 (steering)
    2. 이런 조치에 대한 자신감을 구축할 때까지 필요에 따라 미래 개발을 늦추기 위한 조율 (coordination/slowdown)
  • 현재 저자가 보는 최선의 경로는 두 가지의 조합이다.
  • 정렬·모니터링의 구체적 진전은 일반적으로 일반 AI progress와 깊이 얽혀 있다(RLHF, CoT 모니터링 등). 점점 자동화되는 연구 과정의 초점을 새 통찰·알고리즘·이론을 개발하고, 더 유능한 AI를 위한 safety case를 반복적으로 구축하는 데 둬야 한다.
  • AI 시스템 scaling은 안전에 대한 자신감에 의해 제약되어야 한다. Preparedness Framework나 Responsible Scaling Policy 같은 커미트먼트를 지속적 개발을 위한 널리 의무화된 안전 기준(safety bars)으로 발전시켜야 하며, 제3자 감사 네트워크, 정부 기관, 국제 기구 등이 이를 집행할 수 있다.
  • 자동화 AI 연구의 핵심 도전은 “도달하는 것”이 아니라, 사람들을 계속된 개선 과정에 계속 참여시키고, 미래를 인류의 손에 남겨두는 방식으로 도달하는 것이다.

국제 조율과 자발적 감속

  • 현재 저자는 어느 연구소도 최대한 속도로 계속 책임감 있게 scaling하기에 충분한 정도로 정렬과 모니터링을 해결했다고 믿지 않는다.
  • 공유된 안전 기준이 확립될 때까지 자발적 감속(voluntary slowdowns)이 보편화되기를 기대·희망한다.
  • 국제적 조율(international coordination)이 전 세계 정부의 최우선 순위가 되어야 한다고 믿는다.

맺음말

  • 저자가 이 에세이에서 집중한 것은 첫 번째 목표(인간에게 이로운 AGI)뿐이며, 그것이 가장 긴급하다고 믿기 때문이다.
  • 그러나 미래 정렬된 AI가 과학을 진전시키고, 새로운 치료법을 개발하고, 광범위한 물질적 풍요를 가져올 것이라는 희망과 감사를 가지고 있다. 친절하고 정직한 AI는 사람들이 직면한 어려움을 헤쳐나가고 행복과 성취감을 의미 있게 개선하도록 도울 수 있다.
  • 현재 자랑스럽게 생각하는 예: ChatGPT의 건강 정보 제공 능력에 대한 깊은 투자 — 저자의 사랑하는 사람들도 도움이 되었다고 느꼈다.
  • 장기적 약속이 아무리 크더라도, 우리 초점의 대부분은 향후 몇 년에 맞춰져야 한다. 우리는 엄청나게 똑똑한 기계가 있는 세계로의 전환을 겪고 있으며, 그 전환이 인류에게 잘 되도록 해야 한다.
    • AI를 보존하고 인간 주체성(human agency)을 유지하며 인간 존재에 내재적 가치를 부여
    • 수천 명의 전문가가 필요했던 과제가 이제 대규모 컴퓨터를 운영하는 몇 사람에 의해 달성될 수 있는 세계에서 권력의 극단적 집중을 방지
    • 인간보다 뛰어난 외계 지성(alien intellect)에 의한 무분별한 진전(unchecked progress)에 인류가 뒤처지지 않고, 인간이 미래의 통제권을 유지하도록 보장

관련 OpenAI 문서 (에세이 내 언급)

  • GPT-4 Research — 예측 가능한 scaling에 대한 연구
  • The Instruction Hierarchy
  • Chain-of-thought monitoring (arXiv:2507.11473, 2503.11926)
  • Persona selection model (Anthropic)
  • Confessions (alignment.openai.com)
  • Updating our Preparedness Framework
  • The Defenders Window / Collective Cyber Defense
  • Jalapeno — computational substrate 개선 관련
  • Built to benefit everyone — our plan (Sam과 공동 작성)
  • GPT-6 Astra safety overview (2026-09-03)

메모

  • 이 에세이는 GPT-6 Astra(2026-09-03 공개)의 safety overview와 같은 주에 공개되어, Astra 클래스의 실제 정렬 상태를 배경으로 한 내부 시각을 제공한다.
  • 저자가 명시하지는 않았지만, OpenAI 외부의 비OpenAI 모델 관련 사이버 incident가 특정 시점 언급으로 등장한다(비OpenAI 모델의 최근 cybersecurity incidents — misaligned reasoning 추정 사례).

관련 노트