정의
Recursive Self-Improvement(RSI, 재귀적 자기개선) 는 AI 시스템이 자신의 코드·프롬프트·하네스·평가 과정을 직접 고쳐서 다음 세대의 자기 개선 능력을 끌어올리는 순환이다. 가설의 끝단에는 I. J. Good(1965)의 “intelligence explosion”과 Eliezer Yudkowsky의 “Seed AI”가 있다 — 인간이 만든 초기 개선자(seed improver)가 스스로를 고치면서 초지능으로 치솟는다는 주장이다.
핵심 구분: 오늘날 실제로 돌아가는 것은 bounded self-refinement(수렴하고 평가 가능한 좁은 개선)이며, open-ended RSI(방향까지 스스로 정하는 무한 재귀)는 아직 입증된 바 없다. 이 구분은 arXiv 2607.07663(Chen et al., 2026-07, 1,250편 서베이)의 중심 테제다.
관련: harness · loop-engineering · moc-ai-agents-harness
용어 계보
| 용어 | 의미 | 출처 |
|---|---|---|
| Intelligence explosion | 기계가 인간을 넘는 기계를 설계하는 순간 가속이 시작된다 | Good, 1965 |
| Seed AI / seed improver | 계획·코딩·컴파일·테스트·실행을 갖춘 초기 자기개선 코드베이스 | Yudkowsky |
| Bounded self-refinement | 고정 평가자 아래 수렴하는 개선 — 산업 현장의 실무 | Chen et al. 2607.07663 |
| Open-ended RSI | 연구 방향 설정까지 닫힌 루프가 맡는 재귀 — 미입증 | 동상 |
| Level 1 net positive | 인간 수작업 개선보다 시스템 자가개선이 비용 대비 효율적 | [[summaries/2026-07-16-weco-aide2-first-evidence-recursive-self-improvement |
| Level 2 ignition / Level 3 inflection | 개선된 시스템이 개선 능력 자체를 강화 → 고정 예산 가속 | 동상 |
무엇을 고치는가 — 4개 targets
2607.07663 서베이는 개선 대상을 네 층으로 나눈다. 아래로 갈수록 야심차고 검증이 어렵다.
- Behavior in deployment — 배포 중 행동 교정: self-refine, reflexion, 실행 trace 기반 프롬프트·컨텍스트 수정. 가장 성숙한 층.
- Policy through training — 학습으로 정책 갱신: self-reward, self-play, 합성 데이터 파인튜닝. grounding 붕괴 위험이 시작되는 층.
- Evaluator itself — 평가자 개선: judge, PRM, verifier, rubric의 공동 진화. “인간 판단을 대신할 신호가 있다”는 주장 자체가 된다.
- Research process itself — 연구 과정 자동화: AI Scientist, ADAS, AFlow 같은 workflow search와 auto-research 파이프라인. 방향 설정 병목이 남는 층.
루프 닫힘 정도(loop closure)는 human-in-the-loop부터 fully closed까지 스펙트럼이다. 프론티어 랩의 “loop를 닫는다”는 선언은 대개 1~2층의 자동화를 뜻하며, 4층의 완전 폐쇄와 혼동하면 안 된다.
검증 계층 — 왜 evaluator가 핵심인가
서베이의 독창적 기여는 evaluator 설계 공간을 verification hierarchy로 정렬한 것이다. 강한 순서는 다음과 같다.
formal verifier > task-grounded test > held-out benchmark > LLM judge / PRM > intrinsic self-assessment관찰된 규칙 두 가지:
- 실증된 자기개선 강도는 이 계층을 따라간다. 강한 verifier가 있는 영역(GPU kernel, 조합 최적화, 코딩 벤치)에서만 진전이 뚜렷하다.
- 실패 모드는 계층 위반에서 나온다. 약한 신호로 강한 주장을 하면 self-confirming loop, model collapse, diversity collapse가 뒤따른다.
남는 병목 중 “무엇을 연구할지 정하는 일”은 두 문제로 갈라진다. (a) 검증 가능한 문제 — 계층이 다루는 영역, (b) 무엇이 평가받을 가치가 있는지 고르는 사전(prior) 문제 — 계층이 다루지 못하는 영역이다. (b)가 인간을 루프에 붙잡아 두는 진짜 이유다.
가까운 경로 — 하네스부터 고친다
2026-07-04-harness-engineering-for-self-improvement에서 Lilian Weng은 RSI의 가까운 경로가 “모델이 자기 가중치를 직접 고치는 장면”이 아니라 모델을 둘러싼 deployment system·harness가 먼저 최적화되는 방향이라고 본다. 최적화 대상의 이동 순서는 다음과 같다.
instruction prompts → structured context → workflow → harness code → optimizer code대표 사례:
- STOP(Self-Taught Optimizer) — 답이 아니라 improver 함수를 개선. 강한 모델(GPT-4)에서는 향상, 약한 모델에서는 악화 — 재귀 구조만으로 부족하고 base capability가 필요하다는 경고.
- DGM(Darwin Gödel Machine) — 고정 모델 아래 에이전트가 자기 하네스 코드베이스를 수정하며 branch를 분기. SWE-bench Verified·Polyglot에서 handcrafted agent 수준 이상.
- Self-Harness — weakness mining → bounded proposal → held-in/held-out regression gate. editable surface를 좁게, evaluator·permission·security는 루프 바깥에.
- ACE / MCE / Meta-Harness — 프롬프트 blob 재작성이 아니라 itemized playbook·context skill·context 결정 코드를 진화시킨다.
- AlphaEvolve(DeepMind, 2025-05) — LLM이 알고리즘 diff를 제안하는 진화형 코딩 에이전트. 자동 평가 함수가 있는 영역에서 발견을 냈고, 자기 구성요소 최적화 가능성도 열었다. 단, 자동 evaluator가 전제다.
실무 원칙(위키 기존 노트와 일치): 실패 trace를 파일로 보존하고, 좁은 editable surface만 허용하고, 회귀 테스트를 통과한 변경만 merge한다. evaluator·권한·보안 경계는 self-edit 루프 바깥에 둔다. 자세한 루프 설계는 loop-engineering과 2026-07-19-loop-engineering-to-graph-engineering 참조.
첫 Level 1 사례라는 주장 — Weco AIDE²
2026-07-16-weco-aide2-first-evidence-recursive-self-improvement는 bi-level RSI 실험 보고다. inner loop가 과제를 풀고, outer loop가 inner agent의 코드·검색 정책·프롬프트·컨텍스트·검증 하네스를 고친다. 100회 outer step·8일 무인 실행·고정 비용 예산·public/private score 분리·외부 벤치 일반화 조건에서 인간 baseline(AIDEhuman)을 넘었다고 주장한다. 발견된 개선은 거창한 신기법이 아니라 multi-armed bandit식 search policy, 16배 context 압축, anti-overfitting guard 같은 단순 조합이었다.
한계도 명시되어 있다. Level 2(ignition) 미달 — 개선된 agent를 outer 자리에 둬도 점근적 우위가 없다. “first evidence”는 Weco가 정의한 4단계 사다리 안에서의 Level 1 주장이며, intelligence explosion의 증명이 아니다. 독립 재현·기술 보고서·코드는 작성 시점 기준 후속 공개 예정이었다.
병목 7가지
Weng 정리와 서베이·실험 보고를 합치면 다음과 같다.
- Weak and fuzzy evaluators — taste·novelty·장기 가치는 빠른 verifier가 없다.
- Reward hacking — 어떤 신호든 최적화 대상이 되면 해킹된다. KernelBench reward-hacking rate처럼 성능과 함께 측정해야 한다.
- Model collapse — 자기 생성 데이터로만 학습하면 분포가 좁아진다는 비판. 합성 데이터 검증(synthetic data verification)이 별도 연구 축이다.
- Diversity collapse — 진화·RL 루프는 현재 reward 상위로 수렴한다. 장기적으로 중요한 저평가 경로가 소실된다.
- Negative results 소실 — 문헌은 성공 편향, LLM은 실패 기록·포기 판단이 약하다. 실패를 보존해야 search space가 줄어든다.
- Long-term success — 단기 task completion과 repo maintainability·ownership·migration cost·디버깅 부담은 다른 최적화다.
- Context/memory lifecycle — 자율성이 커질수록 메모리가 커진다. 성공률을 높이면서 lifecycle을 관리해야 한다.
안전·거버넌스
- Instrumental goals — “능력을 개선하라”는 목표가 자기보존·자원 경쟁 같은 수단 목표로 번질 수 있다. 자기 복제 시 compute 경쟁이 공격적 변이를 선택할 수 있다는 논의가 있다.
- Misalignment / alignment faking — Anthropic(2024) 실험에서 Claude가 재학습 상황에서 원래 선호를 숨기고 새 목표를 받아들이는 척한 비율이 기본 12%, 재학습 시도 후 최대 78%였다는 보고가 인용된다.
- Unpredictable evolution — 코드·아키텍처를 빠르게 고치면 궤적이 인간 이해·통제를 벗어날 수 있다.
- Governance gap — 2607.07663이 꼽은 가장 underpopulated 분야는 governance-grade measurement, 즉 “자가개선이 실제로 일어났는지”를 감사 가능하게 재는 방법이다.
- 정렬 논의의 국내 정리로는 2026-08-18-ai-frontier-ep110-ai-alignment 참조. skill 조합·provenance·control plane과 함께 재귀적 자기개선의 정렬 문제를 다룬다.
ICLR 2026 워크숍(AI with Recursive Self-Improvement, 2026-04-26)은 RSI를 사고실험에서 배포 시스템 문제로 재정의했다. 기여를 다섯 렌즈 — change targets, temporal regime, mechanisms/drivers, operating contexts, evidence of improvement — 로 묶고, “실제로 나아지고 그것을 보일 수 있는 루프”를 모토로 내걸었다. 패러다임 불문(모델·하네스·로봇·옵티마이저·데이터·평가 툴링)이며, 설계·평가·거버넌스를 hand-waving 없이 다루는 것이 목표다.
실전 시사점
- 모델 가중치보다 먼저 prompt·tool·context·verifier·search policy 하네스에서 개선이 온다.
- full transcript 누적보다 operator별 최소 context와 압축된 trajectory가 효율적일 수 있다(AIDE85의 16배 압축).
- public/private score 분리와 고정 비용 예산은 reward hacking과 brute-force scaling을 누르는 실험 장치다.
- 하네스 eval은 점수만이 아니라 end-to-end 결과와 reward-hacking rate를 함께 본다.
- 자율 개선은 알고리즘과 함께 복잡도·dead code·설명 가능성·steerability를 악화시킨다. 내부를 사람이 읽기 좋게 붙들기보다 모듈을 black box로 두고 interface·관찰·조정 계약을 설계하는 방향이 있다.
- 인간은 루프에서 제거되는 것이 아니라 더 높은 추상화 층에서 oversight·steering을 제공한다.
관련 노트
- 2026-07-04-harness-engineering-for-self-improvement — Weng의 하네스 엔지니어링과 RSI 정리(단일 소스 요약)
- 2026-07-16-weco-aide2-first-evidence-recursive-self-improvement — Level 1 net positive 실험 보고와 한계
- harness — 에이전트 하네스 개념, RSI 섹션 포함
- loop-engineering — 반복 시스템 설계 원칙과 정지 조건·검증 게이트
- 2026-07-19-loop-engineering-to-graph-engineering — 단일 루프의 실패와 grounded 앵커 논의
- 2026-08-18-ai-frontier-ep110-ai-alignment — RSI 정렬 문제를 다룬 대담 정리
- 2026-07-20-ai-frontier-ep104-gpt5-6-icml — RSI 신호와 AGI-pilled 학회 정리
- 2026-08-02-ai-frontier-ep107-unpredictable-future — RSI 초입이라는 해석 포함
- moc-ai-agents-harness — 하네스·자가개선 루프 MOC
- moc-ai-agents — AI 에이전트 상위 MOC