출처

개요

AutoSci는 논문 수집부터 아이디어 도출, 실험, 집필, 반박(rebuttal)까지 연구 전 과정을 자동화하는 메모리 중심(memory-centric) 에이전트 시스템이다. 베이징대학교 DAIR Lab이 개발했으며, Andrej Karpathy가 이야기한 “LLM 위키(LLM-Wiki)” 비전을 스스로 구현한 것이라고 소개한다 — 이 위키 자체가 그 비전을 따르는 프로젝트라는 점에서 흥미로운 참조점이다. 대부분의 연구 보조 도구가 작업이 끝나면 맥락을 잊는 것과 달리, AutoSci는 읽은 논문·개념·실험 기록·심사 의견을 지식 그래프와 활성 메모리에 쌓아 이후 프로젝트에서 재활용한다. 코딩 에이전트 위에서 동작하며 안정 버전은 Claude Code(main 브랜치), 미리보기는 Codex(autosci-codex)·OpenCode(autosci-opencode)로 제공된다.

핵심 포인트

  • 네 가지 구성요소: SciMem(장기 기억인 지식 그래프 + 수명 주기가 있는 항목을 다루는 활성 기억 + 반영 전 점검하는 Trust Guard), SciFlow(문헌조사→아이디어→실험→집필→반박 5단계 워크플로), SciDAG(입력에 맞는 템플릿으로 연산자 DAG를 구성하는 선택적 증강 단계), SciEvolve(신호를 감지해 시스템 자신의 절차를 감사 가능하게 개선하는 진화 절차).
  • 30개 이상의 에이전트 스킬: /ideate(아이디어 정제), /exp-design·/exp-run·/exp-status·/exp-eval(실험 설계~평가), /discover(학회 논문 중 읽을 것 추리기), /daily-arxiv(매일 신규 arXiv 추천), /poster(초안을 학회 포스터로 변환). 연구 그래프는 웹 UI 또는 Obsidian(/visualize)으로 탐색 가능.
  • 교차 모델 검토(cross-model review): 아이디어·실험·초안 검토 시 OpenAI 호환 API의 두 번째 LLM을 독립 리뷰어로 활용할 수 있고, 미설정 시 단일 에이전트 모드로 동작.
  • 실제 산출물: AutoSci로 전 과정을 수행해 만든 논문 3편을 공개 — GPU 커널 최적화(“Agent-driven iterative optimization of Triton GPU kernels”), 신약 개발 타겟 선정, LLM 인지 모델링(“Forced Honesty Dissociates Polite Speech from Motivated Cognition in LLM Attitude Ratings”). PDF는 저장소 assets/papers에 공개.
  • 설치: git clone -b main 후 Claude Code CLI(npm install -g @anthropic-ai/claude-code)로 /init [연구-주제] 실행. Python 3.9+·Node.js 18+ 필요. Anthropic 키 대신 DeepSeek·Kimi·GLM 등 호환 엔드포인트도 연결 가능. MIT 라이선스.

왜 중요한가

우리 위키가 따르는 것과 같은 “LLM-Wiki” 아이디어를 연구 자동화 도메인에 그대로 적용한 사례라는 점에서 방법론적으로 참고할 만하다. 특히 SciMem의 장기/활성 메모리 분리와 Trust Guard(반영 전 검증) 패턴은 일반 에이전트 메모리 설계에도 적용 가능한 구조다.

더 읽어보기 (원문 인용)

참고 링크

관련 위키