출처

개요

pi-autoresearch는 터미널 기반 AI 코딩 에이전트 pi에 자율 최적화 실험 루프를 추가하는 확장이다. 에이전트는 코드를 수정하고 벤치마크를 실행한 뒤 결과를 기록하며, 개선된 변경은 유지하고 악화된 변경은 되돌리는 과정을 반복한다. 확장은 실험 실행·기록·시각화를 담당하고, 스킬은 도메인별 측정 명령과 지표, 변경 범위를 정의한다. 실험 상태는 .auto/ 디렉터리의 파일에 저장되어 세션 재시작이나 대화 압축 이후에도 작업을 이어갈 수 있다. 다만 벤치마크의 잡음과 LLM 사용 비용을 고려해 신뢰도 점수와 반복 횟수 제한을 함께 사용해야 한다.

핵심 포인트

  • run_experiment가 벤치마크 명령을 실행하고, log_experiment가 지표·커밋·실험 설명을 기록하며 위젯과 대시보드를 갱신한다.
  • init_experiment에서 목표 지표, 단위, 높고 낮음의 방향을 설정하며, /autoresearch off 또는 Escape로 실행 중 개입할 수 있다.
  • 확장 기능과 도메인별 스킬을 분리한다. autoresearch-create는 세션과 기준선을 만들고, autoresearch-finalize는 채택된 변경을 논리적 단위별 독립 브랜치로 정리한다.
  • .auto/prompt.md, .auto/measure.sh, .auto/log.jsonl, .auto/checks.sh 등을 사용해 목표·측정 방법·실험 기록·정확성 검사를 프로젝트 안에 보존한다.
  • 세션에 3회 이상 실험이 쌓이면 중위 절대 편차(MAD)를 기반으로 신뢰도 점수를 계산하지만, 이 점수는 참고용이며 채택·폐기 판단을 자동으로 대신하지 않는다.
  • .auto/checks.sh를 설정하면 테스트·타입 검사·린트 등이 벤치마크 뒤에 실행되고, 검사 실패 변경은 checks_failed로 기록된 뒤 되돌려진다.
  • 설치는 pi install npm:pi-autoresearch로 진행하며, .auto/config.jsonmaxIterations와 제공자 예산 설정으로 장시간 자율 루프의 비용을 제한할 수 있다.

왜 중요한가

성능 최적화에서 반복적으로 발생하는 벤치마크 실행, 수치 기록, 커밋과 되돌리기 작업을 에이전트의 도구 호출과 파일 기록으로 구조화했다는 점이 핵심이다. 테스트 시간·번들 크기·빌드 시간·Lighthouse 점수·LLM 학습 지표처럼 수치화할 수 있는 다양한 대상에 같은 실험 구조를 적용할 수 있다. 또한 실험 결과를 커밋과 브랜치 단위로 남기므로, 자율적으로 생성된 변경을 나중에 검토하고 선택적으로 병합하는 작업 흐름을 지원한다. 다만 신뢰도 점수는 통계적 참고 지표일 뿐이며, 측정 잡음과 토큰 비용을 별도로 검토해야 한다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-30-pytorchkr-topic-11471-pi-autoresearch-pisource_url 및 HTML 원문과 함께 저장되어 있습니다.