출처
- source_url: https://aisparkup.com/posts/15058
- author: Spark
- published: Fri, 07 Aug 2026 10:35:03 +0000
- raw: raw source:
2026-08-07-aisparkup-post-15058-post
개요
에이전트 개선의 초점이 사람이 프롬프트와 도구를 직접 조정하는 방식에서, 에이전트가 실행 과정과 하네스 자체를 수정하는 방식으로 이동하고 있습니다. Lil’Log의 하네스 엔지니어링 정리, Prime Intellect의 Prime Agent 공개, DREvo 논문은 이 흐름을 각각 이론·구현·한계의 관점에서 보여줍니다. 하네스는 프롬프트 템플릿을 넘어 워크플로, 도구 호출, 컨텍스트 관리, 평가, 권한, 영속 상태를 조율하는 실행 시스템으로 설명됩니다. 다만 과거 경험을 활용한 하네스 자기진화는 아직 성능 변동이 크며, 경험의 유효성을 재평가하고 탐색 방향으로 반영하는 방법이 중요한 과제로 남아 있습니다.
핵심 포인트
- 하네스는 모델을 둘러싸고 계획·실행·관찰·평가·개선을 조율하는 런타임 또는 소프트웨어 시스템에 가깝습니다.
- 주요 설계 패턴은 워크플로 자동화, 파일 시스템을 활용한 영속 메모리, 명시적으로 관리 가능한 서브에이전트와 백그라운드 작업입니다.
- 하네스 최적화 대상은 프롬프트에서 구조화된 컨텍스트, 워크플로, 하네스 코드, 옵티마이저 코드로 점차 확장되고 있습니다.
- Prime Agent의 재귀 언어 모델(RLM)은 컨텍스트와 서브에이전트 위임을 프로그래밍 가능한 변수와 함수 호출처럼 다룹니다.
- Prime Agent의 Continual Harness는 에이전트가 실행 중에 프롬프트·스킬·메모리·서브에이전트를 생성, 조회, 수정, 삭제할 수 있도록 합니다.
- DREvo는 과거 경험의 현재 유효성을 재평가하고, 역할별 탐색 의도로 증류하는 방법을 제안했습니다. 논문은 5개 벤치마크에서 최고 정확도와 도메인 추론 평균 16.2%, 에이전틱 과제 평균 14.2% 개선을 보고했지만, 해당 수치는 저자 실험 결과로 독립 재현 여부는 별도 확인이 필요합니다.
왜 중요한가
하네스가 자기개선의 대상이 되면 코딩 에이전트나 자동화 도구를 평가할 때 모델 성능뿐 아니라 작업 상태를 파일과 로그로 보존하는지, 병렬 서브에이전트 결과를 추적할 수 있는지, 실패한 실행 궤적을 다음 시도에 반영하는지도 중요한 기준이 됩니다. 이는 긴 작업을 대화 컨텍스트에만 의존하지 않고 복구 가능하고 검증 가능한 실행 시스템으로 관리하는 방향을 의미합니다. 동시에 자기진화가 항상 안정적인 개선으로 이어지는 것은 아니므로, 경험의 선별·검증·재보정 장치가 필요합니다.
참고 링크
- 원문: https://aisparkup.com/posts/15058
- Harness Engineering for Self-Improvement: https://lilianweng.github.io/posts/2026-07-04-harness/
- Prime Agent: A self-improving RLM agent: https://primeintellect.ai/blog/prime-agent
- DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution: https://arxiv.org/abs/2607.26722
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-07-aisparkup-post-15058-post에 source_url 및 HTML 원문과 함께 저장되어 있습니다.