출처: ChatGPT 대화 “에이전트 하네스 성능 향상”.
첨부된 대화 원문은 raw note에 그대로 보존했다. 아래 링크는 2026-07-11에 제목·초록·수치를 1차 출처와 대조해 보강했다. 직접 확인하지 못한 항목은 별도로 표시한다.

결론

모델 가중치를 바꾸지 않아도 에이전트 하네스의 컨텍스트 구성, 도구 정의, 실행·검증·재시도 루프, 메모리, 탐색 구조를 변경하면 동일 모델을 포함한 전체 시스템의 유효 성능을 높일 수 있다. 정확히는 모델 자체의 지능 향상이 아니라 모델과 하네스 조합의 과제 성공률 향상이다.

조사에서 반복해서 나타난 실용적 조합은 다음과 같다.

구조화된 컨텍스트
+ 목적에 맞는 도구 인터페이스
+ 실행 가능한 외부 검증
+ 실패 경험의 압축·재사용
+ 제한된 재시도와 후보 탐색

직접적인 하네스 연구로 제시된 자료

연구하네스에서 바꾼 요소대화에 제시된 결과검증 상태
Harness-Bench하네스·도구·컨텍스트·실행 구조동일 작업군에서 하네스별 52.4~76.2점1차 자료 확인 필요
Agentic Harness Engineering(AHE)도구·메모리·미들웨어·시스템 프롬프트Terminal-Bench 2 pass@1 69.7%→77.0%1차 자료 확인 필요
Self-Harness모델이 자기 하네스 코드를 생성·수정여러 모델에서 약 14~21%p 향상1차 자료 확인 필요
HarnessFix실패 궤적으로 하네스 결함 진단·수정GAIA·SWE·Terminal-Bench 등에서 향상1차 자료 확인 필요
Meta-Harness상위 에이전트가 하네스 프로그램 탐색분류·수학·터미널 과제에서 향상1차 자료 확인 필요
RHO실행 기록 회고 후 다음 하네스 개선SWE-Bench Pro 59%→78%1차 자료 확인 필요
Effective Feedback Compute같은 예산에서 피드백 품질·배치 변경성공률 0.27→0.901차 자료 확인 필요
ACE·GEPA·UCE경험 플레이북·반성·컨텍스트 최적화여러 에이전트 과제에서 향상개별 논문 확인 필요

이 목록은 2026-05-24-agent-harness-engineering-survey2026-07-04-harness-engineering-for-self-improvement가 다루는 하네스 계층 및 자기개선 흐름을 보완한다. 특히 “프롬프트만 개선”보다 도구, 상태, 미들웨어, 검증기를 함께 다루는 시스템 설계가 중요하다는 관점을 강화한다.

기반이 된 대표 선행 연구

계열연구하네스 패턴
추론 탐색Self-Consistency, Tree of Thoughts, LATS여러 경로 생성, 평가, 투표, 백트래킹
행동과 피드백ReAct, Reflexion, Self-Refine, CRITIC도구 행동, 실패 반성, 외부 검증, 반복 수정
경험과 메모리ExpeL, Voyager성공·실패 경험을 규칙이나 스킬로 저장·재사용
코딩 에이전트AlphaCodium, SWE-agent, AutoCodeRover, AgentCoder, MapCoder코드 탐색·테스트·편집 인터페이스와 역할별 워크플로우
단순 파이프라인Agentless복잡한 자율 루프 대신 결함 위치화→패치→검증 단계화

공통적으로 효과가 큰 요소

  1. 실행 가능한 외부 검증: 테스트, 컴파일러, 린터, 검색, 데이터베이스 조회, 환경 상태를 통해 모델의 자기평가를 실제 신호에 연결한다.
  2. 도구와 관찰 인터페이스: 관련 정보만 제공하고 오류를 구조화하며 편집 범위와 명령 결과를 통제한다.
  3. 실패 경험의 구조화: 전체 로그를 누적하기보다 재사용 가능한 규칙·플레이북으로 압축하고 오래되거나 충돌하는 기억을 관리한다.
  4. 탐색 후 검증: 여러 후보를 만들되 실행 가능한 검증 결과를 투표나 자기확신보다 우선한다.
  5. 관측 가능성: 실패 단계, 잘못 고른 도구, 반복 루프, 컨텍스트 누락, 잘못된 종료 조건을 추적한다.

이 요소들은 etclovg-t-tooling, etclovg-c-context, etclovg-o-observability, etclovg-v-verification의 구분과 직접 대응한다.

실패하기 쉬운 패턴

  • 외부 근거 없이 “다시 생각하라”고 요구하는 자기반성
  • 동일 비용·호출 예산을 통제하지 않은 멀티에이전트 비교
  • 시스템 프롬프트만 길게 만드는 최적화
  • 종료 조건 없는 재시도와 토론
  • 모델 역량과 평가기 품질을 고려하지 않은 자기개선 루프
  • 벤치마크 점수를 모델 성능으로만 해석하고 하네스·계산량을 공개하지 않는 평가

따라서 하네스 실험은 모델, 토큰·도구 호출 예산, 평가기, 재시도 횟수, 실행 환경을 고정하거나 공개해야 한다. 2026-04-16-agent-skills-realistic-benchmark-gap이 지적하는 현실적 평가 격차와도 연결된다.

위키 관점의 실천 항목

  • 하네스 변경 전후를 같은 모델·같은 예산·같은 평가 세트로 비교한다.
  • 실패 궤적을 증상과 원인으로 분리해 기록한다.
  • 프롬프트보다 도구·메모리·미들웨어·검증기를 각각 ablation한다.
  • 자기개선 가능한 영역과 권한·보안·평가기 같은 고정 경계를 분리한다.
  • 이 대화가 제시한 2026년 연구는 논문 URL, 저자, 버전, 평가표를 확인한 뒤 신뢰도를 올린다.

관련 노트

논문 및 공식 자료 링크

직접적인 하네스 연구

연구간단한 설명1차 출처확인 결과
Harness-Bench모델과 과제 예산을 통제한 채 하네스 구성만 바꿔 실행 품질·효율·실패 유형의 차이를 측정하는 진단 벤치마크다.arXiv:2605.27922 · 공식 프로젝트106개 과제와 5,194개 실행 궤적을 확인
Stop Comparing LLM Agents Without Disclosing the Harness에이전트 성능을 모델 단독 속성으로 보고하면 하네스 효과를 모델 향상으로 잘못 귀속할 수 있으므로 실행 설정 공개를 요구한다.arXiv:2605.23950제목과 하네스 공개 주장을 확인
Agentic Harness Engineering실행 궤적을 관찰해 도구·미들웨어·장기 메모리 등 하네스 구성요소를 자동으로 수정하고 다음 평가로 효과를 검증한다.arXiv:2604.25850Terminal-Bench 2 69.7%→77.0% 확인
Self-Harness외부의 더 강한 모델 없이 작업 모델이 자기 실패 패턴을 찾고 최소 범위의 하네스 수정을 제안·회귀 검증한다.arXiv:2606.09498세 모델의 40.5→61.9, 23.8→38.1, 42.9→57.1 확인
HarnessFix실패 궤적을 구조화된 중간 표현으로 바꿔 책임 단계와 하네스 계층을 찾고, 해당 결함만 겨냥한 패치를 생성·검증한다.arXiv:2606.06324논문 정식 제목은 “From Failed Trajectories to Reliable LLM Agents”
Meta-Harness상위 코딩 에이전트가 이전 후보의 코드·실행 기록·점수를 파일 시스템에서 읽으며 하네스 프로그램 자체를 탐색한다.arXiv:2603.28052 · 공식 코드분류 +7.7점, IMO 수학 평균 +4.7점 확인
Retrospective Harness Optimization(RHO)정답 레이블 없이 과거 궤적을 다시 풀고 자기검증·자기선호를 이용해 다음에 사용할 하네스 업데이트를 고른다.arXiv:2606.05922 · 공식 프로젝트SWE-Bench Pro 59%→78% 확인
Effective Feedback Compute단순 토큰·호출량 대신 실제로 유효하고 비중복이며 후속 결정에 보존된 피드백의 양으로 하네스 계산 효율을 측정한다.arXiv:2605.29682정식 제목과 동일 예산 0.27→0.90 확인
AutoHarness환경의 규칙 위반 피드백을 받아 게임별 행동 검증 코드 하네스를 자동 합성해 불법 행동을 차단한다.arXiv:2603.03329TextArena 145개 게임의 불법 행동 방지 결과 확인
Agentic Context Engineering(ACE)성공·실패 경험을 생성·반성·큐레이션 단계로 처리해 무너지지 않는 구조화된 컨텍스트 플레이북으로 축적한다.arXiv:2510.04618 · ICLR 2026에이전트 +10.6%, 금융 +8.6% 확인
GEPA실행 궤적을 자연어로 반성하고 프롬프트 후보를 진화·Pareto 선택해 적은 rollout으로 복합 LLM 시스템을 최적화한다.arXiv:2507.19457 · 공식 코드정식 제목은 “Reflective Prompt Evolution Can Outperform Reinforcement Learning”
Unified Context Engineering(UCE)원문에서는 컨텍스트 선택·요약·메모리를 통합하는 방법으로 소개하지만 논문을 확인하지 못해 상세 방법은 확정할 수 없다.확인 가능한 1차 출처 없음정확한 제목과 ALFWorld·WebShop 수치로 검색했으나 일치 논문을 찾지 못함

추론·행동·메모리 선행 연구

코딩 에이전트와 하네스 비교

멀티에이전트·자동 설계·반례

원문의 “토론보다 다수결이 향상의 대부분을 설명한다”, “동일 예산에서 단일 에이전트가 멀티에이전트보다 낫다”는 문장에 대응하는 논문은 제공된 제목만으로 특정하지 못했다. 해당 주장들은 출처가 확인될 때까지 일반화된 결론으로 인용하지 않는 편이 안전하다.

관련 서베이

  • A Survey of Self-Evolving Agents — 모델·메모리·도구·아키텍처 중 무엇을 언제 어떤 피드백으로 진화시키는지 체계화한다.
  • Agentic Large Language Models, a Survey — 에이전트 연구를 추론, 행동, 상호작용의 세 축으로 정리하고 응용과 연구 과제를 제시한다.
  • A Survey of Frontiers in LLM Reasoning — 추론 시 계산 확장, 추론 학습, 도구·멀티에이전트 기반 시스템을 하나의 분류 체계로 다룬다.
  • “From Storage to Experience”와 “Memory for Autonomous LLM Agents”는 검색 결과에서 제목은 확인했지만 안정적인 arXiv 식별자를 특정하지 못해 링크를 보류했다.