출처: ChatGPT 대화 “에이전트 하네스 성능 향상”.
첨부된 대화 원문은 raw note에 그대로 보존했다. 아래 링크는 2026-07-11에 제목·초록·수치를 1차 출처와 대조해 보강했다. 직접 확인하지 못한 항목은 별도로 표시한다.
결론
모델 가중치를 바꾸지 않아도 에이전트 하네스의 컨텍스트 구성, 도구 정의, 실행·검증·재시도 루프, 메모리, 탐색 구조를 변경하면 동일 모델을 포함한 전체 시스템의 유효 성능을 높일 수 있다. 정확히는 모델 자체의 지능 향상이 아니라 모델과 하네스 조합의 과제 성공률 향상이다.
조사에서 반복해서 나타난 실용적 조합은 다음과 같다.
구조화된 컨텍스트
+ 목적에 맞는 도구 인터페이스
+ 실행 가능한 외부 검증
+ 실패 경험의 압축·재사용
+ 제한된 재시도와 후보 탐색직접적인 하네스 연구로 제시된 자료
| 연구 | 하네스에서 바꾼 요소 | 대화에 제시된 결과 | 검증 상태 |
|---|---|---|---|
| Harness-Bench | 하네스·도구·컨텍스트·실행 구조 | 동일 작업군에서 하네스별 52.4~76.2점 | 1차 자료 확인 필요 |
| Agentic Harness Engineering(AHE) | 도구·메모리·미들웨어·시스템 프롬프트 | Terminal-Bench 2 pass@1 69.7%→77.0% | 1차 자료 확인 필요 |
| Self-Harness | 모델이 자기 하네스 코드를 생성·수정 | 여러 모델에서 약 14~21%p 향상 | 1차 자료 확인 필요 |
| HarnessFix | 실패 궤적으로 하네스 결함 진단·수정 | GAIA·SWE·Terminal-Bench 등에서 향상 | 1차 자료 확인 필요 |
| Meta-Harness | 상위 에이전트가 하네스 프로그램 탐색 | 분류·수학·터미널 과제에서 향상 | 1차 자료 확인 필요 |
| RHO | 실행 기록 회고 후 다음 하네스 개선 | SWE-Bench Pro 59%→78% | 1차 자료 확인 필요 |
| Effective Feedback Compute | 같은 예산에서 피드백 품질·배치 변경 | 성공률 0.27→0.90 | 1차 자료 확인 필요 |
| ACE·GEPA·UCE | 경험 플레이북·반성·컨텍스트 최적화 | 여러 에이전트 과제에서 향상 | 개별 논문 확인 필요 |
이 목록은 2026-05-24-agent-harness-engineering-survey와 2026-07-04-harness-engineering-for-self-improvement가 다루는 하네스 계층 및 자기개선 흐름을 보완한다. 특히 “프롬프트만 개선”보다 도구, 상태, 미들웨어, 검증기를 함께 다루는 시스템 설계가 중요하다는 관점을 강화한다.
기반이 된 대표 선행 연구
| 계열 | 연구 | 하네스 패턴 |
|---|---|---|
| 추론 탐색 | Self-Consistency, Tree of Thoughts, LATS | 여러 경로 생성, 평가, 투표, 백트래킹 |
| 행동과 피드백 | ReAct, Reflexion, Self-Refine, CRITIC | 도구 행동, 실패 반성, 외부 검증, 반복 수정 |
| 경험과 메모리 | ExpeL, Voyager | 성공·실패 경험을 규칙이나 스킬로 저장·재사용 |
| 코딩 에이전트 | AlphaCodium, SWE-agent, AutoCodeRover, AgentCoder, MapCoder | 코드 탐색·테스트·편집 인터페이스와 역할별 워크플로우 |
| 단순 파이프라인 | Agentless | 복잡한 자율 루프 대신 결함 위치화→패치→검증 단계화 |
공통적으로 효과가 큰 요소
- 실행 가능한 외부 검증: 테스트, 컴파일러, 린터, 검색, 데이터베이스 조회, 환경 상태를 통해 모델의 자기평가를 실제 신호에 연결한다.
- 도구와 관찰 인터페이스: 관련 정보만 제공하고 오류를 구조화하며 편집 범위와 명령 결과를 통제한다.
- 실패 경험의 구조화: 전체 로그를 누적하기보다 재사용 가능한 규칙·플레이북으로 압축하고 오래되거나 충돌하는 기억을 관리한다.
- 탐색 후 검증: 여러 후보를 만들되 실행 가능한 검증 결과를 투표나 자기확신보다 우선한다.
- 관측 가능성: 실패 단계, 잘못 고른 도구, 반복 루프, 컨텍스트 누락, 잘못된 종료 조건을 추적한다.
이 요소들은 etclovg-t-tooling, etclovg-c-context, etclovg-o-observability, etclovg-v-verification의 구분과 직접 대응한다.
실패하기 쉬운 패턴
- 외부 근거 없이 “다시 생각하라”고 요구하는 자기반성
- 동일 비용·호출 예산을 통제하지 않은 멀티에이전트 비교
- 시스템 프롬프트만 길게 만드는 최적화
- 종료 조건 없는 재시도와 토론
- 모델 역량과 평가기 품질을 고려하지 않은 자기개선 루프
- 벤치마크 점수를 모델 성능으로만 해석하고 하네스·계산량을 공개하지 않는 평가
따라서 하네스 실험은 모델, 토큰·도구 호출 예산, 평가기, 재시도 횟수, 실행 환경을 고정하거나 공개해야 한다. 2026-04-16-agent-skills-realistic-benchmark-gap이 지적하는 현실적 평가 격차와도 연결된다.
위키 관점의 실천 항목
- 하네스 변경 전후를 같은 모델·같은 예산·같은 평가 세트로 비교한다.
- 실패 궤적을 증상과 원인으로 분리해 기록한다.
- 프롬프트보다 도구·메모리·미들웨어·검증기를 각각 ablation한다.
- 자기개선 가능한 영역과 권한·보안·평가기 같은 고정 경계를 분리한다.
- 이 대화가 제시한 2026년 연구는 논문 URL, 저자, 버전, 평가표를 확인한 뒤 신뢰도를 올린다.
관련 노트
- moc-ai-agents-harness — 에이전트 하네스 및 자가개선 MOC
- harness — 하네스의 개념과 설계 원칙
- 2026-05-24-agent-harness-engineering-survey — ETCLOVG 기반 하네스 서베이
- 2026-07-04-harness-engineering-for-self-improvement — 하네스 최적화와 자기개선
- loop-engineering — 실행·검증·재시도·핸드오프를 묶은 운영 루프
논문 및 공식 자료 링크
직접적인 하네스 연구
| 연구 | 간단한 설명 | 1차 출처 | 확인 결과 |
|---|---|---|---|
| Harness-Bench | 모델과 과제 예산을 통제한 채 하네스 구성만 바꿔 실행 품질·효율·실패 유형의 차이를 측정하는 진단 벤치마크다. | arXiv:2605.27922 · 공식 프로젝트 | 106개 과제와 5,194개 실행 궤적을 확인 |
| Stop Comparing LLM Agents Without Disclosing the Harness | 에이전트 성능을 모델 단독 속성으로 보고하면 하네스 효과를 모델 향상으로 잘못 귀속할 수 있으므로 실행 설정 공개를 요구한다. | arXiv:2605.23950 | 제목과 하네스 공개 주장을 확인 |
| Agentic Harness Engineering | 실행 궤적을 관찰해 도구·미들웨어·장기 메모리 등 하네스 구성요소를 자동으로 수정하고 다음 평가로 효과를 검증한다. | arXiv:2604.25850 | Terminal-Bench 2 69.7%→77.0% 확인 |
| Self-Harness | 외부의 더 강한 모델 없이 작업 모델이 자기 실패 패턴을 찾고 최소 범위의 하네스 수정을 제안·회귀 검증한다. | arXiv:2606.09498 | 세 모델의 40.5→61.9, 23.8→38.1, 42.9→57.1 확인 |
| HarnessFix | 실패 궤적을 구조화된 중간 표현으로 바꿔 책임 단계와 하네스 계층을 찾고, 해당 결함만 겨냥한 패치를 생성·검증한다. | arXiv:2606.06324 | 논문 정식 제목은 “From Failed Trajectories to Reliable LLM Agents” |
| Meta-Harness | 상위 코딩 에이전트가 이전 후보의 코드·실행 기록·점수를 파일 시스템에서 읽으며 하네스 프로그램 자체를 탐색한다. | arXiv:2603.28052 · 공식 코드 | 분류 +7.7점, IMO 수학 평균 +4.7점 확인 |
| Retrospective Harness Optimization(RHO) | 정답 레이블 없이 과거 궤적을 다시 풀고 자기검증·자기선호를 이용해 다음에 사용할 하네스 업데이트를 고른다. | arXiv:2606.05922 · 공식 프로젝트 | SWE-Bench Pro 59%→78% 확인 |
| Effective Feedback Compute | 단순 토큰·호출량 대신 실제로 유효하고 비중복이며 후속 결정에 보존된 피드백의 양으로 하네스 계산 효율을 측정한다. | arXiv:2605.29682 | 정식 제목과 동일 예산 0.27→0.90 확인 |
| AutoHarness | 환경의 규칙 위반 피드백을 받아 게임별 행동 검증 코드 하네스를 자동 합성해 불법 행동을 차단한다. | arXiv:2603.03329 | TextArena 145개 게임의 불법 행동 방지 결과 확인 |
| Agentic Context Engineering(ACE) | 성공·실패 경험을 생성·반성·큐레이션 단계로 처리해 무너지지 않는 구조화된 컨텍스트 플레이북으로 축적한다. | arXiv:2510.04618 · ICLR 2026 | 에이전트 +10.6%, 금융 +8.6% 확인 |
| GEPA | 실행 궤적을 자연어로 반성하고 프롬프트 후보를 진화·Pareto 선택해 적은 rollout으로 복합 LLM 시스템을 최적화한다. | arXiv:2507.19457 · 공식 코드 | 정식 제목은 “Reflective Prompt Evolution Can Outperform Reinforcement Learning” |
| Unified Context Engineering(UCE) | 원문에서는 컨텍스트 선택·요약·메모리를 통합하는 방법으로 소개하지만 논문을 확인하지 못해 상세 방법은 확정할 수 없다. | 확인 가능한 1차 출처 없음 | 정확한 제목과 ALFWorld·WebShop 수치로 검색했으나 일치 논문을 찾지 못함 |
추론·행동·메모리 선행 연구
- Self-Consistency Improves Chain of Thought Reasoning in Language Models — 여러 추론 경로를 샘플링한 뒤 가장 일관된 답을 선택해 단일 greedy 추론의 우연성을 줄인다.
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models — 중간 사고 상태를 트리로 만들고 후보 평가·가지치기·백트래킹으로 탐색한다.
- Language Agent Tree Search Unifies Reasoning, Acting, and Planning in Language Models(LATS) — 몬테카를로 트리 탐색에 환경 피드백과 자기반성을 결합해 행동 계획을 반복 개선한다.
- More Agents Is All You Need — 같은 모델의 여러 독립 응답을 집계해 모델 가중치 변경 없이 추론 성능을 높이는 샘플링 전략을 분석한다.
- ReAct: Synergizing Reasoning and Acting in Language Models — 자연어 추론과 검색·환경 행동을 교대로 수행해 판단을 외부 관찰에 연결한다.
- Reflexion: Language Agents with Verbal Reinforcement Learning — 실패 피드백을 자연어 반성 메모리로 저장하고 다음 시도에서 재사용한다.
- Self-Refine: Iterative Refinement with Self-Feedback — 동일 모델이 초안 생성, 피드백 작성, 수정 단계를 반복하며 결과물을 개선한다.
- CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing — 검색·코드 실행 같은 외부 도구 결과를 근거로 모델이 자기 출력을 비평하고 수정한다.
- ExpeL: LLM Agents Are Experiential Learners — 여러 성공·실패 궤적에서 일반화 가능한 자연어 규칙을 추출해 새 과제에 적용한다.
- Voyager: An Open-Ended Embodied Agent with Large Language Models — Minecraft에서 자동 커리큘럼과 실행 가능한 코드 스킬 라이브러리를 축적하는 장기 학습 에이전트다.
코딩 에이전트와 하네스 비교
- AlphaCodium: From Prompt Engineering to Flow Engineering — 문제 분석, 테스트 생성, 해법 작성, 실행, 수정으로 이어지는 검증 중심 코딩 흐름을 제안한다.
- SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering — 저장소 탐색·편집·테스트에 맞춘 Agent–Computer Interface가 코딩 에이전트 성능을 좌우함을 보인다.
- AutoCodeRover: Autonomous Program Improvement — AST와 결함 위치 추정을 활용해 GitHub 이슈와 관련된 코드 문맥을 구조적으로 찾고 패치를 만든다.
- AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation — 프로그래머·테스트 설계자·테스트 실행자 역할을 분리하고 테스트 피드백으로 코드를 반복 수정한다.
- MapCoder: Multi-Agent Code Generation for Competitive Problem Solving — 유사 문제 기억 검색, 계획, 코드 생성, 디버깅을 역할별 에이전트로 나눈다.
- Three Roles, One Model — 하나의 고정 Qwen3-8B를 요약자·주 에이전트·격리된 교정자로 반복 호출해 작은 모델의 성능을 높인다.
- SWE-Bench Mobile · 공식 벤치마크 — 실제 iOS 제품 코드와 PRD·Figma를 사용해 같은 모델도 에이전트 하네스에 따라 최대 6배 차이남을 보고한다.
- Agentless: Demystifying LLM-based Software Engineering Agents — 자율 루프 대신 결함 위치화, 패치 생성, 패치 검증의 단순한 단계식 파이프라인을 사용한다.
멀티에이전트·자동 설계·반례
- Multiagent Debate — 여러 모델 인스턴스가 서로의 답과 논거를 보고 수정하도록 해 합의 기반 추론을 유도한다.
- Automated Design of Agentic Systems — 메타 에이전트가 에이전트 구성요소와 워크플로우 코드를 자동으로 제안하고 평가 아카이브를 통해 개선한다.
- Anthropic: How we built our multi-agent research system — 리드 에이전트가 병렬 서브에이전트에 조사 범위를 나누고 결과를 종합하는 프로덕션 리서치 시스템의 설계 경험을 설명한다.
- Large Language Models Cannot Self-Correct Reasoning Yet — 외부 피드백 없이 자기교정만 반복하면 처음의 올바른 답까지 훼손할 수 있음을 보여주는 반례 연구다.
- Harness Updating Is Not Harness Benefit — 하네스를 잘 갱신하는 능력과 갱신된 하네스를 실제 과제에서 활용하는 능력이 서로 다름을 분석한다.
원문의 “토론보다 다수결이 향상의 대부분을 설명한다”, “동일 예산에서 단일 에이전트가 멀티에이전트보다 낫다”는 문장에 대응하는 논문은 제공된 제목만으로 특정하지 못했다. 해당 주장들은 출처가 확인될 때까지 일반화된 결론으로 인용하지 않는 편이 안전하다.
관련 서베이
- A Survey of Self-Evolving Agents — 모델·메모리·도구·아키텍처 중 무엇을 언제 어떤 피드백으로 진화시키는지 체계화한다.
- Agentic Large Language Models, a Survey — 에이전트 연구를 추론, 행동, 상호작용의 세 축으로 정리하고 응용과 연구 과제를 제시한다.
- A Survey of Frontiers in LLM Reasoning — 추론 시 계산 확장, 추론 학습, 도구·멀티에이전트 기반 시스템을 하나의 분류 체계로 다룬다.
- “From Storage to Experience”와 “Memory for Autonomous LLM Agents”는 검색 결과에서 제목은 확인했지만 안정적인 arXiv 식별자를 특정하지 못해 링크를 보류했다.