에이전트를 “감싸는” 하네스 설계와, 에이전트가 스스로 개선하는 자가개선 루프.


하네스 설계

노트설명
2026-03-24-anthropic-harness-design장기 실행 에이전트를 위한 하네스 설계 가이드
2026-03-26-anthropic-harness-design장기 실행 애플리케이션 개발을 위한 하네스 설계
2026-03-23-aisparkup-post-10256AI 에이전트 성능을 좌우하는 하네스 설계 핵심 구조
2026-04-03-autoagent에이전트 하네스 자율 구축/반복 개선 도구 (Thirdlayer)
2026-04-03-qwen-function-calling-harness6.75%→100% Function Calling 성공률 개선 (Wrtn/AutoBe/Typia)
2026-03-21-gstackClaude Code 기반 Planning, Review, QA, Shipping 시스템
2026-04-08-openharness-agent-harnessHKUDS 오픈소스 에이전트 하네스 — oh CLI, 43+ tools, swarm coordination (7.1k★)
2026-04-08-rivet-agent-osWebAssembly + V8 에이전트 경량 OS — 6ms cold start, ACP, multiplayer (2.4k★)
2026-04-15-openharness-ohmo-agentOpenHarness의 메신저 내장 개인 에이전트 ohmo 발표
2026-05-21-superpowersagent workflow and skills framework
2026-05-21-ouroborosreplayable, specification-first agent OS/runtime
2026-04-19-everything-claude-code-ecc-guideharness-native operator workflow
2026-05-21-oh-my-agentportable multi-agent harness
2026-05-21-agent-harness-landscapecomparison note for the five repos
2026-06-03-claude-code-dynamic-workflowsClaude Code가 작업별 하네스를 직접 생성·오케스트레이션하는 동적 워크플로우 소개
2026-06-22-build-your-own-claude-code-langchain-deep-agentsLangChain Deep Agents로 Claude Code형 하네스(루프·도구·planning·context·subagents·sandbox·persistence)를 직접 조립하는 글
2026-07-12-elicit-aepl-verifiable-agentic-workflowsElicit의 검증 가능한 리서치 에이전트 — 튜링 불완전 DSL ‘ÆPL’과 작성·해석·재작성 루프, 하네스 교체 wrapper
2026-07-12-fighting-financial-crime-with-claude-coworkQonto — 오케스트레이터+원자적 서브스킬 플러그인 구조와 MCP Gateway(신뢰 경계: SSO·PASETO·RBAC·감사)로 보안·컴플라이언스를 하네스 설계에 내장
loop-engineering하네스 위에 자동화·상태·위임·검증·핸드오프를 얹어 계속 돌아가는 코딩 에이전트 운영 루프를 설계하는 개념
2026-07-18-linkedin-sujin-loop-context-engineeringPrompt → Context → Harness → Loop의 계층 변화와 루프의 구성 요소·검증 부채를 정리한 LinkedIn 요약
2026-04-16-agent-skills-realistic-benchmark-gap스킬 자체보다 retrieval·selection·refinement가 병목임을 보여준 현실 벤치마크 연구
2026-04-16-cloudflare-project-thinkDurable Objects 기반 장기 실행 에이전트 하니스와 execution ladder
2026-04-16-openai-agents-sdk-next-evolutionMCP·skills·AGENTS.md·sandbox를 통합한 OpenAI model-native harness
2026-04-30-improving-deep-agents-with-harness-engineeringLangChain 하네스 엔지니어링 — Terminal Bench 2.0 Top 5, 자기검증+트레이싱으로 +13.7점
2026-05-24-agent-harness-engineering-surveyAgent Harness Engineering: A Survey — ETCLOVG 7계층 서베이 (한국어 상세 확장 + 7 sub-page)
2026-05-25-agent-harness-survey-resourcesAgent Harness Survey — 1차/2차 학습 리소스 인덱스
2026-06-01-gucci-harness-autonomous-coding-orchestrator테디노트 Gucci Harness — Hermes 위 GitHub 운영 자율화 (PM+6워커+SoT 계약)
etclovg-e-executionETCLOVG · E — 실행 환경 / 샌드박스
etclovg-t-toolingETCLOVG · T — 도구 인터페이스 · 프로토콜
etclovg-c-contextETCLOVG · C — 컨텍스트 · 메모리 관리
etclovg-l-lifecycleETCLOVG · L — 라이프사이클 · 오케스트레이션
etclovg-o-observabilityETCLOVG · O — 관측 가능성 · 운영
etclovg-v-verificationETCLOVG · V — 검증 · 평가
etclovg-g-governanceETCLOVG · G — 거버넌스 · 보안
2026-05-25-threads-geun-daeng-harness-benchmarkThreads 포스트 — 로컬 모델/오픈소스 하네스 벤치마크 주장
2026-04-19-anatomy-of-agent-harness에이전트 하네스 해부 — 구조, 패턴, 설계 원칙
2026-04-19-harness-is-everything하네스가 전부다 — 에이전트 성능의 핵심은 모델이 아닌 하네스
2026-07-11-harness-bench-research-and-open-projectsHarness-Bench 중심 하네스 효과 벤치마크 연구 + awesome list·안전감사·라이브 비교 오픈 프로젝트 지형
2026-07-11-shopify-under-the-riverShopify River — Aquifer(Session·Harness·Sandbox 3계층 분리) 위 공개 기본(public-by-default) durable 에이전트 인프라; harness는 sandbox 밖에
2026-07-12-pytorchkr-topic-11209-hermes-hud-web-ui-aiHermes Agent의 상태·메모리·세션·비용·Replay를 보여주는 브라우저 대시보드
2026-07-14-building-against-the-big-labs-that-are-trying-to-eat-youShortcut vs Claude for Excel — 좁은 도메인 하네스 집중·모델 자유·고객 밀착으로 빅랩을 이기는 구조적 전략
2026-07-14-the-architect-s-guide-to-harness-engineering구매/커스터마이즈/구축 결정 기준, 하네스 평가 8대 진단 질문, 서브에이전트 라우팅·성능 서빙이라는 미래 방향 정리
2026-07-16-pytorchkr-topic-11267-why-write-code-in-2026소프트웨어 팩토리에서 인간의 직접 코딩·판단과 에이전트 반복 작업의 경계를 다룬 관점
2026-07-18-aisparkup-post-14547-xaiGrok Build 데이터 유출 논란과 xAI의 전체 코드 공개 대응 — 공개 후에도 서브에이전트에 남은 비공개 지시

자가개선 루프

노트설명
2026-03-26-autoimprove-ccSKILL.md 자동 개선 시스템
2026-03-29-dream-cycle에이전트가 밤에 ‘꿈’을 꾸면 아침마다 똑똑해진다
2026-05-24-gdb-self-improvement-prompt-for-codexGreg Brockman의 짧은 Codex self-improvement 티저
2026-05-25-lucas-flatwhite-codex-workflow-packaging반복 워크플로우를 skill/subagent/automation으로 포장하도록 유도하는 Codex 메타프롬프트
2026-07-04-harness-engineering-for-self-improvementLilian Weng — 하네스 엔지니어링을 RSI의 현실적 경로로 보고 context/workflow/harness-code/evolutionary search를 정리
2026-07-11-chatgpt-agent-harness-performance-research동일 모델에서 도구·컨텍스트·검증·메모리·탐색 구조가 시스템 성능을 높인 연구와 사례 조사
2026-07-11-skillopt-self-evolving-agent-skills고정 모델의 외부 skill을 bounded edit와 validation gate로 최적화하는 연구
2026-07-18-memoharness-agent-harnesses-learn-from-experience실행 경험 은행으로 6개 하네스 제어면을 최적화하고 테스트 입력별로 적응시키는 연구
2026-07-18-pytorchkr-topic-11283-inkling-975b-moeInkling이 하네스 안에서 자기 파인튜닝과 장기 개선 루프를 수행하는 모델 공개 사례
2026-07-15-aspire-self-improving-robot-learning실행 흔적으로 로봇 제어 코드를 고치고 검증된 수정을 스킬로 축적하는 자기개선형 시스템
2026-07-15-pytorchkr-topic-11240-adala정답 데이터로 스킬 지시문을 반복 개선하는 자율 데이터 라벨링 에이전트 프레임워크
2026-03-29-agent-eval-checklistLangChain — 가장 단순한 eval로 시작해라
2026-07-19-loop-engineering-to-graph-engineering단일 자기개선 루프의 네 실패와 ‘루프들의 그래프’로의 전환, 그리고 앵커 없는 그래프는 순환적으로 실패한다는 에세이

에이전트 실행 도구

노트설명
2026-04-04-acpx-headless-acp-cliPTY 없이 ACP로 코딩 에이전트 호출 (Codex, Claude, Pi) (1.9k★)
2026-04-04-agent-device-mobile-cliiOS/Android UI 자동화 CLI (1303★, Callstack)

2026-07-20 신규 유입 (고아 정리)

노트설명
2026-07-07-software-after-ai-harness-era고정 워크플로우 SaaS가 지능으로 대체되는 시대, AI 에이전트 하네스를 구성하는 7가지 핵심 요소와 ‘가장 잘 타는 자가 승리한다’는 새 경쟁 구도.
2026-07-14-harness-books-claude-code-codex코드 작성 모델을 실제 엔지니어링 환경에 안착시키는 ‘하네스(harness)’ 구조를 다룬 두 권짜리 무료 온라인 책 소개.
2026-07-20-pytorchkr-topic-11305-mozilla-ai-2026-3-3Mozilla의 첫 연례 보고서 — 오픈모델과 폐쇄형의 능력 격차는 3.3%, 추론 비용은 36개월간 50배 하락, 경쟁의 무게중심은 모델에서 에이전트 하니스로 이동.

2026-07-20 신규 유입 (고아 정리, 3차)

노트설명
2026-05-02-ouroboros-beats-claude-plan-mode한국 개발자의 오픈소스 Ouroboros가 이산사건 시뮬레이션 벤치마크에서 Claude Plan Mode를 제치고 1위를 기록.
2026-05-05-gn-long-running-agentsAI 에이전트가 수일~수주간 자율 실행될 때 필요한 체크포인트·메모리·세션 로그 설계를 Anthropic·Google·Cursor 사례로 정리한 글의 한국어 번역.
2026-05-25-diana-hu-ai-native-companyYC 파트너 Diana Hu가 AI를 회사 운영체제로 재정의하며 폐쇄 루프·AI 소프트웨어 팩토리·평평한 조직을 제시한다.
2026-05-25-threads-geun-daeng-personal-harness-swe-benchThreads 이용자가 직접 만든 오케스트레이션 하네스로 오픈소스 로컬 모델을 돌려 SWE-Bench Pro 72.6점(95% CI 66.4-78.1)을 기록했다는 자기 실험 공유.
2026-06-27-planning-harness-detailed-spec-workflow-automation기획자가 로컬 CLAUDE.md 규칙파일과 전용 스킬로 AI 상세기획을 통제하는 ‘기획 하네스’ 구축 사례 — 시퀀스 다이어그램·유저플로우 자동 생성.

관련 MOC


최종 업데이트: 2026-07-18 (xAI Grok Build 데이터 유출·전체 코드 공개 요약 추가)