에이전트를 “감싸는” 하네스 설계와, 에이전트가 스스로 개선하는 자가개선 루프.


하네스 설계

노트설명
2026-03-24-anthropic-harness-design장기 실행 에이전트를 위한 하네스 설계 가이드
2026-03-26-anthropic-harness-design장기 실행 애플리케이션 개발을 위한 하네스 설계
2026-03-23-aisparkup-post-10256AI 에이전트 성능을 좌우하는 하네스 설계 핵심 구조
2026-04-03-autoagent에이전트 하네스 자율 구축/반복 개선 도구 (Thirdlayer)
2026-04-03-qwen-function-calling-harness6.75%→100% Function Calling 성공률 개선 (Wrtn/AutoBe/Typia)
2026-03-21-gstackClaude Code 기반 Planning, Review, QA, Shipping 시스템
2026-04-08-openharness-agent-harnessHKUDS 오픈소스 에이전트 하네스 — oh CLI, 43+ tools, swarm coordination (7.1k★)
2026-04-08-rivet-agent-osWebAssembly + V8 에이전트 경량 OS — 6ms cold start, ACP, multiplayer (2.4k★)
2026-04-15-openharness-ohmo-agentOpenHarness의 메신저 내장 개인 에이전트 ohmo 발표
2026-05-21-superpowersagent workflow and skills framework
2026-05-21-ouroborosreplayable, specification-first agent OS/runtime
2026-04-19-everything-claude-code-ecc-guideharness-native operator workflow
2026-05-21-oh-my-agentportable multi-agent harness
2026-05-21-agent-harness-landscapecomparison note for the five repos
2026-06-03-claude-code-dynamic-workflowsClaude Code가 작업별 하네스를 직접 생성·오케스트레이션하는 동적 워크플로우 소개
2026-06-22-build-your-own-claude-code-langchain-deep-agentsLangChain Deep Agents로 Claude Code형 하네스(루프·도구·planning·context·subagents·sandbox·persistence)를 직접 조립하는 글
2026-07-12-elicit-aepl-verifiable-agentic-workflowsElicit의 검증 가능한 리서치 에이전트 — 튜링 불완전 DSL ‘ÆPL’과 작성·해석·재작성 루프, 하네스 교체 wrapper
[[summaries/2026-07-12-fighting-financial-crime-with-claude-cowork2026-07-12-fighting-financial-crime-with-claude-cowork]]
loop-engineering하네스 위에 자동화·상태·위임·검증·핸드오프를 얹어 계속 돌아가는 코딩 에이전트 운영 루프를 설계하는 개념
[[summaries/2026-08-12-nhncloud-meetup-420-bargain-sale-ends2026-08-12-nhncloud-meetup-420-bargain-sale-ends]]
[[summaries/2026-07-18-linkedin-sujin-loop-context-engineering2026-07-18-linkedin-sujin-loop-context-engineering]]
2026-08-01-bloom-ai-graph-harness-engineering확률론적 LLM과 결정론적 코드를 노드로 나눠 그래프로 잇는 설계 — 하네스·루프·그래프는 결국 같은 문제의 다른 층위
2026-04-16-agent-skills-realistic-benchmark-gap스킬 자체보다 retrieval·selection·refinement가 병목임을 보여준 현실 벤치마크 연구
2026-04-16-cloudflare-project-thinkDurable Objects 기반 장기 실행 에이전트 하니스와 execution ladder
openai-agents-apiOpenAI가 Codex 하네스를 클라우드 관리형 API로 공개한 서비스 — 세션·오케스트레이션·컨텍스트 압축·복구를 OpenAI가 관리하고, 개발자는 도구·실행 환경을 선택한다. 공개 베타 (2026-09-10).
2026-08-08-github-criptogus-hermesofficeagent-core의 ReAct loop·context compaction·tool retry·snapshot rollback·문서별 Hermes session ID를 공유하는 오피스 에이전트 하네스
2026-08-08-github-agentplugins-agent-plugins-specSkills·MCP·확장 디렉터리를 하나의 이동 가능한 Agent Plugin 패키지로 만드는 최소 표준
2026-08-08-github-duolahypercho-codex-routermodel registry·provider credential·caller capability·migration snapshot·doctor를 결합한 Codex 외부 모델 실행 하네스
[[summaries/2026-08-17-commandcode-ai2026-08-17-commandcode-ai]]
2026-08-17-commandcode-opencode-go-cursor-valueCommand Code·OpenCode Go·Cursor 하네스의 비용·모델·실행면을 비교한 가이드
2026-08-08-github-cloudflare-computerdurable workspace·backend capability·sync·agent tool plane을 결합한 Cloudflare-native 실행 하네스
2026-04-30-improving-deep-agents-with-harness-engineeringLangChain 하네스 엔지니어링 — Terminal Bench 2.0 Top 5, 자기검증+트레이싱으로 +13.7점
[[summaries/2026-05-24-agent-harness-engineering-survey2026-05-24-agent-harness-engineering-survey]]
2026-08-10-anthropic-managed-agentsAnthropic Managed Agents — 세션·하네스·샌드박스를 분리하는 brain/hands 메타-하네스 설계
2026-08-11-github-semantica-agi-semanticagraph-native context layer로 메모리·결정·provenance·reasoning을 하네스 외부 인프라로 연결
2026-08-11-github-nvidia-elementsNVIDIA Design System·CLI·MCP·agent skills를 결합한 UI agent harness 모노레포
2026-08-11-github-primeintellect-prime-agentpersistent IPython control environment·RLM 재귀 위임·Continual Harness refinement를 결합한 자기개선 코딩 에이전트
[[summaries/2026-08-15-x-deepseek-harness-developer-preview2026-08-15-x-deepseek-harness-developer-preview]]
deepseek-harnessDeepSeek Harness 엔티티 — Cordis 커널·패키지 지도·실행 모드 4종·턴 플로우·capability seam 구조 분석
2026-08-17-deepseek-harness-study-guideDeepSeek Harness의 부팅·세션 이벤트·도구 파이프라인·프리셋·샌드박스를 코드 흐름으로 학습하는 심층 가이드
2026-08-15-managed-deep-agents-overviewLangSmith가 하네스·런타임을 관리하고 파일 디렉터리로 에이전트를 정의하는 Managed Deep Agents 개요
2026-05-25-agent-harness-survey-resourcesAgent Harness Survey — 1차/2차 학습 리소스 인덱스
2026-06-01-gucci-harness-autonomous-coding-orchestrator테디노트 Gucci Harness — Hermes 위 GitHub 운영 자율화 (PM+6워커+SoT 계약)
2026-08-15-github-orbitosObsidian 볼트를 Claude Code/Gemini CLI 스킬·워크플로우로 오케스트레이션하는 개인 지식·일정 시스템
etclovg-e-executionETCLOVG · E — 실행 환경 / 샌드박스
etclovg-t-toolingETCLOVG · T — 도구 인터페이스 · 프로토콜
etclovg-c-contextETCLOVG · C — 컨텍스트 · 메모리 관리
etclovg-l-lifecycleETCLOVG · L — 라이프사이클 · 오케스트레이션
etclovg-o-observabilityETCLOVG · O — 관측 가능성 · 운영
etclovg-v-verificationETCLOVG · V — 검증 · 평가
etclovg-g-governanceETCLOVG · G — 거버넌스 · 보안
[[comparisons/2026-05-25-threads-geun-daeng-harness-benchmark2026-05-25-threads-geun-daeng-harness-benchmark]]
2026-04-19-anatomy-of-agent-harness에이전트 하네스 해부 — 구조, 패턴, 설계 원칙
2026-04-19-harness-is-everything하네스가 전부다 — 에이전트 성능의 핵심은 모델이 아닌 하네스
2026-07-11-harness-bench-research-and-open-projectsHarness-Bench 중심 하네스 효과 벤치마크 연구 + awesome list·안전감사·라이브 비교 오픈 프로젝트 지형
[[summaries/2026-08-25-github-llm-as-a-verifier2026-08-25-github-llm-as-a-verifier]]
2026-07-11-shopify-under-the-riverShopify River — Aquifer(Session·Harness·Sandbox 3계층 분리) 위 공개 기본(public-by-default) durable 에이전트 인프라; harness는 sandbox 밖에
2026-07-12-pytorchkr-topic-11209-hermes-hud-web-ui-aiHermes Agent의 상태·메모리·세션·비용·Replay를 보여주는 브라우저 대시보드
[[summaries/2026-07-14-building-against-the-big-labs-that-are-trying-to-eat-you2026-07-14-building-against-the-big-labs-that-are-trying-to-eat-you]]
2026-07-14-the-architect-s-guide-to-harness-engineering구매/커스터마이즈/구축 결정 기준, 하네스 평가 8대 진단 질문, 서브에이전트 라우팅·성능 서빙이라는 미래 방향 정리
2026-07-16-pytorchkr-topic-11267-why-write-code-in-2026소프트웨어 팩토리에서 인간의 직접 코딩·판단과 에이전트 반복 작업의 경계를 다룬 관점
2026-07-18-aisparkup-post-14547-xaiGrok Build 데이터 유출 논란과 xAI의 전체 코드 공개 대응 — 공개 후에도 서브에이전트에 남은 비공개 지시

자가개선 루프

노트설명
2026-03-26-autoimprove-ccSKILL.md 자동 개선 시스템
2026-03-29-dream-cycle에이전트가 밤에 ‘꿈’을 꾸면 아침마다 똑똑해진다
[[summaries/2026-05-24-gdb-self-improvement-prompt-for-codex2026-05-24-gdb-self-improvement-prompt-for-codex]]
2026-08-11-x-av1dlive-codex-self-improving-loopDeepSeek 실행·Luna 평가·Sol 프롬프트 재작성으로 Codex 작업을 반복 개선하는 3-model loop
2026-08-11-github-codejunkie99-codex-self-improving-loop연결 저장소의 고정 커밋·driver·role prompt·설치·demo를 코드 수준으로 검증한 companion note
[[summaries/2026-05-25-lucas-flatwhite-codex-workflow-packaging2026-05-25-lucas-flatwhite-codex-workflow-packaging]]
recursive-self-improvementRSI 개념 정리 — bounded refinement vs open-ended RSI, 검증 계층, 하네스 경로, Weco Level 1, 병목·안전
[[summaries/2026-07-11-chatgpt-agent-harness-performance-research2026-07-11-chatgpt-agent-harness-performance-research]]
2026-07-11-skillopt-self-evolving-agent-skills고정 모델의 외부 skill을 bounded edit와 validation gate로 최적화하는 연구
2026-07-18-memoharness-agent-harnesses-learn-from-experience실행 경험 은행으로 6개 하네스 제어면을 최적화하고 테스트 입력별로 적응시키는 연구
2026-07-18-pytorchkr-topic-11283-inkling-975b-moeInkling이 하네스 안에서 자기 파인튜닝과 장기 개선 루프를 수행하는 모델 공개 사례
2026-07-15-aspire-self-improving-robot-learning실행 흔적으로 로봇 제어 코드를 고치고 검증된 수정을 스킬로 축적하는 자기개선형 시스템
2026-07-15-pytorchkr-topic-11240-adala정답 데이터로 스킬 지시문을 반복 개선하는 자율 데이터 라벨링 에이전트 프레임워크
2026-03-29-agent-eval-checklistLangChain — 가장 단순한 eval로 시작해라
2026-07-19-loop-engineering-to-graph-engineering단일 자기개선 루프의 네 실패와 ‘루프들의 그래프’로의 전환, 그리고 앵커 없는 그래프는 순환적으로 실패한다는 에세이

에이전트 실행 도구

노트설명
2026-04-04-acpx-headless-acp-cliPTY 없이 ACP로 코딩 에이전트 호출 (Codex, Claude, Pi) (1.9k★)
2026-04-04-agent-device-mobile-cliiOS/Android UI 자동화 CLI (1303★, Callstack)
2026-08-05-github-muxy-app-muxymacOS 터미널 안에 AI provider hook, workspace API, CLI·확장 권한·runtime consent를 결합한 에이전트 실행 표면
2026-08-05-github-skalesapp-skalesReAct tool loop·승인 수준·5분 heartbeat·retry/block을 갖춘 로컬 데스크톱 에이전트 하네스(역사적 v7 소스 기준)

2026-07-20 신규 유입 (고아 정리)

노트설명
2026-07-07-software-after-ai-harness-era고정 워크플로우 SaaS가 지능으로 대체되는 시대, AI 에이전트 하네스를 구성하는 7가지 핵심 요소와 ‘가장 잘 타는 자가 승리한다’는 새 경쟁 구도.
2026-07-14-harness-books-claude-code-codex코드 작성 모델을 실제 엔지니어링 환경에 안착시키는 ‘하네스(harness)’ 구조를 다룬 두 권짜리 무료 온라인 책 소개.
[[summaries/2026-07-20-pytorchkr-topic-11305-mozilla-ai-2026-3-32026-07-20-pytorchkr-topic-11305-mozilla-ai-2026-3-3]]

2026-07-20 신규 유입 (고아 정리, 3차)

노트설명
2026-05-02-ouroboros-beats-claude-plan-mode한국 개발자의 오픈소스 Ouroboros가 이산사건 시뮬레이션 벤치마크에서 Claude Plan Mode를 제치고 1위를 기록.
2026-05-05-gn-long-running-agentsAI 에이전트가 수일~수주간 자율 실행될 때 필요한 체크포인트·메모리·세션 로그 설계를 Anthropic·Google·Cursor 사례로 정리한 글의 한국어 번역.
2026-05-25-diana-hu-ai-native-companyYC 파트너 Diana Hu가 AI를 회사 운영체제로 재정의하며 폐쇄 루프·AI 소프트웨어 팩토리·평평한 조직을 제시한다.
2026-05-25-threads-geun-daeng-personal-harness-swe-benchThreads 이용자가 직접 만든 오케스트레이션 하네스로 오픈소스 로컬 모델을 돌려 SWE-Bench Pro 72.6점(95% CI 66.4-78.1)을 기록했다는 자기 실험 공유.
2026-06-27-planning-harness-detailed-spec-workflow-automation기획자가 로컬 CLAUDE.md 규칙파일과 전용 스킬로 AI 상세기획을 통제하는 ‘기획 하네스’ 구축 사례 — 시퀀스 다이어그램·유저플로우 자동 생성.

2026-08-18 신규 유입

노트설명
2026-08-18-ai-frontier-ep110-ai-alignmentskill 조합·provenance·회사형 control plane·지식 노동의 Git·재귀적 자기개선의 정렬 문제를 다룬 대담

2026-08-23 신규 유입

노트설명
2026-08-23-trueforge-agent-harnessTrueFoundry의 오픈소스 에이전트 하네스 — 실행 루프·MCP·샌드박스·승인·컨텍스트 엔지니어링을 UI/SDK로 노출
2026-08-23-walkinglabs-learn-harness-engineeringwalkinglabs의 프로젝트 기반 하네스 엔지니어링 코스 — 5대 서브시스템·루프/그래프 엔지니어링·Pi/Claude Code/Codex/DeepSeek 하네스 해부
2026-08-23-enterprise-tech-stack-ai-agents규제 기업에서 감사·민감 데이터·인간 에스컬레이션·eval을 처음부터 내장하는 AI 에이전트 아키텍처
[[summaries/2026-08-23-tech-bridge-unlazy-skill2026-08-23-tech-bridge-unlazy-skill]]
[[summaries/2026-08-23-github-xintaofei-codeg2026-08-23-github-xintaofei-codeg]]
[[summaries/2026-08-23-github-dimillian-codexmonitor2026-08-23-github-dimillian-codexmonitor]]
[[summaries/2026-08-23-github-kenn-io-agentsview2026-08-23-github-kenn-io-agentsview]]
[[summaries/2026-08-25-github-miuuyy-codex-chatgpt-web2026-08-25-github-miuuyy-codex-chatgpt-web]]
[[summaries/2026-08-25-github-htdt-godogen2026-08-25-github-htdt-godogen]]
[[summaries/2026-07-21-maxmiksa-auto-company2026-07-21-maxmiksa-auto-company]]
[[summaries/2026-08-23-github-iamcorey-wake2026-08-23-github-iamcorey-wake]]

2026-08-25 신규 유입

노트설명
2026-08-25-ai-frontier-ep111-dokpamo-race모델 비교를 벤치마크에서 task harness·proxy 평가·control plane·Operator Agent의 반복 실행 루프로 확장한 대담

2026-08-30 신규 유입

노트설명
frontier-development에이전트가 계획·실행·검증까지 자율 수행하며 배포 속도를 단계함수적으로 높이는 AI 네이티브 개발 방식 — 4단계 진화·3경로·5습관·측정·병목
2026-08-30-clare-liguori-ai-native-five-habits아마존 50팀 관찰로 도출한 AI 네이티브 5가지 습관과 단계함수적 생산성의 조건 — 같은 무대 Garry Tan/Imad Touil 발표와 짝을 이루는 운영 규율
2026-08-30-imad-touil-ai-native-skills-governance에이전틱 스택의 두 루프, 스킬의 8원칙과 점진적 공개, 15팀 시뮬레이션과 중앙 플랫폼 거버넌스 — QuantumBlack Imad Touil의 AI Engineer World’s Fair 발표

2026-09-03 신규 유입

노트설명
2026-09-03-claude-code-team-workflowClaude Code 개발팀의 목표 위임·Slack 에이전트·루프·동적 fan-out 워크플로우·검증 중심 개발 방식

2026-08-29 신규 유입

노트설명
[[summaries/2026-08-29-github-lilmgenius-paperthin2026-08-29-github-lilmgenius-paperthin]]

2026-09-10 신규 유입 (X 북마크)

노트설명
2026-09-10-agent-graphs-loops-verification프롬프팅 종말·그래프 엔지니어링 — 루프에서 그래프로, Potato 플래닝 비판과 검증 우선
2026-09-10-pi-agent-workbenchPi 작업대 6개 오픈소스 확장 — 분업·상주개입·모델전환·루프·이식·일괄 구축

2026-09-12 신규 유입

노트설명
[[summaries/2026-09-12-threads-nvidia-sol-pi2026-09-12-threads-nvidia-sol-pi]]

2026-09-20 신규 유입 (YouTube)

노트설명
2026-09-20-pstack-overengineering플레이북 라우팅·Recall·probe·검증 스킬·실제 결과물 증명으로 코딩 에이전트를 감싸는 Pstack 운영 사례

2026-09-10 신규 유입 (Threads 저장)

노트설명
[[summaries/2026-09-10-threads-harnessdev-paper2026-09-10-threads-harnessdev-paper]]

관련 MOC


최종 업데이트: 2026-08-29 (Paperthin 고정 커밋 조사 노트 추가)