개요

ByteDance Seed·SUTD·조지아텍의 HarnessDev 논문(“Can LLMs Create and Evolve Their Own Agent Harness?”)을 @unclejobs.ai가 6연쓰레드로 소화했다. 루프·계획·검증기 없는 빈 껍데기를 6개 모델(Opus·GPT-5.5·Gemini·DeepSeek·Qwen·Seed)이 Claude Code·Codex 안에서 하네스로 짓게 해 2,207개 과제로 잰 결과다.

게시물 요지

  • 설정: 씨앗 껍데기 그대로는 전 벤치마크 0점. 종합 1위 Opus 67.8 vs 사람 하네스 참조 86.2. 코드·웹 조사는 크게 뒤졌고 ML 실험은 참조 24.0을 32.9로 넘었다. 데이터 과제 실패의 77.8%는 하네스 결함 탓이었다.
  • 코드량≠점수: 터미널 1위는 1,006줄 고친 Gemini(68.8)였고 3,562줄 짠 Qwen은 41.3. 스타일도 제각각(Opus 실행 스택 재작성 / GPT-5.5 단일 대형 에이전트 / Gemini 러너 제자리 수정). 공통 약점은 상태 저장으로, 체크포인트 구현은 18개 중 1개·궤적 26,679개 중 체크포인트 이벤트 0건이었다. 검증기도 얕아 퇴행 제출 441건을 아무도 못 잡았다.
  • 모델 교체는 공짜가 아니다: 전 하네스를 Gemini 하나로 돌리면 순위가 뒤집혔다(Qwen 조사 +17.6 / Opus 코드 69.3→33.0). Opus 하네스의 120스텝 하드코딩, 검색 하네스의 중복 검색 88.2%(Opus 10.1%→Gemini 88.2%)처럼 하네스에 박힌 가정이 원인이다.
  • 자기 개선의 한계: 보이는 시험지에서만 오르고 숨긴 문제에선 평균 +3.11. 버전 전환 64회 중 노이즈 초과 이득 2회, 독립 검증기 수정 전환 0회. 작성자의 한 줄 평은 “‘모델 교체는 공짜가 아니다’ — 남의 하네스에 다른 모델을 꽂을 땐 점수보다 정지 규칙과 스텝 한도부터 보라.”
  • 단서: 사람 참조값은 서로 다른 모델·하네스 조합의 공개 기록이라 동일 조건 비교가 아니라고 저자들이 명시했다.

확인 범위와 한계

  • 논문 원문(arXiv)이 아닌 Threads 소화본 기준이다. 수치·해석의 1차 검증은 원문이 필요하다.
  • 게시 시점(4일 전) 기준 pre-print일 가능성이 있어 인용 시 버전을 확인할 것.

관련 위키

검증

  • Threads 게시물을 ego-browser로 2026-09-10에 직접 렌더링해 6개 포스트 전문을 캡처했다.
  • 원문은 raw/articles/2026-09-10-threads-harnessdev-paper.md에 보존했고 SHA-256을 기록했다.