출처

개요

darwin-skill은 SKILL.md 기반 에이전트 스킬을 평가하고, 한 번에 한 가지를 개선한 뒤 테스트 결과에 따라 유지하거나 되돌리는 최적화 시스템입니다. Andrej Karpathy의 autoresearch에서 영감을 받았지만, 스킬 품질에는 사람의 판단이 필요하다고 보고 최적화 과정에 사용자 확인을 포함합니다. 2.0 버전에서는 SkillLens와 SkillOpt의 영향을 반영해 9차원 평가 루브릭과 검증 게이트를 도입했습니다. 점수가 개선된 변경만 커밋하고 하락한 변경은 되돌리는 래칫 방식으로 스킬의 회귀를 방지합니다.

핵심 포인트

  • 평가→개선→테스트→사람 확인→유지/되돌리기 순서로 스킬을 반복 최적화합니다.
  • 한 라운드에는 SKILL.md의 한 가지 평가 차원만 수정해 어떤 변경이 효과를 냈는지 추적합니다.
  • 수정한 에이전트와 분리된 독립 서브에이전트 2개가 다시 평가하며, 다음 라운드에는 새 심사자를 사용해 평가 편향을 줄입니다.
  • 구조 점수와 테스트 프롬프트 실행 결과를 결합한 9차원, 100점 만점 루브릭을 사용합니다. 실행 성능, 실패 경로 명시, 실행 가능한 구체성, 고위험 작업 블랙리스트 등이 포함됩니다.
  • 점수가 오르면 git commit으로 유지하고, 하락하면 git revert로 되돌립니다. 한 라운드의 상승 폭이 1점 미만이면 불필요한 편집을 막기 위해 조기 종료합니다.
  • 여러 에이전트에서 수십 개의 스킬을 운영하는 사용자에게 적합하지만, 스킬이 적거나 사람 확인 없는 완전 자동 최적화를 원하는 경우에는 비용과 설계 목적이 맞지 않을 수 있습니다.
  • 사용 전 git 저장소에서 기존 변경분을 커밋하거나 stash하고, 셸 명령·git 조작·자격증명·파일 게시를 다루는 스킬은 각 라운드의 diff를 확인해야 합니다.

왜 중요한가

기존의 스킬 검토가 형식과 경로 같은 정적 조건에 치우쳤다면, darwin-skill은 실제 테스트 프롬프트의 출력과 회귀 여부를 기준으로 스킬을 개선하려고 합니다. 또한 모든 실험을 git 커밋 단위로 관리하고 낮은 점수의 변경을 되돌리므로, 스킬이 장기간 수정되는 과정에서 품질 기준선이 누적해서 하락하는 것을 방지하는 구조를 제공합니다. 다만 게시글에 소개된 점수 향상 사례는 저자가 README에 제시한 측정 결과이므로, 실제 도입 시에는 자신의 스킬과 평가 프롬프트로 별도 검증해야 합니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-03-pytorchkr-topic-11492-darwin-skillsource_url 및 HTML 원문과 함께 저장되어 있습니다.