개요
Peng 외(arXiv:2302.06590)는 GitHub Copilot이 개발자 생산성에 미치는 영향을 검증하기 위해 통제된 실험(RCT)을 진행했다. 모집된 개발자들에게 JavaScript로 HTTP 서버를 구현하는 표준화된 과제를 주고, 처치 집단에는 Copilot 접근 권한을, 대조군에는 주지 않았다.
핵심 결과
- 초록에 따르면 Copilot을 사용한 집단이 대조군보다 과제를 55.8% 더 빠르게 완료했다.
왜 중요한지
이 실험은 좁고 표준화된 과제·지표에 대해서는 강력한 인과적 증거지만, 과제 자체가 협소하다는 한계가 있다. 하나의 통제된 벤치마크 결과를 모든 소프트웨어 엔지니어링 작업이나 자율 루프에 그대로 일반화해서는 안 된다는 것이 원 논문과 loop-engineering 관점 모두가 강조하는 지점이다. 생산성 수치를 인용할 때는 항상 “어떤 과제, 어떤 지표에서” 측정됐는지를 함께 명시해야 한다.