출처
- source_url: https://aisparkup.com/posts/14729
- author: Spark
- published: Sat, 25 Jul 2026 01:44:00 +0000
- raw: 2026-07-25-aisparkup-post-14729-ai-1-008
개요
유명한 “펠리컨이 자전거를 타는 SVG를 그려라” 프롬프트를 AI 연구소들이 의도적으로 학습했다는 의혹을 검증하기 위해 48가지 동물·탈것 조합을 비교한 실험이 진행됐다. Dylan Castillo는 7개 모델에 각 조합을 3번씩 요청해 총 1,008개의 SVG를 생성하고, 별도의 AI 모델로 동물·탈것·동작의 자연스러움을 5점 만점으로 평가했다. 펠리컨은 8개 동물 중 6위, 자전거는 6개 탈것 중 5위로 특별히 높은 성능을 보이지 않았다. 회귀분석에서도 펠리컨이나 펠리컨-자전거 조합에 대한 통계적으로 유의미한 보너스는 확인되지 않았다. 따라서 특정 프롬프트를 겨냥한 ‘pelicanmaxxing’의 뚜렷한 증거는 없으며, SVG 생성 능력 전반을 개선했다는 설명이 더 그럴듯하다는 결론이다.
핵심 포인트
- 동물 8종과 탈것 6종을 조합한 48개 프롬프트를 구성했다.
- GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro가 각각 3개 샘플씩 생성해 총 1,008개 SVG를 만들었다.
- GPT-5.6 Luna가 동물 표현력, 탈것 표현력, 동작의 자연스러움을 평가했다.
- 펠리컨 관련 성능 보너스는 7개 모델 모두 -0.11~+0.14점 범위였고, 통계적으로 유의미하지 않았다.
- Gemini 3.5 Flash의 자전거 관련 결과도 다중비교 보정 후에는 유의미하지 않은 것으로 나타났다.
- 펠리컨-자전거 이미지 21개가 모두 오른쪽을 향했지만, 전체 이미지에서도 오른쪽 구도가 흔해 조작의 증거로 보기는 어려웠다.
- 실험은 특정 프롬프트가 아닌 SVG 생성 능력 전반을 최적화한 경우까지는 식별하지 못한다.
왜 중요한가
유명한 비공식 벤치마크에서 높은 성능이 관찰됐다는 사실만으로 특정 테스트를 겨냥한 학습이나 벤치마크 조작을 단정하기는 어렵다. 이 실험은 하나의 사례를 다양한 비교군으로 확장하고, 모델 평가와 통계적 검정을 함께 적용해 의혹을 검증하려 한 접근을 보여준다. 다만 표본 수, 평가 모델, 대상 모델 수가 제한적이고 SVG 생성 능력 전반의 개선과 특정 프롬프트 최적화를 완전히 구분할 수 없으므로, 결과는 “조작이 없다”가 아니라 “뚜렷한 증거를 찾지 못했다”는 의미로 해석해야 한다.
참고 링크
- 원문: https://aisparkup.com/posts/14729
- 실험 원문: https://dylancastillo.co/posts/pelicanmaxxing.html
- 실험 코드 및 데이터: https://github.com/dylancastillo/blog/tree/main/_extras/pelicanmaxxing
관련 위키
원문 보존 위치
원문 전체는 2026-07-25-aisparkup-post-14729-ai-1-008에 source_url 및 HTML 원문과 함께 저장되어 있습니다.