개요

GeekNews가 소개한 tryai.dev의 비교는 12개 모델에 동일한 웹 앱을 처음부터 만들게 하고, 과제별 성공 횟수·비용·시간·생성물 품질을 비교한다. 대상은 Doom 스타일 레이캐스터 미로, 3D 루빅스 큐브, 계산기, Conway’s Game of Life이며, 주된 세 과제는 모델별 5회 실행으로 평가했다.

이 결과는 생성물을 직접 살펴본 주관적 비교다. 과제별 성공 기준은 기능 중심이지만, 평가자의 선호와 구현 품질 판단이 포함되므로 일반적인 모델 능력의 과학적 순위표로 해석하면 안 된다.

비교 대상

  • GPT-5.6: Sol, Terra, Luna
  • Anthropic: Claude Fable 5, Claude Opus 4.8
  • 기타 상용 모델: Grok 4.5, GPT-5.5, Muse Spark 1.1
  • Fireworks 제공 오픈 웨이트 모델: Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6, GLM-5.2

핵심 결과

과제가장 강한 결과관찰
레이캐스터 미로GPT-5.6 Sol, Grok 4.5, GPT-5.6 Luna가 5/5Sol은 품질과 세부 묘사가 좋았고, Luna는 0.27·62초의 실용적 대안이었다.
3D 루빅스 큐브Claude Fable 5가 5/5Fable 5만 다섯 번 모두 애니메이션·색상 오류 없이 성공했다. GPT-5.6 Sol·Terra는 4/5, Opus 4.8·Luna·GLM-5.2는 0/5였다.
계산기Claude Opus 4.8·Fable 5·Grok 4.5·GPT-5.6 Luna가 5/5단순 기능 과제에서는 최신 플래그십 간 격차가 작았다. Qwen 3.7 Plus도 $0.04·12초에 4/5를 기록했다.
Game of LifeGrok 4.5와 오픈 웨이트 모델이 경쟁력공개 예제와 구현 패턴이 풍부한 과제라 Qwen 3.7 Plus(0.10·121초)도 낮은 비용으로 좋은 결과를 냈다.

모델 선택에 대한 해석

GPT-5.6 계열

  • Sol: 레이캐스터에서 5/5로 가장 좋은 결과를 냈지만 비용이 $1.35, 120초로 높았다. 복잡한 시각적 구현에서 품질을 우선할 때 적합한 모습이다.
  • Terra: 레이캐스터 3/5, 루빅스 큐브 4/5로 Sol보다 저렴하고 빠른 균형형 후보지만, 일부 결과에서 이동이나 애니메이션이 깨졌다.
  • Luna: 레이캐스터 5/5, $0.15·23초로 비용·속도 경쟁력이 매우 높았다. 다만 루빅스 큐브에서는 섞기 동작 후 결과가 깨져 0/5였다.

Claude Fable 5와 Opus 4.8

Fable 5는 루빅스 큐브에서 5/5를 기록하고 계산기·SVG 과제에서도 스타일과 세부 묘사가 좋았지만, 레이캐스터에서는 3/5로 일관성이 낮았다. Opus 4.8은 계산기에서는 5/5였으나 루빅스 큐브에서는 작은 오류와 색상 변화 때문에 0/5였다. 같은 모델 계열도 과제의 구조와 오류 민감도에 따라 결과가 크게 달라졌다.

Grok 4.5와 Muse Spark 1.1

Grok 4.5는 레이캐스터 5/5, 계산기 5/5, Game of Life에서도 좋은 결과를 내며 비용 대비 실용적인 대안으로 평가됐다. Muse Spark 1.1은 일부 작동 결과의 품질은 높았지만 전체 일관성은 낮아, 오픈 웨이트 모델보다 대체로 낫되 Grok보다 우선할 이유는 제한적이었다.

오픈 웨이트 모델

복잡하고 새로운 레이캐스터·루빅스 큐브에서는 최상위 상용 모델과 격차가 있었지만, 구현 예제가 풍부한 Game of Life와 단순 계산기에서는 Qwen 3.7 Plus와 GLM-5.2가 매우 낮은 비용으로 경쟁력 있는 결과를 냈다. 따라서 오픈 웨이트 모델의 성능을 하나의 앱 과제로 일반화하기보다, 과제의 친숙도와 학습 데이터·예제의 풍부함을 함께 봐야 한다.

속도와 비용

짧은 프롬프트의 응답 시작 시간은 GPT-5.6 계열이 가장 빨랐다. Luna는 1.0초·97 tok/s·0.001, Sol은 1.8초·45 tok/s·0.001로 매우 저렴하고 빨랐다.

다만 일부 오픈 웨이트 모델은 답변을 한 번에 내보내며 400토큰 상한에 도달했으므로, 표시된 tok/s는 실제 디코딩 속도와 다를 수 있다. 비용·속도 수치만으로 앱 생성 품질을 판단해서는 안 된다.

실무적 시사점

  • 복잡하고 새로운 UI·상태·애니메이션을 한 번에 구현할 때는 최상위 상용 모델이 여전히 유리하지만, 모델별 강점이 과제마다 바뀐다.
  • 단순하거나 널리 알려진 패턴은 저가·오픈 웨이트 모델로 먼저 시도하고, 실패한 경우에만 상위 모델로 승격하는 라우팅이 합리적이다.
  • 빠른 초안 생성에는 GPT-5.6 Luna·Terra나 Qwen 3.7 Plus가 유리하고, 시각적 완성도·복잡한 동작 검증에는 Sol·Fable 5 같은 상위 모델을 고려할 수 있다.
  • 원샷 앱 생성 결과는 실제 기존 코드베이스 유지보수·기능 추가·테스트 능력과 다르므로, 후속 변경 작업을 포함한 평가가 필요하다.

한계

  • 생성 결과를 사람이 직접 관찰한 주관적 평가이며 객관적인 벤치마크가 아니다.
  • 과제별 프롬프트와 평가 기준의 세부가 충분히 표준화되지 않으면 재현성이 제한된다.
  • 4개 앱의 원샷 생성은 실제 소프트웨어 엔지니어링의 기존 코드 수정·테스트·유지보수 흐름을 대변하지 않는다.
  • Game of Life처럼 공개 예제가 풍부한 과제의 결과를 일반적인 추론·코딩 성능으로 확대하면 안 된다.

관련 페이지

출처