출처

  • source_url: https://aisparkup.com/posts/14991
  • author: Spark
  • published: Tue, 04 Aug 2026 07:58:34 +0000
  • raw: raw source: 2026-08-04-aisparkup-post-14991-deepseek-v4-flash

같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘

개요

Artificial Analysis 측정에서 DeepSeek V4 Flash 0731의 Intelligence Index 점수는 이전 버전보다 10점 오른 50점을 기록했습니다. 가격은 이전 버전과 동일해 지능 대비 비용 측면에서 경쟁력 있는 위치를 차지했습니다. 다만 AA-Omniscience 개선은 정확도 상승이 아니라 환각률 감소에서 비롯된 것으로 분석됐습니다. 사이먼 윌리슨의 테스트에서는 추론 강도를 high로 설정했을 때 같은 모델과 요청에서도 결과물의 완성도가 높아졌습니다.

핵심 포인트

  • Intelligence Index: 이전 버전 40점에서 50점으로 상승했으며, 기사 기준 GPT-5.6 Luna의 51점에 근접했습니다.
  • 에이전트 작업 평가도 개선됐습니다. GDPval-AA v2는 1189점에서 1559점으로, Terminal-Bench 2.1은 79%로 상승했습니다.
  • API 가격은 입력 100만 토큰당 0.14달러, 출력 0.28달러로 유지됐고, 캐시 입력은 100만 토큰당 0.0028달러입니다.
  • AA-Omniscience 지수는 -23에서 -16으로 개선됐지만, 정확도는 37%로 동일했습니다. 환각률이 95%에서 84%로 낮아진 것이 주요 변화였습니다.
  • 모델의 파라미터 규모는 284B로 동일해, 일부 점수 개선은 모델의 지식 증가보다 응답 신중성 향상과 관련될 가능성이 제시됐습니다.
  • 사이먼 윌리슨의 이미지 생성 테스트에서는 추론 강도를 기본값에서 high로 높였을 때 결과가 더 정돈됐습니다.
  • 모델 선택뿐 아니라 추론 강도 같은 설정값이 비용과 작업 품질 사이의 균형에 영향을 줄 수 있습니다.

왜 중요한가

이 사례는 벤치마크 점수 상승을 모델의 전반적인 지능 향상으로만 해석하기 어렵다는 점을 보여줍니다. 정확도가 그대로인 상태에서 환각률이 줄어들 수도 있으며, 실제 작업 결과는 추론 강도 설정에 따라 달라질 수 있습니다. 따라서 저비용 모델을 평가하거나 도입할 때는 단일 총점뿐 아니라 세부 지표, 추론 설정, 작업별 비용과 결과 품질을 함께 확인해야 합니다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-04-aisparkup-post-14991-deepseek-v4-flashsource_url 및 HTML 원문과 함께 저장되어 있습니다.