출처
- source_url: https://aisparkup.com/posts/14991
- author: Spark
- published: Tue, 04 Aug 2026 07:58:34 +0000
- raw: raw source:
2026-08-04-aisparkup-post-14991-deepseek-v4-flash
같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘
개요
Artificial Analysis 측정에서 DeepSeek V4 Flash 0731의 Intelligence Index 점수는 이전 버전보다 10점 오른 50점을 기록했습니다. 가격은 이전 버전과 동일해 지능 대비 비용 측면에서 경쟁력 있는 위치를 차지했습니다. 다만 AA-Omniscience 개선은 정확도 상승이 아니라 환각률 감소에서 비롯된 것으로 분석됐습니다. 사이먼 윌리슨의 테스트에서는 추론 강도를 high로 설정했을 때 같은 모델과 요청에서도 결과물의 완성도가 높아졌습니다.
핵심 포인트
- Intelligence Index: 이전 버전 40점에서 50점으로 상승했으며, 기사 기준 GPT-5.6 Luna의 51점에 근접했습니다.
- 에이전트 작업 평가도 개선됐습니다. GDPval-AA v2는 1189점에서 1559점으로, Terminal-Bench 2.1은 79%로 상승했습니다.
- API 가격은 입력 100만 토큰당 0.14달러, 출력 0.28달러로 유지됐고, 캐시 입력은 100만 토큰당 0.0028달러입니다.
- AA-Omniscience 지수는 -23에서 -16으로 개선됐지만, 정확도는 37%로 동일했습니다. 환각률이 95%에서 84%로 낮아진 것이 주요 변화였습니다.
- 모델의 파라미터 규모는 284B로 동일해, 일부 점수 개선은 모델의 지식 증가보다 응답 신중성 향상과 관련될 가능성이 제시됐습니다.
- 사이먼 윌리슨의 이미지 생성 테스트에서는 추론 강도를 기본값에서
high로 높였을 때 결과가 더 정돈됐습니다. - 모델 선택뿐 아니라 추론 강도 같은 설정값이 비용과 작업 품질 사이의 균형에 영향을 줄 수 있습니다.
왜 중요한가
이 사례는 벤치마크 점수 상승을 모델의 전반적인 지능 향상으로만 해석하기 어렵다는 점을 보여줍니다. 정확도가 그대로인 상태에서 환각률이 줄어들 수도 있으며, 실제 작업 결과는 추론 강도 설정에 따라 달라질 수 있습니다. 따라서 저비용 모델을 평가하거나 도입할 때는 단일 총점뿐 아니라 세부 지표, 추론 설정, 작업별 비용과 결과 품질을 함께 확인해야 합니다.
참고 링크
- 원문: https://aisparkup.com/posts/14991
- Artificial Analysis: https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash
- Simon Willison 테스트: https://simonwillison.net/2026/Jul/31/deepseek-v4-flash-0731/
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-04-aisparkup-post-14991-deepseek-v4-flash에 source_url 및 HTML 원문과 함께 저장되어 있습니다.