출처

Qwen3.8-Max: 2.4T 규모 플래그십 모델과 가중치 공개 예정

개요

Qwen 팀은 2026년 8월 3일 전체 2.4T, 토큰당 95B를 활성화하는 MoE 기반 플래그십 모델 Qwen3.8-Max를 공개했습니다. 이 모델은 Qwen3.5 아키텍처를 확장했으며 코딩, 리서치, 실무 자동화, 멀티모달 작업, 장기 과제 수행을 주요 개선 대상으로 삼았습니다. Qwen은 Max 계열 최초로 가중치를 공개할 예정이며, 8월 10~16일 사이 Hugging Face와 ModelScope에 배포할 계획이라고 밝혔습니다. 발표 사례는 단일 응답 성능보다 며칠 동안 스스로 계획·실행·검증·수정하는 에이전트 루프에 초점을 맞춥니다.

핵심 포인트

  • 모델 사양과 제공 방식: 전체 2.4T 파라미터, 토큰당 95B 활성화 MoE 구조이며, 공식 설정 기준 100만 토큰 컨텍스트를 지원합니다. reasoning_effortxhigh, medium, low로 조절할 수 있고 preserve_thinking은 기본 활성화되어 있습니다.
  • Max 계열 최초의 오픈 웨이트 계획: 가중치는 공개 예정 상태이며, 배포처로 Hugging FaceModelScope가 안내되었습니다. 현재는 QwenCloud에서 OpenAI 및 Anthropic 호환 API로 사용할 수 있다고 설명합니다.
  • 장기 자율 코딩: 모델이 16일 동안 oh-my-cli 저장소를 운영하며 이슈 상태 관리, 작업 분배, 테스트, CI, PR 병합을 수행했다는 사례가 소개되었습니다. 해당 저장소에는 당시 기준 커밋 265개, PR 127개, 이슈 151개가 기록되었습니다.
  • 연구와 문제 해결 루프: 논문 구현에 필요한 코드와 학습·평가 환경을 직접 구성하고, 125시간 동안 18개 개선 아이디어를 시험해 AIME24 점수를 논문 재현 기준선 49.58%에서 52.29%로 높였다고 보고했습니다. 526개 팀이 참가한 멀티모달 대회에서는 45회 제출을 거쳐 정확도 0.853을 기록했다고 설명합니다.
  • 장기 과제와 실무 자동화: 칩 설계 사례에서는 약 500턴 동안 검증을 반복하며 게이트 수를 8,298개에서 678개로 줄였다고 밝혔고, E-Commerce Bench에서는 365일 동안 상품·재고·가격·공급업체 협상을 수행하는 시뮬레이션 결과를 제시했습니다.
  • 멀티모달 에이전트와 평가 주의점: 문서·영상 이해뿐 아니라 자신이 만든 결과물을 시각적으로 점검하고 수정하는 피드백 루프, 코드와 GUI를 결합한 작업, RecreationBench, Qwen-MM-Plugins가 소개되었습니다. 일부 벤치마크는 자체 제작 환경이거나 모델별 하네스 조건이 달라 직접적인 순위 비교에는 주의가 필요합니다.

왜 중요한가

  • Max급 모델의 가중치가 실제로 공개되면 대규모 모델의 양자화, 서빙 최적화, 도메인 적응, 에이전트 하네스 연구를 API 외부에서도 시도할 수 있는 기반이 생깁니다.
  • 발표의 평가 관점이 한 번의 답변 품질에서 장기간의 계획 수립, 도구 사용, 실행 결과 검증, 실패 후 재시도로 확장되었다는 점에서 장기 자율 작업 벤치마크 설계에 참고가 됩니다.
  • 다만 공개된 사례와 성능 수치는 Qwen이 설계·선정한 환경에서 나온 결과가 많으므로, 가중치 공개 이후 동일 조건의 재현과 독립적인 평가가 필요합니다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-03-pytorchkr-topic-11509-qwen-max-2-4t-qwen3-8-maxsource_url 및 HTML 원문과 함께 저장되어 있습니다.