출처
- source_url: https://discuss.pytorch.kr/t/tencent-295b-21b-moe-hy3/11147
- author: 9bow
- published: Wed, 08 Jul 2026 08:30:50 +0000
- raw: raw source:
web-2026-07-08-pytorchkr-topic-11147-tencent-hy3-295b-moe-reasoning-agent-model
개요
Tencent Hy3는 텐센트 훈위안(Tencent Hy, 구 Hunyuan) 팀이 공개한 Apache 2.0 라이선스의 오픈소스 대규모 언어 모델이다. 전체 파라미터는 295B이지만, MoE 구조를 통해 토큰당 21B만 활성화해 추론 비용과 지연 시간을 줄이는 방향으로 설계됐다. Hy3 Preview 이후 50개 이상 텐센트 제품의 피드백과 확장된 사후 학습을 반영해 정식 버전으로 공개됐다. 텐센트는 Hy3가 추론, 에이전트, 긴 컨텍스트 작업에서 비슷한 규모의 모델뿐 아니라 더 큰 오픈소스 플래그십 모델과도 경쟁할 수 있다고 설명한다. 다만 벤치마크상 Claude Opus 4.8, GPT-5.5 같은 최상위 상용 모델과는 일부 코딩·지식 추론 과제에서 아직 차이가 있다.
핵심 포인트
-
Hy3는 전체 295B 파라미터 중 매 토큰마다 21B만 활성화하는 MoE 모델이며, 80개 Transformer 레이어, 192개 전문가, top-8 전문가 활성화 구조를 사용한다.
-
256K 컨텍스트 길이를 지원하며, GQA를 적용해 긴 컨텍스트 처리 시 KV 캐시 메모리 부담을 줄이는 설계를 채택했다.
-
3.8B 규모의 MTP(Multi-Token Prediction) 레이어를 포함하며, vLLM/SGLang에서 speculative decoding에 활용해 생성 속도를 높일 수 있다.
-
Hy3 Preview 대비 DeepSWE, SkillsBench, MathArena Apex, HLE, USAMO 2026 등 여러 추론·에이전트 벤치마크에서 점수가 크게 개선됐다.
-
SWE-bench Verified, BrowseComp, GPQA Diamond, AA-LCR 등에서 주요 오픈소스·상용 모델과 비교한 결과가 공개됐으며, 텐센트가 강조하는 강점은 절대 1위보다는 “활성 21B 대비 성능 효율”이다.
-
Hy3와 Hy3-FP8 가중치는 Apache License 2.0으로 Hugging Face, ModelScope, GitCode, CNB에 공개됐고, vLLM/SGLang 서빙 레시피와 LLaMA-Factory/ms-swift 기반 파인튜닝 파이프라인도 제공된다.
-
reasoning_effort 파라미터로 no_think, low, high 모드를 선택할 수 있어 단순 응답과 복잡한 추론 작업을 같은 모델에서 구분해 사용할 수 있다.
왜 중요한지
Hy3는 대형 MoE 모델에서 “전체 파라미터 규모”와 “실제 추론 시 활성 파라미터”를 분리해 성능과 비용 사이의 균형을 노린 사례다. 전체 295B의 지식 용량을 유지하면서도 활성 파라미터를 21B로 제한한다는 점은 실제 서비스 배포에서 중요한 추론 비용, 지연 시간, GPU 메모리 요구량과 직접 연결된다. 또한 Apache 2.0 라이선스, FP8 모델, vLLM/SGLang 레시피, 파인튜닝 파이프라인이 함께 공개되어 연구용 모델을 넘어 실제 적용 가능성을 높였다. 특히 도구 호출 안정성, 환각 감소, 다중 턴 문맥 유지, 여러 에이전트 스캐폴딩 간 성능 일관성 개선을 강조한 점은 에이전트형 LLM을 제품에 통합하려는 사용자에게 참고할 만하다.
후속으로 볼 링크와 키워드
링크
- 원문: https://discuss.pytorch.kr/t/tencent-295b-21b-moe-hy3/11147
- Hy3 소개 페이지: https://hy.tencent.com/research/hy3
- Hugging Face Hy3: https://huggingface.co/tencent/Hy3
- Hugging Face Hy3-FP8: https://huggingface.co/tencent/Hy3-FP8
- GitHub Hy3 저장소: https://github.com/Tencent-Hunyuan/Hy3
- Hy3 라이선스: https://github.com/Tencent-Hunyuan/Hy3/blob/main/LICENSE
- vLLM: https://github.com/vllm-project/vllm
- SGLang: https://github.com/sgl-project/sglang
- LLaMA-Factory: https://github.com/hiyouga/LLaMA-Factory
- ms-swift: https://github.com/modelscope/ms-swift
- AngelSlim: https://github.com/tencent/AngelSlim
- Multi-Token Prediction 논문: https://arxiv.org/abs/2404.19737
- LoRA 논문: https://arxiv.org/abs/2106.09685
키워드
- Tencent Hy3
- Tencent Hunyuan / Tencent Hy
- Mixture-of-Experts
- MoE inference model
- active parameters
- 295B total parameters / 21B active parameters
- Multi-Token Prediction
- speculative decoding
- vLLM serving
- SGLang serving
- reasoning_effort
- agentic LLM
- long-context reasoning
- Apache License 2.0
- FP8 quantization
- LoRA fine-tuning
원문 보존 위치
원문 전체는 raw source: web-2026-07-08-pytorchkr-topic-11147-tencent-hy3-295b-moe-reasoning-agent-model에 source_url 및 HTML 원문과 함께 저장되어 있습니다.