출처
- source_url: https://x.com/KyleHessling1/status/2049663103131070691
- author: Kyle Hessling (@KyleHessling1, X)
- published: 2026-04-30
- raw: raw source:
web-2026-05-02-post-by-kylehessling1-on-x
요약
Kyle Hessling이 저VRAM 사용자를 위한 새 모델 Qwen3.5-9B-DeepSeek-V4-Flash(HuggingFace Jackrong/Qwen3.5-9B-DeepSeek-V4-Flash-GGUF)를 공개했다. 기반 qwen 3.5-9B에 deepseek-v4를 증류(distill)한 모델로, Asus GX10 유닛으로 구축한 새 학습 파이프라인의 첫 완성 결과물이라고 소개한다.
자체 벤치마크로 제시하는 개선점:
- 추론(Reasoning): 베이스 모델은 5개 프롬프트 중 3개에서 8K 사고 토큰 한도에 걸려 과도하게 생각하지만, 증류 모델은 5개 모두 깔끔하게 통과 — 속도 2.2배, 추론 길이 2.6배 단축.
- 창작 프론트엔드 디자인: 베이스 모델은 오버레이·애니메이션 버그가 있는 밋밋한 결과를 내지만, 증류 모델은 9B급 치고 훨씬 뛰어난 결과를 낸다고 주장(원본·증류 결과를 모두 공개해 직접 비교 가능).
- 도구 호출(Tool calling): 양쪽 모두 6개 중 5개 통과 — 파인튜닝이 도구 호출 능력을 해치지 않았음.
- 처리량: RTX 5090에서 양쪽 모두 143 tok/s로 동일.
이 모델은 “Wyoming 랩에서 완전히 완성한 첫 모델”이며, 성공을 확인한 뒤 곧이어 27B 규모의 Qwopus 3.6 학습을 이미 시작했다고 밝힌다.
댓글 스레드에서는 KV 캐시 절감이 핵심이라는 지적(로컬에서 9B 모델이 8K 사고 토큰을 뱉게 두면 메모리 대역폭이 크게 소모되므로, 증류된 추론은 사실상 추론 최적화 트릭이라는 관찰), 그리고 macOS M1 16GB나 8GB Nvidia+32GB RAM 같은 저사양 환경에서의 구동 가능 여부에 대한 질답이 이어진다.
관련 위키
원문 보존 위치
원문 전체는 raw source: web-2026-05-02-post-by-kylehessling1-on-x에 source_url과 함께 저장되어 있다.