요약
Seapy의 이 글은 512GB Mac Studio에서 glm-5.2를 MLX 변환본과 GGUF Metal 조합으로 실제 실행해 보고, DGX Spark 2대의 GGUF/RPC 결과와 Gemma4 31B Dense Q8 + MTP를 보조 기준점으로 비교한 실험 기록이다. 핵심은 “753B급 MoE로 표기되는 GLM-5.2도 개인/소규모 장비에서 양자화 조합을 통해 실행 자체는 가능하지만, 실사용 과제에서는 양자화·서버 스택·작업 유형에 따라 체감 가치가 크게 갈린다”는 점이다.
실험 구성
| 축 | 내용 |
|---|---|
| 주 장비 | Mac Studio 512GB |
| 보조 장비 | DGX Spark spark, spark2 2대 — QSFP/CX7 직결, llama.cpp RPC |
| GLM-5.2 MLX | mxfp4 368GB, 4bit 401GB, DQ4plus-q8 433GB |
| GLM-5.2 GGUF | Unsloth UD-IQ1_M 213GB, UD-IQ2_M 222GB |
| DGX Spark GLM | GGUF UD-IQ2_M, 65K context, CUDA/RPC |
| 비교 기준 | Gemma4 31B Dense Q8 + MTP on DGX Spark |
| 벤치셋 | 일본어 10개, 영어 10개, 중국어 10개 RSS/커뮤니티 제목을 한국어 한 줄 제목으로 번역 |
Mac Studio에서 받은 모델만 약 1.64TB였고, MLX 4-bit 계열 하나의 평균 크기도 약 401GB였다. 이 실험은 local-llm에서 “모델 하나가 수백 GB”가 되는 구간의 실제 운용 비용을 잘 보여준다.
속도 결과
| 모델/조합 | 실행 위치 | 총 시간 | 평균/제목 | wall tok/s | 비고 |
|---|---|---|---|---|---|
| Gemma4 31B Dense Q8 + MTP | DGX Spark | 50.08s | 1.67s | 12.52 | draft accept 58.0% |
GLM-5.2 GGUF UD-IQ1_M | Mac Studio Metal | 87.19s | 2.91s | 9.37 | 1-bit 근처 |
GLM-5.2 GGUF UD-IQ2_M | Mac Studio Metal | 87.62s | 2.92s | 9.59 | 2-bit 근처 |
GLM-5.2 MLX mxfp4 | Mac Studio MLX | 140.81s | 4.69s | 5.67 | MLX server 기준 |
GLM-5.2 GGUF UD-IQ2_M 65K | DGX Spark 2대 RPC | 144.19s | 4.81s | 5.70 | 긴 컨텍스트 후보 |
GLM-5.2 MLX 4bit | Mac Studio MLX | 148.92s | 4.96s | 5.51 | 품질 안정적 |
GLM-5.2 MLX DQ4plus-q8 | Mac Studio MLX | 170.26s | 5.68s | 4.78 | 가장 무겁고 느림 |
이번 단문 제목 번역 벤치에서는 llama-cpp Metal 기반 GGUF UD-IQ2_M이 MLX server보다 빨랐다. 다만 이 결과는 OpenAI-compatible server를 통한 동일 벤치 기준이므로, mlx_lm.generate 같은 단일 생성 벤치와 직접 비교하면 안 된다.
품질 결과
| 순위 | 모델/조합 | GPT-5.5 judge | 판단 |
|---|---|---|---|
| 1 | Gemma4 31B Dense Q8 + MTP | 92 | 가장 안정적. 고유명사·커뮤니티 표현·제목체에서 우세 |
| 2 | GLM-5.2 MLX 4bit | 86 | GLM 계열 중 품질 상위. 일부 은어/구어체 약점 |
| 3 | GLM-5.2 MLX DQ4plus-q8 | 85 | 4bit와 거의 동급. 속도·용량 비용 대비 이점 작음 |
| 4 | GLM-5.2 MLX mxfp4 | 83 | 실용 균형은 좋지만 직역/잔류 표현 있음 |
| 5 | GLM-5.2 GGUF UD-IQ2_M Metal | 80 | 작은 용량 대비 괜찮지만 자연스러움 이슈 있음 |
| 6 | GLM-5.2 UD-IQ2_M 65K RPC | 77 | 긴 컨텍스트 가능성이 장점. 짧은 제목 번역은 약함 |
| 7 | GLM-5.2 GGUF UD-IQ1_M Metal | 68 | 1-bit치고 번역은 되지만 혼합 문자/깨짐으로 신뢰도 낮음 |
품질 면에서는 Gemma4 31B Dense Q8 + MTP가 가장 안정적이었다. GLM-5.2는 戒名을 “법명”으로 옮기는 등 일부 문맥에서 더 자연스러운 경우도 있었지만, お化けローカルLLM, 阿波銀行, yyds 같은 고유명사·은어 처리에서는 Gemma4가 전반적으로 나았다.
실무적 해석
- Mac Studio에서 작고 빠르게 GLM-5.2를 맛보기: GGUF
UD-IQ2_MMetal이 가장 매력적이다. 222GB 정도로 MLX 계열보다 작고, 이번 벤치에서는 30개 제목을 87.62초에 처리했다. - 품질 안정성 위주: MLX
4bit또는mxfp4가 후보지만, 이번 OpenAI-compatible server 벤치에서는 GGUF Metal보다 느렸다. - 1-bit 극한 압축 실험: GGUF
UD-IQ1_M은 빠르지만 출력 결함 때문에 실사용 신뢰도가 낮다. - 긴 컨텍스트 실험: DGX Spark 2대의 GLM-5.2
UD-IQ2_M65K context 구성은 짧은 번역보다 긴 컨텍스트 회수 QA 실험에 의미가 있다. - 현재 RSS/커뮤니티 제목 번역 실사용: 글쓴이는 GLM-5.2보다 Gemma4 31B Dense MTP를 먼저 고르겠다고 결론냈다.
위키 연결
이 노트는 glm-5.2의 오픈웨이트/로컬 실행 가능성, local-llm의 Apple Silicon 대용량 모델 운용 비용, llama-cpp의 GGUF Metal 경로, 그리고 moc-ai-models의 로컬 모델 벤치마크 흐름과 연결된다.