로컬에서 실행하는 LLM 생태계에 대한 참조 페이지입니다. moc-llm-wiki와 연계됩니다.
대용량 Apple Silicon 실행 메모
2026-06-26-glm52-mac-studio-dgx-spark-benchmark는 512GB Mac Studio에서 glm-5.2 MLX 4-bit 계열과 GGUF 1/2-bit 계열을 실제로 실행한 사례다. 모델 파일만 약 1.64TB를 내려받았고, MLX 4-bit 계열 하나가 평균 약 401GB였다는 점은 로컬 LLM 운용에서 저장공간·다운로드 대역폭이 성능만큼 중요한 병목이 된다는 것을 보여준다. 실사용 제목 번역에서는 llama-cpp Metal 기반 GGUF UD-IQ2_M이 속도/용량 면에서 매력적이었지만, 품질 안정성은 MLX 4bit가 더 낫게 평가됐다.
2026-07-12-justvugg-colibri는 이 병목을 다른 방향으로 다룬다. dense 모델 전체를 양자화해 상주시키는 대신, GLM-5.2의 routed expert를 약 370GB 디스크에서 스트리밍하고 RAM에는 dense 부분과 학습형 hot cache만 둔다.
다중 GPU 로컬 추론 하드웨어
2026-07-17-pytorchkr-local-llm-gpu-hardware-guide는 RTX PRO 6000 4장, PCIe Gen4 스위치, P2P·전력·Docker 서빙을 조합한 대규모 로컬 추론 장비 사례를 정리한다.