개요

이 글은 jamesob이 실제로 운영하는 local-llm 저장소를 바탕으로, 최신 LLM을 클라우드 API 없이 로컬 GPU 장비에서 추론하기 위한 하드웨어와 소프트웨어 구성을 설명한다. 중심 사례는 NVIDIA RTX PRO 6000 Blackwell Workstation 4장으로 총 384GB VRAM을 확보하고, 지난 세대 EPYC·DDR4 호스트와 PCIe Gen4 스위치를 조합한 약 5만 달러대 장비다. 글은 GPU 선택과 BOM뿐 아니라 PCIe P2P, BIOS·커널 설정, 110V 회로를 위한 전력 제한, ZFS 기반 모델 저장, Docker/vLLM 서빙까지 다룬다. 성능·비용·모델 지능에 관한 수치는 저자가 제시한 사례와 주장으로, 별도 검증 결과가 아니다.

핵심 포인트

  • 예산별 구성으로 약 2천 달러의 RTX 3090 2장(48GB VRAM), 약 2만 달러대의 여러 후보, 약 4만 달러의 RTX 6000 Pro 4장(384GB VRAM)을 제시한다. 저자는 3090 2장으로 Qwen3.6-27B와 약 11GB VRAM이 필요한 cohere-transcribe STT를 실행할 수 있다고 설명한다.
  • 4장 GPU 사례는 ASRock Rack ROMED8-2T, EPYC Milan 7313P, DDR4 ECC 128GB, 4TB 부팅 디스크와 8TB 모델 디스크 2개, 1700W 전원 2개, c-payne Microchip Switchtec PM40100 Gen4를 사용하며 기본 시스템 비용을 $5,687로 제시한다.
  • 모델이 시스템 RAM으로 넘어가면 에이전트 워크로드가 실사용하기 어려울 정도로 느려질 수 있으므로, 저자는 최신 호스트 플랫폼보다 VRAM 확보에 지출을 우선하는 판단을 설명한다.
  • PCIe 스위치로 CPU PCI 루트 컴플렉스를 거치지 않는 GPU 간 P2P 통신을 구성하고, BIOS에서 링크 폭 x16·Gen4 고정, ASPM 비활성화, Re-Size BAR 활성화를 권장한다.
  • 커널에서는 iommu=off amd_iommu=off nomodesetnvidia_uvmuvm_disable_hmm=1 설정을 사용하며, ACS를 비활성화해야 P2P 트래픽이 CPU 루트 포트로 우회하지 않는다고 설명한다. nvidia-smi topo -m에서 GPU 간 연결이 PIX인지 확인하고 measure-gpu-speed.sh로 측정한다.
  • 저자가 보고한 P2P 측정치는 단방향 27.5GB/s, 양방향 50.4GB/s, 지연 0.37~0.45µs이며, 전력은 GPU당 600W 기본값을 350W로 낮춰 단일 110V 회로에서 운용하는 방식이다.
  • 모델 가중치는 복제된 ZFS 저장소에 캐시하고, 모델별 docker-compose.yml로 컨테이너를 격리한다. 글에 따르면 GLM-5.2-594B 러너는 vLLM 기반 구성에서 약 460k 컨텍스트와 초당 약 80토큰을 목표로 하며, 별도 VM의 OpenCode가 추론 API를 사용한다.

왜 중요한가

대규모 로컬 LLM은 GPU를 구매하는 것만으로 끝나지 않고, VRAM 용량, PCIe 토폴로지, BIOS·커널·드라이버 설정, 전력 예산, 모델 저장장치와 서빙 격리를 함께 설계해야 한다는 점을 보여준다. 특히 이 글은 특정 장비의 성공 사례를 일반적인 정답으로 제시하기보다, 실제 구매 목록과 튜닝 확인법을 공개해 비슷한 다중 GPU 구성을 검토할 때의 출발점과 위험 지점을 제공한다. 다만 가격, 모델명, 성능 수치와 전력 조건은 작성 시점 및 저자의 하드웨어 환경에 의존하므로 그대로 재현된다고 단정할 수 없다.

후속으로 볼 링크 및 키워드