개요
AI Sparkup은 13년 된 듀얼 Xeon 서버에서 GPU 없이 Gemma 4 26B를 실행한 사례를 소개한다. 원본 구성이 2016년형 브로드웰을 전제로 했기 때문에 2013년형 아이비브릿지 서버에서는 AVX2·FMA3 최적화 경로가 실행되지 않아 빌드가 실패했다. Claude는 AVX2가 없는 경우 안전한 대체 경로로 분기하도록 C++ 코드를 수정했고, 서버는 약 초당 5토큰으로 모델을 실행했다. 글의 핵심 주장은 모델 구독료보다 문제를 정확히 정의하고 에이전트의 수정 결과를 사람이 검증하는 능력이 중요하다는 것이다.
핵심 포인트
- 원본 실험과 동일한 절차라도 CPU 세대가 다르면 지원 명령어셋 차이로 결과가 달라질 수 있다.
ik_llama.cpp포크의 일부 빠른 연산 경로는 AVX2와 FMA3를 전제로 하며, 2013년형 아이비브릿지에는 해당 명령어셋이 없다.- 해결책은 구형 CPU에서 해당 최적화 경로를 건너뛰고 안전한 대체 경로를 사용하도록 성능 민감 코드를 수정하는 것이었다.
- 에이전트는 최적화 C++ 코드 분석과 수정에 기여했지만, 실험 설계·실행·결과 검증은 필자가 수행했다.
- 최종 결과는 GPU 없는 13년 된 서버에서 260억 파라미터 Gemma 4를 약 5 tokens/sec로 실행한 것이다.
- 글은 이를 “무료로 AI를 쓸 수 있다”는 이야기보다, 하드웨어 제약을 진단하고 에이전트의 답을 검증하는 실무 능력의 사례로 해석한다.
왜 중요한가
- 로컬 LLM 추론은 모델 크기나 구독료만의 문제가 아니라 CPU 명령어셋, 최적화 경로, 대체 구현의 호환성에 좌우될 수 있다.
- 코딩 에이전트를 효과적으로 사용하려면 문제를 구체적으로 겨냥하고, 생성된 수정이 실제 환경에서 타당한지 실험으로 확인해야 한다.
- 이 사례의 약 5 tokens/sec는 해당 글에서 보고된 결과이며, 일반적인 Gemma 4 성능이나 모든 구형 서버에 대한 보장을 뜻하지 않는다.