출처

  • source_url: https://aisparkup.com/posts/14829
  • author: Spark
  • published: Wed, 29 Jul 2026 07:21:25 +0000
  • raw: raw source: 2026-07-29-aisparkup-post-14829-2-8-kimi-k3-16

개요

개인 연구 프로젝트 Deltafin은 애플 실리콘과 64GB RAM을 탑재한 맥북 한 대에서 2.8조 파라미터 Kimi K3를 실행하는 실험을 구현했습니다. 모델 가중치 용량은 약 1.56TB이며, 모든 파라미터를 메모리에 올리는 대신 MoE 구조의 특성을 활용해 필요한 전문가만 디스크나 네트워크에서 불러옵니다. 전문가 전체를 로컬에 저장하면 토큰당 약 16초가 걸리고, 스트리밍 방식을 사용하면 저장공간을 약 215GB로 줄일 수 있지만 캐시에 없는 전문가를 불러올 때 토큰당 3분 이상 걸릴 수 있습니다. Deltafin은 대화형 사용을 목표로 한 도구라기보다 초대형 모델의 로컬 실행 가능성과 스트리밍 추론을 검증하는 연구 프로젝트에 가깝습니다. 제작자는 속도보다 원본 모델과 동일한 계산 및 반복 실행 시 토큰 단위의 재현성을 주요 특성으로 설명합니다.

핵심 포인트

  • Deltafin은 애플 실리콘 맥북과 64GB RAM 환경에서 2.8조 파라미터 Kimi K3를 실행합니다.
  • Kimi K3는 MoE 구조를 사용하므로 추론 시 전체 파라미터가 아니라 토큰 생성에 필요한 일부 전문가만 선택적으로 사용합니다.
  • Deltafin은 어텐션과 임베딩 등 약 114GB의 핵심 구성요소를 로컬 디스크에 유지하고, 나머지 전문가를 디스크 캐시 또는 네트워크에서 불러옵니다.
  • 전문가 전체를 미리 저장하는 방식은 약 1.7TB의 저장공간이 필요하지만 토큰당 약 16초의 비교적 안정적인 실행이 가능합니다.
  • 필요할 때 전문가를 내려받는 스트리밍 방식은 저장공간을 약 215GB로 줄이지만, 캐시에 없는 전문가를 만날 경우 토큰당 3분 이상 걸릴 수 있습니다.
  • 프로젝트 초기 버전의 토큰 생성 시간은 약 20분이었으며, 이후 약 16초까지 개선됐다고 설명합니다.
  • 기본 계산 경로는 근사 연산보다 정확성과 재현성을 우선하며, 같은 프롬프트에 대해 동일한 결과를 얻는 것을 목표로 합니다.

왜 중요한가

이 프로젝트는 일반적인 노트북에서 실용적인 속도로 대화하기는 어렵지만, 초대형 MoE 모델을 전체 메모리에 적재하지 않고도 로컬 환경에서 실행할 수 있음을 보여주는 사례입니다. 또한 모델 전문가를 저장장치나 네트워크에서 선택적으로 불러오는 스트리밍 추론 방식을 실험할 수 있는 테스트베드라는 의미가 있습니다. 다만 토큰 생성 속도와 긴 프롬프트에서의 추가 비용을 고려하면, 현재 단계에서는 실용적인 채팅 서비스보다는 실행 가능성 및 시스템 연구에 더 적합합니다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-29-aisparkup-post-14829-2-8-kimi-k3-16source_url 및 HTML 원문과 함께 저장되어 있습니다.