출처
- 저장소: hertz-ai/HARTOS
- 문서: docs.hevolve.ai
- 라이선스: Apache License 2.0
- 원문 캡처: raw source:
2026-07-27-github-hertz-ai-hartos
한눈에 보기
HARTOS는 AI-native 운영체제를 표방하는 오픈소스 런타임이다. 모델을 사용자의 하드웨어에서 실행하고, 여러 노드가 중앙 브로커 없이 직접 연결되며, 애플리케이션은 OpenAI 호환 API를 통해 모델 서비스를 호출한다. 저장소 설명에 따르면 자체 Wayland compositor를 포함한 부팅 가능한 시스템과 8GB RAM 환경을 목표로 한다.
엄밀히 말하면 이 저장소의 핵심은 HART OS 전체라기보다 HART(Hive Agentic Runtime) 엔진이다. 같은 런타임을 일반 애플리케이션 번들, regional/central 노드용 Docker, Nix 기반 HART OS 형태로 패키징하는 구조다.
핵심 아키텍처
로컬 모델 서비스와 Model Bus
추론을 각 애플리케이션이 직접 관리하는 기능이 아니라 운영체제가 제공하는 시스템 서비스로 취급한다. 앱은 모델이나 API 키를 번들링하는 대신 Model Bus를 통해 런타임에 요청하고, 런타임이 하드웨어와 설정에 맞는 모델을 선택한다. 기본 서버는 :6777에서 OpenAI 호환 /v1/chat/completions API를 제공한다.
README의 실행 예시는 Python 3.10 또는 3.11 가상환경에서 requirements.txt를 설치한 뒤 python hart_intelligence_entry.py로 서버를 시작하는 방식이다. 로컬 llama.cpp 경로를 사용할 수 있고, 외부 제공자를 사용할 때는 OpenAI·Groq 등의 키를 환경 변수로 설정한다.
하드웨어 적응형 모델 로딩
core/gpu_tier.py가 하드웨어 티어를 분류하고, integrations/service_tools/vram_manager.py가 모델별 메모리 예산과 로딩 위치를 결정한다. 조건에 따라 GPU, CPU offload, CPU-only로 배치하며, GGUF 모델 카탈로그를 통해 모델 교체를 설정 수준에서 처리한다.
README가 설명하는 예시는 다음과 같다.
- 10GB 이상 CUDA: speculative decoding으로 0.8B draft 모델을 활용
- 4–10GB: 주 모델을 GPU에서 실행
- CUDA 없음: compact 모델을 CPU에서 실행
- 7B 로컬 모델의 FULL 티어 요구사항: 약 16GB RAM과 GPU
이 수치와 성능 표현은 저장소 README의 설명이며, 이 노트에서 별도로 재현한 벤치마크 결과는 아니다.
PeerLink 기반 연합
노드는 PeerLink라는 직접 P2P WebSocket으로 연결되며 중앙 브로커를 거치지 않는다. 한 노드가 감당하기 어려운 작업을 더 큰 모델을 가진 피어로 넘기는 expert discovery / capability routing 경로가 포함된다. hive_capability_advertiser가 기능을 알리고 hive_expert_discovery가 피어의 능력을 검색한다.
광고는 HEVOLVE_HIVE_ADVERTISE=1과 공개 엔드포인트 설정이 필요한 opt-in 방식이다. 따라서 아무 노드도 참여를 선택하지 않은 네트워크에서는 로컬 실행으로 fallback한다. 이 구조는 모델을 여러 머신에 분할하는 layer sharding이 아니라, 하나의 작업 또는 turn을 다른 노드에 위임하는 방식이다.
Nix 기반 업데이트와 안전 경계
HART OS 형태에서는 NixOS 기반 세대(generation), 롤백, 읽기 전용 store를 활용한다. README는 BUILD → TEST → AUDIT → BENCHMARK → SIGN → CANARY → DEPLOY 파이프라인과 health regression 시 자동 rollback을 설명한다. release signing에는 사람이 보유한 master key가 필요하므로, AI 에이전트가 직접 배포·서명을 결정하지 않도록 경계를 둔다.
저장소 자체도 “AI-native OS”라는 명칭의 범위가 과장될 수 있음을 문서에서 인정한다. Smithay compositor와 NixOS 테스트가 정의되어 있지만 일부 VM 검사는 수동 dispatch 전용이며, README 시점에는 전체 부팅 성공을 의미하지 않는다고 명시한다.
주요 기능
- OpenAI 호환 API: 기존 OpenAI SDK, LangChain, LiteLLM, Aider, Continue 등을 endpoint 변경만으로 연결
- 멀티모델 런타임: llama.cpp/GGUF를 통해 CUDA, ROCm, Metal, Vulkan, CPU 경로 지원
- 컴퓨터 사용: 로컬 VLM이 화면을 보고 pyautogui 기반 동작으로 GUI를 제어
- 에이전트 코파일럿:
hart-copilot이 새 브랜치와 writable checkout에서 Claude Code를 실행 - 로컬 우선 학습: 사용량에서 얻은 학습 정보를 노드에 축적하고 federated aggregation을 수행
- 다양한 패키징: Nunba 데스크톱 앱, Docker 노드, Nix 기반 부팅 시스템
설치 개요
저장소에서 직접 실행할 때는 Python 3.10 또는 3.11이 권장된다. README는 일부 의존성이 Python 3.12용 wheel을 제공하지 않아 최신 Python에서 설치가 실패할 수 있다고 경고한다.
git clone https://github.com/hertz-ai/HARTOS.git
cd HARTOS
python3.10 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
python hart_intelligence_entry.py단순 사용자는 Python 설치 대신 HARTOS의 소비자용 클라이언트인 Nunba 릴리스를 사용할 수 있다고 안내한다.
공개 범위와 주의점
HARTOS의 중심 아이디어는 “각 기기가 모델을 직접 실행하고, 필요하면 서로의 추론 능력을 빌리는 로컬 우선 AI 운영 계층”이다. 특히 모델 호출을 Model Bus로 통합하고, PeerLink로 노드 간 작업 위임을 표준화하려는 점이 일반적인 로컬 챗 앱과 다르다.
반면 README는 학습 코드 일부가 비공개 HevolveAI 저장소의 서명 바이너리에 의존한다는 점도 명시한다. 따라서 저장소 전체가 완전히 독립적인 학습 스택을 제공한다고 해석하면 안 된다. 또한 public alpha 상태이며 API가 변경될 수 있고, 노드 간 연합·자기개선·OS 부팅 관련 기능은 문서의 설계 주장과 구현 상태를 구분해 검증해야 한다.
연결 메모
HARTOS는 2026-07-27-x-beamnxw-graph-engineering-langgraph식 워크플로 그래프 프레임워크와 직접 경쟁하기보다, 그런 에이전트 런타임이 올라갈 수 있는 로컬 우선 실행·모델 서비스 계층에 가깝다. LangGraph가 상태와 경로를 명시하는 애플리케이션 오케스트레이션이라면, HARTOS는 모델 선택, 로컬/피어 추론, OS 패키징, OpenAI 호환 API를 시스템 서비스로 묶으려는 시도다.
따라서 “그래프 엔지니어링” 관점에서 HARTOS를 읽을 때의 질문은 그래프 DSL이 있는가보다, 장기 실행 에이전트가 필요로 하는 모델 접근·격리·복구·피어 위임을 운영 계층에서 얼마나 안정적으로 제공하는가다. 현재 노트의 결론은 설계 방향은 흥미롭지만 public alpha 상태라 구현 완성도와 부팅 가능한 OS 범위는 별도 검증이 필요하다는 쪽이다.
관련 위키
검증
- GitHub REST API와
raw.githubusercontent.com의 README를 2026-07-27에 직접 조회했다. - 저장소 메타데이터, 라이선스, 언어, 토픽, 기본 브랜치를 API 응답에서 확인했다.
- README와 API 메타데이터는
raw/articles/2026-07-27-github-hertz-ai-hartos.md에 보존했다. - raw 본문 SHA-256은 저장 후 재계산하여 frontmatter 값과 비교했다.