출처

Liquid AI, 휴대폰에서 실행 가능한 온-디바이스 에이전트 모델 LFM2.5-2.6B 공개

개요

Liquid AI가 온디바이스 에이전트 실행을 목표로 한 2.69B 파라미터 모델 LFM2.5-2.6B와 Base 모델을 공개했습니다. 이 모델은 22개의 게이트 단거리 합성곱 블록과 8개의 GQA 어텐션 블록을 조합하고, 128K 컨텍스트와 128K 어휘를 지원합니다. 사후학습 과정에는 도구 사용·추론·에이전트 작업을 위한 SFT, 도메인별 전문가 모델, MOPD 증류, 실제 에이전트 하네스 안에서 수행한 에이전틱 RL이 포함됩니다. 게시글에 따르면 Q4_K_M 양자화 기준 Snapdragon 휴대폰에서 약 30 tok/s의 디코드 속도와 2.5GB 미만의 메모리 사용량을 보였습니다. 다만 코딩과 지식 집약적 작업은 더 큰 모델보다 약할 수 있으며, 벤치마크 결과는 측정 조건에 따라 해석해야 합니다.

핵심 포인트

  • 온디바이스 지향 구조: 총 30층 중 22층을 게이트 단거리 합성곱으로 구성하고 8층에만 GQA 어텐션을 사용해 KV 캐시 메모리와 추론 부담을 줄였습니다.
  • 확장된 컨텍스트와 어휘: 기존 LFM2.5의 32K 컨텍스트를 128K로 확장하고, 어휘 크기를 65K에서 128K로 늘렸습니다. 한국어를 포함한 16개 언어를 지원합니다.
  • 토크나이저 확장의 trade-off: 태국어·벵골어·베트남어·힌디어 등에서는 인코딩 길이가 줄어들 수 있지만, 어휘 확장으로 인해 참조 기기에서 토큰당 디코딩 속도가 약 7~10% 감소할 수 있다고 설명합니다.
  • 에이전트 중심 사후학습: 두 차례 SFT 이후 지시 따르기, 수학, 지식, 코드, 도구 사용, 긴 컨텍스트별 전문가를 RLVR로 학습하고, MOPD를 통해 하나의 학생 모델로 통합했습니다.
  • 실제 하네스에서의 에이전틱 RL: Hermes Agent, OpenClaw, 커스텀 하네스 등을 샌드박스에서 실행하며 GRPO 기반 결과 보상으로 다중턴 도구 사용과 작업 수행을 학습했습니다.
  • 벤치마크와 실행 성능: 지시 따르기 관련 IFBench 59.17, Multi-IF 80.07, IFStruct 85.49를 기록했고, ToolSandbox는 77.83으로 비교 대상 일부 대형 모델을 앞섰습니다. 반면 LiveCodeBenchv6는 59.41로 8B·9.7B 모델보다 낮았습니다. Q4_K_M 기준 디코드 속도는 Apple M5 Max 220 tok/s, Ryzen AI Max+ 395 113 tok/s, Snapdragon 휴대폰 30 tok/s였으며 메모리는 약 2.36~2.45GB였습니다.

왜 중요한가

LFM2.5-2.6B는 소형 언어 모델을 단순 대화용이 아니라 도구 호출과 다중 단계 작업을 수행하는 로컬 에이전트로 활용하려는 사례입니다. 로컬 실행은 클라우드 API 비용과 네트워크 왕복 지연을 줄이고, 코드베이스나 개인 문서가 기기 밖으로 나가지 않도록 구성할 수 있습니다. 특히 8GB RAM 수준의 기기에서도 실행을 고려할 수 있는 메모리 사용량은 모바일·엣지 환경의 선택지를 넓힐 수 있습니다. 다만 실제 성능은 하드웨어, 양자화, 컨텍스트 관리, 하네스의 도구 호출 구현에 따라 달라지며, 게시글에서도 코딩과 지식 집약적 작업에는 주의를 요구합니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-07-pytorchkr-topic-11549-liquid-ai-lfm2-5-2-6bsource_url 및 HTML 원문과 함께 저장되어 있습니다.