출처

개요

LOTUS: 데이터에 LLM과 에이전트 처리를 대규모로 적용하는 시맨틱 연산자 프레임워크

개요

LOTUS는 대규모 데이터셋의 각 레코드에 LLM이나 에이전트를 반복 적용하는 작업을 선언적으로 정의하고 실행하는 프레임워크입니다. 사용자는 자연어 지시와 map, filter, reduce 같은 고수준 연산으로 원하는 처리를 표현하며, 옵티마이저가 호출 배칭, 모델 캐스케이드, 지연 실행 등의 전략을 결정합니다. 문서 요약·분류, 비정형 데이터 분석, 코드베이스 점검, 에이전트 로그 분석 같은 작업을 대상으로 합니다. Stanford University와 UC Berkeley 연구진의 시맨틱 연산자 연구를 구현한 프로젝트입니다.

핵심 포인트

  • 대표적인 LLM형 시맨틱 연산자는 sem_map, sem_filter, sem_agg, sem_join, sem_extract입니다.
    • sem_map: 레코드별 요약, 분류, 재작성
    • sem_filter: 자연어 조건에 따른 레코드 필터링
    • sem_agg: 여러 레코드를 하나의 결과로 집계
    • sem_join: 조건에 따른 두 데이터 집합 결합
  • 에이전트형 연산자는 코퍼스 위에서 도구를 사용하는 에이전트를 실행하며, 코드 실행이나 파일 파싱처럼 여러 단계가 필요한 작업에 적합합니다.
  • LLM형 연산자는 작업이 명확하고 레코드당 필요한 모델 호출 수가 적은 대규모 분석에 적합합니다.
  • Python 패키지 lotus-ai로 설치할 수 있고, LiteLLM이 지원하는 프로바이더를 모델로 사용할 수 있습니다.
  • 예제에서는 코드 조각을 샤드로 나누고, Python REPL 샌드박스에서 각 함수를 실행해 버그를 찾은 뒤 결과를 하나의 보고서로 종합합니다.
  • 게시글에 인용된 저자 공개 결과에서는 에이전트 트레이스 분석 정확도가 21%에서 97%로, RAG 파이프라인 정확도가 60%에서 90%로 향상되었습니다. LLM-as-Judge 비용은 요청당 0.11달러에서 0.046달러로, 에이전트 트레이스 분석 비용은 0.05달러에서 0.038달러로 낮아졌다고 제시합니다.
  • Apache License 2.0으로 공개되어 있습니다.

왜 중요한가

LLM 기반 데이터 처리는 데이터 규모가 커질수록 호출 수, 모델 선택, 병렬화, 비용, 정확도를 함께 관리해야 합니다. LOTUS는 처리 의도와 실행 전략을 분리해 사용자가 실행 계획을 직접 조율하지 않아도 되도록 하며, 관계형 데이터베이스의 질의 최적화와 유사한 방식으로 LLM 데이터 처리를 다루려는 접근을 제시합니다. 다만 게시글의 정확도와 비용 수치는 원문에서 소개한 공개 결과이며, 이 요약에서 별도로 재현한 결과는 아닙니다.

후속으로 볼 링크와 키워드

원문 보존 위치

원문 전체는 raw source: web-2026-07-14-pytorchkr-topic-11235-lotus-llmsource_url 및 HTML 원문과 함께 저장되어 있습니다.