출처

개요

Unstract는 계약서, 청구서, 보험 서류, 이력서 같은 비정형 문서에서 필요한 데이터를 자연어 프롬프트로 정의하고 구조화된 JSON으로 추출하는 오픈소스 LLM 플랫폼입니다. PDF, 스캔본, 이미지, DOCX, XLSX, PPTX 등 다양한 형식의 문서를 처리할 수 있습니다. 추출 로직은 REST API 또는 ETL 파이프라인으로 배포해 애플리케이션이나 데이터 웨어하우스에 연결할 수 있습니다. React, Django, Celery, Redis, RabbitMQ, PostgreSQL과 LLM·벡터 데이터베이스·텍스트 추출기 어댑터로 구성됩니다. Docker Compose 기반 자체 호스팅을 지원하며 OpenAI, Anthropic, Bedrock, Gemini, Mistral, Ollama 등 여러 LLM 제공자를 선택할 수 있습니다.

핵심 포인트

  • 프롬프트 기반 추출: 정규식이나 문서별 좌표 템플릿 대신 자연어로 추출 필드와 JSON 구조를 정의합니다.
  • 문서 양식 변화 대응: 같은 유형의 문서라도 공급업체나 레이아웃이 달라질 때 프롬프트 하나로 여러 변형을 처리하는 방식을 지향합니다.
  • 두 가지 배포 방식:
    • API Deployment: 문서를 REST API로 전송하고 추출 결과를 JSON으로 반환
    • ETL Pipeline: 스토리지나 지정 폴더의 문서를 주기적으로 처리해 데이터 저장소에 적재
  • 확장 기능: MCP 서버를 통한 AI 에이전트 연결과 n8n 커스텀 노드 연동을 지원합니다.
  • 어댑터 기반 구성: LLM 제공자, 벡터 데이터베이스, 텍스트 추출기를 분리해 OpenAI·Claude·Ollama, Qdrant·Weaviate·Milvus·Pinecone, LLMWhisperer·Unstructured.io 등을 연결할 수 있습니다.
  • 입출력 커넥터: S3, MinIO, Google Cloud Storage, Azure Blob, Google Drive, Dropbox, SFTP에서 입력을 받고 Snowflake, Redshift, BigQuery, PostgreSQL, MySQL 등으로 결과를 내보낼 수 있습니다.
  • 자체 호스팅과 라이선스: Docker Compose로 Linux 또는 macOS에 설치할 수 있으며, 오픈소스 코드는 AGPL-3.0으로 공개되어 있습니다. 어댑터 자격 증명 암호화에 사용되는 ENCRYPTION_KEY를 분실하면 기존 어댑터에 접근할 수 없다는 점에 유의해야 합니다.

왜 중요한가

비정형 문서에서 데이터를 추출하는 기존 방식은 문서 유형과 공급업체별 템플릿·정규식을 별도로 유지해야 하므로 변경 비용이 발생합니다. Unstract는 추출 규칙을 자연어 프롬프트와 JSON 스키마로 정의하고 API·ETL 형태로 연결함으로써, 문서 처리 로직을 애플리케이션과 데이터 파이프라인에 통합하려는 선택지를 제공합니다. 다만 실제 추출 정확도, 운영 비용, 개인정보·보안 요구사항, AGPL-3.0의 서비스 제공 관련 조건은 도입 전에 별도로 검토해야 합니다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-28-pytorchkr-topic-11417-unstract-json-llmsource_url 및 HTML 원문과 함께 저장되어 있습니다.