출처
- source_url: https://discuss.pytorch.kr/t/paddleocr-llm-ocr/10935
- author: 9bow
- published: 2026-06-25
- raw: raw source:
web-2026-06-30-paddleocr-ocr-toolkit-llm-structured-data
요약
PaddleOCR은 PDF와 이미지 문서를 LLM이 곧바로 사용할 수 있는 구조화된 데이터(JSON, Markdown)로 변환하는 오픈소스 OCR 툴킷이다. 단순 문자 인식을 넘어 표, 수식, 도장, 차트 같은 복잡한 요소까지 인식해 문서 구조를 보존한 형태로 출력하는 데 초점을 맞춘다. 프로젝트는 두 갈래 문제를 함께 풀도록 설계됐다. 하나는 거리 간판·신분증·손글씨 등 다양한 환경의 글자를 읽는 장면 텍스트 인식(Scene OCR)이고, 다른 하나는 복잡한 레이아웃의 문서 한 페이지 전체를 Markdown이나 JSON으로 옮기는 문서 파싱(Document Parsing)이다. 전자는 PP-OCR 계열 모델이, 후자는 비전-언어 모델(VLM) PaddleOCR-VL과 레이아웃 분석 파이프라인 PP-StructureV3가 담당한다.
전체 구조는 응용(Apps), 모델 저장소(Model Zoo), 도구(Toolkit) 세 층으로 나뉜다. 문서 파싱의 핵심 모델은 0.9B 규모의 PaddleOCR-VL-1.6으로, NaViT 스타일 동적 해상도 비전 인코더와 ERNIE-4.5-0.3B 언어 모델을 결합했으며 문서 파싱 벤치마크 OmniDocBench v1.6에서 96.3% 이상의 정확도를 보고한다. 장면 텍스트 인식은 새로 설계된 PPLCNetV4 백본 기반의 PP-OCRv6가 맡는데, 하나의 통합 모델로 중국어·영어·일본어를 포함한 50개 언어를 별도 모델 교체 없이 인식하며 저자들은 이전 버전(PP-OCRv5_server) 대비 검출 +4.6%, 인식 +5.1% 정확도 향상과 CPU 추론 5.2배 속도 향상을 측정했다고 밝힌다. PP-OCRv6는 tiny(1.5M)·small(7.7M)·medium(34.5M) 세 등급으로 제공되어 엣지·모바일·서버 시나리오에 맞춰 고를 수 있다. 한국어 사용자를 위한 별도 경량 모델 korean_PP-OCRv5_mobile_rec(14MB, 평균 정확도 88.0%)도 제공된다.
프로젝트는 100개 이상 언어를 지원하고, PaddlePaddle 프레임워크 위에서 NVIDIA GPU, Intel CPU, 쿤룬신(Kunlunxin) XPU, Ascend 등 여러 하드웨어 백엔드로 배포 가능하다. Dify, RAGFlow, Cherry Studio, MinerU 같은 RAG·문서 처리 도구들이 이미 PaddleOCR을 기반 OCR 엔진으로 채택하고 있다. 도구 층에서는 학습·추론·고성능 서빙을 명령 몇 줄로 실행할 수 있고, LLM이 호출 가능한 MCP 서버 형태의 연동도 지원해 재무 보고서 분석, 시험 채점, 계약서 검토, 증명서 정보 추출 같은 실제 응용을 같은 토대 위에서 구성할 수 있다.
설치는 PyPI 패키지로 이뤄지며 텍스트 인식만 필요하면 pip install paddleocr, 문서 파싱을 포함한 전체 기능은 pip install "paddleocr[all]"을 쓴다. 파이썬에서는 PaddleOCR 객체를 만들어 predict()로 추론하고 결과를 이미지·JSON으로 저장하며, lang이나 ocr_version 인자로 언어와 모델 버전을 바꿀 수 있고 OpenVINO·ONNX Runtime·TensorRT 등 다양한 추론 엔진을 선택할 수 있다. Apache 2.0 라이선스로 공개되어 개인·상업적 목적 모두에 자유롭게 사용 가능하다.
관련 위키
원문 보존 위치
원문 전체는 raw source: web-2026-06-30-paddleocr-ocr-toolkit-llm-structured-data에 source_url과 함께 저장되어 있다.