출처

개요

GOT-OCR2.0은 문서 이미지에서 평문뿐 아니라 수식, 분자식, 표, 차트, 악보, 기하 도형 등을 하나의 모델로 인식하는 엔드투엔드 OCR 모델입니다. 기존 OCR처럼 검출기·인식기·레이아웃 분석기를 조합하는 대신, 이미지 입력을 받아 텍스트를 직접 생성하는 단일 모델 구조를 사용합니다. 입력은 장면 이미지와 문서 이미지를 지원하며, 출력은 프롬프트에 따라 평문이나 마크다운·LaTeX·SMILES 등 구조화된 형식으로 생성할 수 있습니다. 모델은 5.8억 개 파라미터로 구성되며, 가중치·벤치마크·학습 코드가 공개되어 있고 Hugging Face Transformers에서도 사용할 수 있습니다.

핵심 포인트

  • OCR-2.0은 평문뿐 아니라 수식, 분자식, 표, 차트, 악보, 기하 도형 등 사람이 만든 다양한 광학 신호를 통합적으로 처리하려는 접근입니다.
  • GOT-OCR2.0은 고압축 인코더와 롱컨텍스트 디코더로 구성되며, 인코더는 이미지 정보를 시각 토큰으로 압축하고 디코더는 긴 텍스트 시퀀스를 생성합니다.
  • Qwen 기반 언어 모델 디코더를 사용해 일반 텍스트와 서식이 있는 출력을 모두 생성합니다.
  • 수식은 LaTeX, 분자식은 SMILES, 표는 마크다운 등 대상에 맞는 표현 형식으로 변환할 수 있습니다.
  • 좌표(--box)나 색상(--color)을 지정해 이미지의 특정 영역만 인식하는 세밀한 OCR을 지원합니다.
  • 동적 해상도 처리와 멀티 페이지 입력을 지원하며, 저장소에서는 LoRA 기반 미세 조정 방법도 안내합니다.
  • 저장소 기준 실행 환경은 CUDA 11.8과 PyTorch 2.0.1이며, Transformers 병합 이후 배치 추론도 지원됩니다.

왜 중요한가

수식·표·악보처럼 내용뿐 아니라 2차원 배치와 서식이 의미를 구성하는 자료는 단순 문자 인식만으로 원래 정보를 복원하기 어렵습니다. GOT-OCR2.0은 이러한 대상을 별도 전문 모듈의 조합이 아니라 하나의 모델과 프롬프트 체계로 처리하려는 설계를 제시합니다. 따라서 문서 디지털화, 구조화 데이터 추출, 멀티모달 문서 처리에서 통합된 OCR 구성의 가능성을 확인할 수 있지만, 게시글의 성능 주장은 저자 실험에 근거하므로 실제 적용 시에는 논문에 제시된 수치와 대상 데이터에 대한 별도 검증이 필요합니다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-26-pytorchkr-topic-11415-got-ocr2-0-end-to-end-ocrsource_url 및 HTML 원문과 함께 저장되어 있습니다.