한줄 요약
PaddleOCR은 PDF나 이미지 문서를 구조화된 JSON/Markdown 데이터로 변환하는 경량 OCR 툴킷으로, 100개 이상의 언어를 지원한다.
핵심 기능
PDF 및 이미지 문서에서 텍스트 추출 및 구조화된 데이터(JSON/Markdown) 출력
100개 이상의 언어 지원, 경량화된 모델로 CPU/GPU/XPU/NPU 등 다양한 하드웨어에서 동작
Python 패키지(paddleocr)로 간편하게 설치 및 사용 가능
언제 쓰나
PDF나 이미지 형태의 문서(계약서, 보고서, 스캔본 등)에서 텍스트를 추출하여 LLM이나 데이터 파이프라인에 입력해야 할 때
다국어 문서를 처리해야 하는 OCR 작업이 필요할 때
경량화된 OCR 솔루션을 원할 때