TL;DR
Open-source toolkit for converting PDF documents into LLM training text
Key features
Converts PDF, PNG, JPEG documents to clean Markdown
Supports equations, tables, handwriting, complex formatting
Automatic header/footer removal and natural reading order
Based on 7B parameter VLM, requires GPU
Conversion cost under $200 per million pages
When to use it
When converting large-scale PDF documents into LLM training datasets
When extracting text from complex academic papers or reports
When benchmarking OCR performance