MonkeyOCRv2 is a visual-text foundation model designed for document AI, addressing limitations of mainstream visual encoders in processing document images through character-level visual perception. To enhance its performance, the authors introduce MonkeyDoc v2, the largest document-image pretraining corpus with 113 million multilingual images. The model leverages this extensive dataset to improve text recognition capabilities in document analysis. Read original
huggingface/daily-papers