Обучению языковых моделей мешает некачественное распознавание текстов старыми OCR
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
Компания Baidu разработала OCR-систему, которая обходит ограничения памяти за счет механизма R-SWA, позволяя быстро и точно распознавать многостраничные документы.
Современные мультимодальные OCR-модели эволюционировали от простого распознавания текста к комплексному пониманию документов с поддержкой 100+ языков и расширенными функциями анализа.
LightOnOCR-1B устанавливает новый стандарт эффективности в оптическом распознавании текста — работает в 6 раз быстрее конкурентов при стоимости менее $0,01 за 1000 страниц.
Современные открытые модели OCR преобразуют не только текст, но и сложные элементы документов: таблицы, диаграммы и изображения с сохранением структуры.
Китайская компания DeepSeek разработала систему OCR, которая сжимает текст из изображений в 10 раз, позволяя ИИ обрабатывать больше документов без перегрузки памяти.