OCR

Новости

FineBooks OCR

Обучению языковых моделей мешает некачественное распознавание текстов старыми OCR

Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.

Baidu Unlimited OCR

Baidu представила Unlimited OCR — модель распознавания текста, умеющую «забывать» лишнее

Компания Baidu разработала OCR-систему, которая обходит ограничения памяти за счет механизма R-SWA, позволяя быстро и точно распознавать многостраничные документы.

OCR-модели не только для текста

Мультимодальные OCR-модели выходят за рамки простого распознавания текста

Современные мультимодальные OCR-модели эволюционировали от простого распознавания текста к комплексному пониманию документов с поддержкой 100+ языков и расширенными функциями анализа.

LightOnOCR-1B: модель для OCR

LightOnOCR-1B: модель для оптического распознавания текста с рекордной скоростью

LightOnOCR-1B устанавливает новый стандарт эффективности в оптическом распознавании текста — работает в 6 раз быстрее конкурентов при стоимости менее $0,01 за 1000 страниц.

Open-source OCR

Оптическое распознавание текста вышло на новый уровень с открытыми моделями

Современные открытые модели OCR преобразуют не только текст, но и сложные элементы документов: таблицы, диаграммы и изображения с сохранением структуры.

DeepSeek разработал OCR

DeepSeek разработал OCR-систему для сжатия текста из изображений

Китайская компания DeepSeek разработала систему OCR, которая сжимает текст из изображений в 10 раз, позволяя ИИ обрабатывать больше документов без перегрузки памяти.