Оглавление

Обучение современных нейросетей на книгах из общественного достояния сталкивается с неожиданным препятствием: низким качеством оцифровки прошлых десятилетий. Как сообщает The Decoder, проект FineBooks, ставший результатом коллаборации Hugging Face и EleutherAI, протестировал 14 открытых моделей оптического распознавания символов (OCR) на исторических документах, чтобы найти эффективный способ очистки данных для LLM.

Исследователи обнаружили, что использование текстов с ошибками распознавания катастрофически снижает эффективность обучения: модель, тренируемая на плохом OCR, усваивает информацию лишь на 30% так же эффективно, как на чистых транскрипциях. В рамках эксперимента были проанализированы более 2 000 страниц из Библиотеки наследия биоразнообразия (BHL), охватывающей миллионы страниц научной литературы, которые остро нуждаются в переработке.

Малые модели обходят гигантов в точности

В ходе тестов выяснилось, что размер модели не всегда гарантирует качество при работе с архивной бумагой и специфическими шрифтами. Лидером рейтинга стала dots.mocr с 3 миллиардами параметров, показавшая точность символов выше 97%. При этом модель OvisOCR2, имеющая всего 0,9 миллиарда параметров, заняла второе место, продемонстрировав впечатляющую экономическую эффективность.

Стоимость обработки данных оказалась на удивление низкой: лучшие решения позволяют распознавать тысячу страниц менее чем за два доллара. Это открывает путь к масштабной переработке открытых датасетов, таких как Common Pile, где сотни тысяч книг до сих пор хранятся в виде «грязного» текста из старых автоматизированных пайплайнов десятилетней давности.

Эра бездумного скармливания нейросетям любого текстового мусора подходит к концу, уступая место высокоточной селекции данных. Тот факт, что модели весом менее 1 миллиарда параметров справляются с артефактами печати лучше тяжеловесных систем, подчеркивает избыточность универсальных архитектур для узких задач. Однако пока эти инструменты не научатся сохранять оригинальную орфографию вместо принудительной модернизации, они останутся лишь «пылесосами» для подготовки обучающих выборок, а не серьезными помощниками историков. Дешевизна обработки — отличный козырь, но в академической среде точность ценится выше сэкономленных центов.

Границы применимости: ИИ против науки

Несмотря на успехи в подготовке данных для обучения ИИ, текущие OCR-модели все еще недостаточно хороши для академических исследований. Основная проблема заключается в «молчаливой модернизации»: нейросети склонны заменять архаичные символы, такие как длинная «s» (ſ), на их современные эквиваленты. Для обучения языковых моделей это приемлемо, но для ученых-гуманитариев такая потеря аутентичности критична.

Кроме того, современные модели чаще всего выдают результат в формате Markdown или простом тексте, теряя координаты слов на странице. Это делает их несовместимыми с библиотечными стандартами вроде ALTO XML. Тем не менее, команда FineBooks планирует переработать около 200 000 документов и выпустить их в виде открытого датасета, что станет значимым вкладом в развитие доступного ИИ.