Обучению языковых моделей мешает некачественное распознавание текстов старыми OCR
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
26 сентября 2026
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
OpenAI запустила GPT-5.6-Cyber, модель для поиска уязвимостей и написания эксплойтов, доступную через закрытый уровень Daybreak Red.
Meta* представила модель Muse Glimmer для локального запуска на ПК. Это меняет подход бизнеса к затратам на ИИ, превращая их из операционных в капитальные.
ByteDance представила SeedRealtime — полнодуплексную мультимодальную модель, способную одновременно обрабатывать видео и аудио для естественного диалога.
Разработчики Suno представили новые меры по защите авторских прав и ограничению массовой генерации треков на фоне юридического давления в Европе и США.
Google DeepMind представила DiffusionGemma — модель, которая генерирует текст параллельными блоками из шума, обеспечивая высокую скорость работы.