Машинное обучение

Актуальные новости машинного обучения и нейронных сетей. Прорывы в области ML, новые алгоритмы, исследования от ведущих лабораторий. Практические применения машинного обучения в бизнесе, науке и повседневной жизни. Deep learning, computer vision, NLP и другие направления. Туториалы, гайды и экспертные материалы для специалистов.

Count Anything

Китайские ученые представили модель Count Anything, которая умеет только считать объекты

Новая модель Count Anything от исследователей Университета Цинхуа решает сложную задачу универсального подсчета объектов на изображениях разных типов с помощью текстовых подсказок.

Reinforcement Learning with Verifiable Rewards

Исследователи предложили способ обучать LLM суммаризации процессов мышления через RLVR

Исследователи представили ReSum — метод обучения LLM самостоятельному сжатию своих мыслей для повышения точности и сокращения затрат на токены.

Sapient обучили HRM-Text

Разработчики из Sapient смогли обучить базовую ИИ-модель всего за $1500

Исследователи из Sapient представили архитектуру HRM-Text, позволившую обучить базовую модель с 1 млрд параметров всего за 1500 долларов, бросив вызов доминированию тяжелых трансформеров.

Одинаковое мышление LLM

Исследование показало, что крупные LLM часто «мыслят» похоже и дают одинаковые ответы

Исследование показывает, что продвинутые языковые модели демонстрируют общие паттерны взаимодействия при предсказании токенов, что открывает путь к универсальному аудиту ИИ.

LLM-судьи не понимают контекст

ИИ-судьи не могут быть беспристрастными, потому что часто игнорируют новый контекст

Новое исследование показывает, что LLM-судьи часто игнорируют контекст, если он противоречит их внутренним установкам, что ставит под угрозу точность оценки безопасности ИИ.

Крупные LLM обучаются лучше

Исследование объяснило, почему крупные LLM обучаются лучше, чем небольшие модели

Долгое время считалось, что чем больше параметров в нейросети, тем она умнее. Новое исследование объясняет, что дело не только в абстрактной «мощности», а в способности модели справляться с внутренним шумом при усвоении редких данных.