Новая модель Count Anything от исследователей Университета Цинхуа решает сложную задачу универсального подсчета объектов на изображениях разных типов с помощью текстовых подсказок.
Исследователи представили ReSum — метод обучения LLM самостоятельному сжатию своих мыслей для повышения точности и сокращения затрат на токены.
Исследователи из Sapient представили архитектуру HRM-Text, позволившую обучить базовую модель с 1 млрд параметров всего за 1500 долларов, бросив вызов доминированию тяжелых трансформеров.
Исследование показывает, что продвинутые языковые модели демонстрируют общие паттерны взаимодействия при предсказании токенов, что открывает путь к универсальному аудиту ИИ.
Новое исследование показывает, что LLM-судьи часто игнорируют контекст, если он противоречит их внутренним установкам, что ставит под угрозу точность оценки безопасности ИИ.
Долгое время считалось, что чем больше параметров в нейросети, тем она умнее. Новое исследование объясняет, что дело не только в абстрактной «мощности», а в способности модели справляться с внутренним шумом при усвоении редких данных.