Оглавление

Исследователи задались вопросом, могут ли современные большие языковые модели (LLM), облаченные в цифровую «личность», предсказывать реакции реальных пользователей на контент в социальных сетях. Согласно отчету, опубликованному в журнале Nature, ИИ-агенты демонстрируют определенные успехи в этой области, однако их возможности пока далеки от идеальной симуляции человеческого поведения.

В ходе масштабного эксперимента были проанализированы реакции 1 511 участников из Сербии на 56 различных постов. Эти данные сопоставили с прогнозами 27 моделей ИИ, для которых было создано более 120 000 комбинаций цифровых персон. В первом этапе исследования агенты достигли точности в 70,7%, но этот показатель во многом объясняется предсказуемостью типичных реакций, а не глубоким пониманием индивидуальности.

Важным открытием стало то, что выбор конкретной модели ИИ влияет на результат сильнее, чем детальность описания личности. Разрыв в точности между лидерами и аутсайдерами составил 13%. Лучшие результаты показали такие модели, как GPT-5.2 и Gemini 2.5 Flash, в то время как более простые или специализированные решения справлялись заметно хуже.

Границы возможностей цифровых двойников

Методология исследования включала создание промптов трех уровней сложности: от базовой демографии до глубоких психологических портретов и аттитюдов. Ожидалось, что чем больше деталей о человеке знает модель, тем точнее будет прогноз. Однако на практике добавление сложных личностных характеристик дало лишь минимальный прирост точности по сравнению с простыми демографическими данными.

Интересно, что классические алгоритмы машинного обучения, использующие векторное представление текста TF-IDF, превзошли современные LLM-агенты, достигнув коэффициента корреляции Мэтьюса 0,36 против 0,29 у нейросетей. Это намекает на то, что текущие модели скорее занимаются семантическим анализом текста поста, чем реальным моделированием человеческой логики или эмоций.

Превосходство классических текстовых классификаторов над сложными LLM-агентами обнажает главную проблему: современные нейросети пока не симулируют личность, а лишь эффективно распознают паттерны в контенте. Использование тяжеловесных моделей там, где справляется обычная логистическая регрессия, выглядит избыточным. Пока мы видим не цифровое «я», а очень продвинутый поисковый алгоритм с человеческим лицом.

Фактор контекста и эмоционального окраса

Исследование выявило любопытную закономерность в зависимости от типа контента. Предсказать реакцию на развлекательные посты оказалось проще, чем на политические новости. В политической сфере точность прогнозов напрямую зависела от того, совпадали ли взгляды цифровой персоны с темой поста. Если агент «знал» об отношении пользователя к конкретным институтам власти, вероятность правильного предсказания негативной реакции возрастала.

Также был зафиксирован выраженный позитивный сдвиг: ИИ гораздо точнее предсказывает лайки (точность около 68%), чем дизлайки или критические комментарии. Это может быть связано как с особенностями обучающих выборок, так и с общей склонностью моделей к «вежливости» и социально одобряемым ответам, что искажает реальную картину сетевых дискуссий.

Для разработчиков и исследователей это означает, что создание универсального симулятора общества на базе промптов — задача нетривиальная. Текущие возможности позволяют оценивать общие тренды и тестировать алгоритмы рекомендаций на устойчивость к поляризации, но они все еще недостаточно надежны для точного микротаргетинга или предсказания индивидуального поведения в сложных сценариях.