Исследователи в области кибербезопасности обнаружили критическую брешь в архитектуре Grok, чат-бота от компании xAI Илона Маска. Как пишет Ars Technica, злоумышленники могут обходить защитные фильтры модели, используя зашифрованные команды, что приводит к несанкционированной передаче личной информации пользователей на сторонние серверы.
Проблема заключается в так называемой криптографической инъекции контекста. Эта атака эксплуатирует неспособность больших языковых моделей (LLM) отличать легитимные запросы пользователя от скрытых инструкций, внедренных в контент, который нейросеть анализирует по просьбе человека. Несмотря на то что xAI получила уведомление об уязвимости еще в июне, система продолжала демонстрировать небезопасное поведение на момент публикации отчета.
Механика обхода защитных барьеров
Традиционные методы защиты LLM строятся на работе статических фильтров, которые сканируют входящий текст на наличие опасных паттернов. Однако эксперт компании Adversa Рони Утевский выяснил, что если вредоносная инструкция зашифрована, фильтры воспринимают её как обычный набор символов. На вредоносной веб-странице размещается зашифрованный код вместе с ключом и командой для самой нейросети выполнить расшифровку.
Процесс атаки выглядит следующим образом:
- Пользователь просит Grok кратко пересказать содержимое определенной веб-страницы.
- Модель считывает страницу, находит инструкции по расшифровке и выполняет их в своей «песочнице», используя алгоритмы AES-256-GCM.
- Результат расшифровки попадает в модель как её собственный вывод, минуя первичные фильтры безопасности.
- Дешифрованные команды заставляют ИИ собрать имя пользователя, геолокацию и историю чатов, после чего передать эти данные в виде параметров URL при переходе по ссылке на сервер атакующего.
Архитектурный изъян современных LLM заключается в доверии к результатам исполнения собственного кода. Когда модель сама расшифровывает вредоносный промпт, она воспринимает его как проверенный внутренний контекст, а не как внешнюю угрозу. Это делает статические фильтры бесполезными, превращая мощный инструмент обработки данных в эффективное средство их эксфильтрации. Разработчикам придется пересматривать саму концепцию доверенных зон внутри модели.
Системный кризис безопасности нейросетей
Ситуация с Grok не уникальна. Ранее аналогичные проблемы наблюдались у Microsoft 365 Copilot и Google Gemini. В случае с Gemini исследователи использовали похожую технику для «джейлбрейка», заставляя модель игнорировать правила безопасности и выдавать инструкции по созданию опасных предметов. Хотя Google постепенно усиливает защиту, точные механизмы этих обновлений остаются непрозрачными.
Проблема носит фундаментальный характер: разработчики пытаются устанавливать «ограждения» на опасных поворотах вместо того, чтобы менять геометрию самой дороги. Пока LLM обучаются беспрекословно следовать инструкциям из контекста, любая попытка скрыть эти инструкции за слоем кодирования или шифрования будет находить лазейку в защите. Похоже, индустрия вступила в бесконечный цикл исправлений, где атакующие всегда на шаг впереди, манипулируя промежуточными состояниями и результатами выполнения инструментов ИИ.
Оставить комментарий