Оглавление

Когда первые версии языковых моделей появились в открытом доступе, отличить машинный текст от человеческого было не сложнее, чем заметить опечатку в заголовке газеты. Такой текст было легко вычислить просто по использованию характерных слов-клише.

Но сейчас все иначе: объем контента, созданного искусственным интеллектом, превысил человеческий, а его присутствие в поисковой выдаче стало повсеместным. Поэтому детекция ИИ-текстов теперь обязательный этап контроля качества для любой публикации. Потому что, к примеру, поисковики тоже оценивают подлинность контента.

Как работают сервисы ИИ-детекции

Основная проблема детекции кроется в эволюции самих алгоритмов. Когда речь шла про первые ИИ-модели, выявлять их тексты было просто — как спам в электронной почте, по стоп-словам и фразам. По мере того, как ИИ-модели становились более продвинутыми, их уже нельзя было поймать на характерных словах и оборотах. Пришлось изобретать новые способы.

Современные LLM постепенно научились имитировать плавные и естественные структуры, которые раньше, как считалось, может выдать только человек. Если раньше ИИ-текст выдавал себя специфическими повторами, то теперь он выглядит слишком идеальным. Эта безупречность сохраняется на всей протяженности документа и выдает его «машинность».

Поэтому детекторы пытаются найти статистические и лингвистические маркеры, типичные для машинной генерации. А инструменты обхода детекции, в свою очередь, научились манипулировать основными метриками, на которые опираются детекторы.

Общие принципы

В основе большинства профессиональных решений лежат модели глубокого обучения, которые прошли «курс молодости» на колоссальных массивах данных, состоящих из парных примеров: текстов, написанных людьми, и их ИИ-аналогов. Под капотом таких сервисов обычно скрывается архитектура RoBERTa. Она анализирует лингвистические признаки — от плотности словарного запаса до тегов частей речи — и демонстрирует точность до 99,73% в лабораторных условиях.

Процесс проверки обычно выглядит следующим образом:

  1. Сегментация: система делит входящий текст на отдельные фрагменты или абзацы.
  2. Вероятностный анализ: каждому куску присваивается оценка на основе предсказуемости формулировок, равномерности стиля и распределения слов.
  3. Агрегация: результаты по фрагментам объединяются в общий показатель вероятности использования ИИ.

Такой подход позволяет выявлять даже те случаи, когда автор пытается скрыть следы нейросети, вставляя собственные предложения в сгенерированный поток.

Статистические методы

В первую очередь, детекторы искусственного интеллекта применяют два ключевых статистических метода оценки текста:

  • Перплексия (perplexity — не путать с одноименным сервисом), или, говоря проще, «запутанность». Это математическая мера предсказуемости текста: она показывает, насколько модель «удивлена» выбором следующего слова в последовательности. Чем выше этот показатель, тем менее предсказуем текст и тем больше у него шансов быть признанным человеческим. Человеческое письмо в среднем демонстрирует перплексию в диапазоне от 20 до 50 по стандартным бенчмаркам для английского языка. В то же время топовые языковые модели достигают показателей всего в 5-10 единиц.
  • Неравномерность текста (burstiness), которая описывает ритм и вариабельность структуры предложений. Человек пишет хаотично: мы можем использовать длинное, нагруженное деепричастными оборотами предложение, а затем резко оборвать мысль короткой фразой. ИИ же склонен к монотонности, выдавая предложения примерно одинаковой длины и структуры. Низкая неравномерность служит серьезным сигналом для детектора. Когда текст идет ровным, предсказуемым потоком без структурных всплесков, система с большой долей вероятности пометит его как сгенерированный.

Это легко понять наглядно на примерах:

Перплексия и burstiness

То есть, суть в том, что живой человек обычно пишет пишет разными предложениями и не всегда предсказуемо. И если текст не такой — его с большой вероятностью сгенерировал ИИ.

Прочие методы

Перплексию и неравномерность при желании можно «подкрутить», к примеру, настроив параметр температуры (t) на более высокое значение. Так что вместе со статистическими методами применяются и другие:

  • Лингвистические методы — уже не столько стоп-слова (как для самых первых моделей), а средняя длина абзацев, вариативность словаря, частотность разных частей речи, синтаксические деревья. По каждой метрике есть какие-то рамки для авторского текста и какие-то для сгенерированного.
  • Семантические признаки — здесь уже текст переводят в векторный вид (как это делает LLM) и по сложным алгоритмам сравнивается с машинным и человеческим. Не такой простой метод — детектору нужно самому использовать ИИ, плюс требуются заранее размеченный большой набор данных для сравнения.

Есть методы еще сложнее — например, метод контрафактических пертурбаций. Это когда в исходных данных незначительно меняется какая-то одна деталь, а потом сравниваются результаты генерации до и после изменения. И в сгенерированных текстах отличия будут меньше. Но этот метод слишком дорогой и сложный, поэтому используется не так часто.

Водяные знаки от искусственного интеллекта

Перплексию и неравномерность оценивают по уже готовым текстам, но уже достаточно давно существует более продвинутый подход. Речь идет о так называемых «водяных знаках» — скрытых цифровых отметках, которые интегрируются непосредственно в ткань текста в момент его генерации нейросетью. Но, хоть это на первый взгляд и самый простой способ вычислить машинный текст, в реальности все не так просто.

Что такое ИИ-вотермарки

По своей сути, водяной знак в тексте — это невидимая цифровая подпись, позволяющая однозначно идентифицировать происхождение контента. В отличие от водяных знаков на бумаге или изображениях, здесь нет видимых символов или искажений. Это статистическая аномалия, заложенная в саму последовательность слов.

Суть в том, что на этапе генерации в текст «вшиваются» метки — через небольшое смещение вероятности выбора конкретного токена. Как это работает, или может работать:

  1. Доступный запас слов модели случайным образом делится на две части — «зеленый» и «красный» списки.
  2. Для слов из «зеленого» списка вероятность выбора незначительно повышается, а для «красного» — так же незначительно понижается.
  3. При генерации текста модель, соответственно, чуть чаще выбирает слова из одного списка и чуть реже — из другого.
  4. ИИ-детектор, имея ключ (то есть, доступ к этим спискам), может отследить, слова из какого списка выбираются с большей вероятностью, и так выявить, какая модель писала этот текст.

Цели внедрения таких меток благородны: борьба с дезинформацией, защита авторских прав и предотвращение «деградации» будущих моделей ИИ, которые могут случайно начать обучаться на собственных же продуктах, теряя связь с реальностью.

Разработчики пытались сделать эти метки устойчивыми к редактированию, чтобы даже после легкой правки текст сохраняла метки. Это критически важно для поддержания доверия в цифровой среде, где дипфейки и академическое списывание стали повседневностью.

Как встраиваются вотермарки

Наиболее продвинутую технологию в этой области в свое время представила команда Google DeepMind — ее назвали SynthID-Text (обычный SynthID заточен под сгенерированные изображения). Подробности этого метода были опубликованы в журнале Nature, а сам инструмент даже был доступен через Hugging Face.

Говоря проще, модель не просто выбирает наиболее вероятное следующее слово, а делает это с оглядкой на секретный алгоритм. При этом в процессе встраивания для каждого шага генерации система использует уникальный криптографический ключ, известный только создателю модели. То есть, для разработчиков ИИ-детекторов это информация закрытая.

схема маркировки текста

Генерация и выявление маркированного текста / источник: Nature

Самое удивительное, что такое вмешательство практически не влияет на качество и скорость генерации. В ходе масштабного эксперимента с Google Gemini пользователи оценили 20 миллионов ответов и не заметили разницы в качестве между маркированными и обычными текстами.

Обнаружение же происходит в обратном порядке: специальный код ищет в тексте те самые статистические паттерны «выигрышных» токенов. Система демонстрирует умеренную устойчивость: метка надежно считывается в текстах объемом от 200 токенов, даже если их пытались перефразировать другой нейросетью.

Символьные водяные знаки

Существует и более простой, даже кустарный метод — символьные водяные знаки. Они основаны на вставке в текст невидимых символов Unicode, таких как пробелы нулевой ширины или неразрывные пробелы (U+202F). Эти знаки не видны в браузере, но их легко «высветить» в редакторах кода вроде VS Code или через специальные онлайн-инструменты анализа Unicode.

Однако их надежность крайне низка: любой внимательный редактор или простая очистка форматирования удаляют их без следа. При желании их можно заметить даже в блокноте:

скрытые символы

Внимание на дефис в первой строчке: первый абзац писал ИИ, во втором дефис заменен на обычный

Интересна в этом контексте позиция OpenAI. Несмотря на то что пользователи периодически находят подобные символы в ответах ChatGPT, компания официально отрицает их намеренное внедрение. В OpenAI утверждают, что это лишь непреднамеренный побочный эффект масштабного обучения с подкреплением (и случилось это достаточно давно). Модель могла случайно научиться использовать эти символы, если они часто встречались в тренировочных данных.

Насколько это реально?

В случае с картинками «пометить» сгенерированное произведение легко. Как минимум — тот же логотип Gemini на картинках из Nano Banana, как максимум — всегда можно спрятать несколько байтов информации внутри файла. Более того, по этим меткам компании компании дают описание и иногда документацию, но без полного криптографического/алгоритмического «спека» с ключами.

Но если «прятать» метки непосредственно в тексте, может оказаться, что технология SynthID — это слишком хорошо, чтобы быть правдой. Да, за ней стоит стремление решить фундаментальные проблемы доверия, но насколько это вообще реально?

На данный момент концепция текстовых вотермарок неплохо описана в публикациях, в том числе компаний (того же Google). То есть, более-менее хорошо известно, как разбивается словарь, как смещаются вероятности токенов, как строится статистический тест, как это все в итоге контролировать.

Используется ли это на практике — неизвестно. Официально только OpenAI заявляла еще в 2024-м, что не использует вотермарки (потому что пользователи перестанут пользоваться сервисом, зная, что это раскроется). Хотя технология тестировалась, и даже выяснилось, что маркировка текста не влияет на качество самого текста.

Кроме того, можно предъявить массу аргументов в пользу того, что это не реально:

  • Между разработчиками детекторов и моделей идет «гонка вооружений», и, очевидно, условные GPTZero и Copyleaks никогда бы не получили доступа к скрытым словарям и не могли бы выявлять сгенерированный контент. А разработчики LLM не спешат представлять свои собственные детекторы.
  • Если текст в процессе генерации намеренно искажается, чтобы использовать слова из определенного списка, то даже легкая ручная или машинная редактура полностью размоет все признаки вотермарок.
  • Разработчики LLM публично заявляют, что не используют зашифрованные метки в тексте — учитывая количество сотрудников, работающих над проектами, это было бы сложно скрыть.

Соответственно, для ИИ-детекторов идея вотермарок остается скорее «священным Граалем», чем реальной технологией. Поэтому и работают они в основном через инструменты статистического, лингвистического и семантического анализа текста.

Справляются детекторы не всегда — точность детекции остается на уровне 60-70%, и лишь в лабораторных условиях повышается до 85-90%. Причем есть как ложноположительные, так и ложноотрицательные срабатывания.

Более-менее релевантный результат дают лишь немногие ИИ-детекторы — вроде Pangram. Тогда как даже популярные Copyleaks и GPTZero ошибаются гораздо чаще. Также проверить текст на ИИ можно в бесплатном детекторе от Kotia.app.

Какое будущее у маркировки

Будущее технологии, вероятно, лежит в двухуровневом подходе. Встроенный водяной знак будет служить постоянным «генетическим кодом» файла, а метаданные стандарта C2PA обеспечат прозрачную историю его изменений. Учитывая инициативы вроде OWASP AI Model Watermarking, направленные на создание открытых стандартов, можно ожидать, что в ближайшем будущем маркировка станет неотъемлемой частью любого коммерческого ИИ-инструмента.

Например, в OpenAI тоже внедряют двухуровневый подход — где ИИ-генератор получает статус соответствия стандартам C2PA, а технология SynthID проверяет контент через невидимые «фильтры»:

подход OpenAI к маркировке контента

Подход OpenAI к маркировке контента

Второе направление — государственное регулирование. Параллельно с технической реализацией подтягивается и законодательная база, которая к 2026 году стала гораздо жестче.

  1. Европейский союз: согласно EU AI Act, с марта 2025 года поставщики генеративных систем обязаны маркировать вывод в машиночитаемом формате.
  2. США: указ президента прямо предписывает создание национальных стандартов для идентификации ИИ-контента.
  3. Китай: здесь уже действуют строгие правила, требующие обязательного использования заметных меток для предотвращения манипуляций.

Правда, все это касается визуального контента — изображений и видео, потому что целью является борьба с дипфейками. И, несмотря на оптимизм регуляторов, в этой области сохраняется фундаментальная асимметрия: злоумышленнику достаточно найти одну лазейку для удаления или подделки знака, в то время как защитник обязан закрыть все возможные векторы атак.

Вопрос верификации текстов тоже важен для сохранения доверия в сети, но пока ключевую роль тут играют традиционные методы, опирающиеся на анализ перплексии и неравномерности. Однако появление инструментов «гуманизации», способных имитировать человеческую вариативность, заставляет искать более надежные решения.