Проверка текста на ИИ — это анализ статистических признаков текста, а не поиск цифрового отпечатка конкретной нейросети. Точность таких сервисов ограничена, и это стоит понимать до, а не после сдачи работы.

Как устроен детектор ИИ-текста изнутри

Большинство детекторов не сравнивают ваш текст с базой готовых ответов ChatGPT — это технически невозможно, ответы генерируются заново при каждом запросе. Вместо этого они оценивают два статистических признака. Первый — perplexity, мера того, насколько предсказуемо каждое следующее слово: у сгенерированного текста слова чаще идут «ожидаемо», у живого — с большим числом неожиданных оборотов. Второй — burstiness, разброс длины и структуры предложений: человек естественно чередует короткую фразу и длинный период, нейросеть по умолчанию держит более ровный ритм.

Часть сервисов, включая закрытый сейчас классификатор OpenAI, обучалась на парах «текст человека — текст модели» как задача бинарной классификации. Такой подход зависит от того, какие модели попали в обучающую выборку, поэтому точность падает на новых версиях нейросетей и на текстах, прошедших ручную правку.

Какие сервисы проверяют текст на ИИ в России и за рубежом

Антиплагиат.ВУЗ и модуль поиска нейросетевых текстов

С 2023 года система Антиплагиат, которую используют большинство российских вузов, добавила отдельный модуль поиска текстов, сгенерированных нейросетями. Он работает параллельно с проверкой на заимствования и выдаёт отдельный процент по ИИ-генерации в отчёте — эту цифру видит и студент, и научный руководитель.

Зарубежные детекторы — GPTZero, Copyleaks, Originality.ai

GPTZero, Copyleaks и Originality.ai работают по схожему принципу perplexity и burstiness, но откалиброваны в основном на англоязычные тексты — на русском их точность заметно ниже, и полагаться на них при сдаче работы в российский вуз смысла немного. Показательный факт: летом 2023 года OpenAI закрыла собственный публичный классификатор ИИ-текста, прямо указав низкую точность как причину закрытия.

Насколько точны такие проверки

Открытая статистика по конкретным цифрам точности у большинства сервисов не публикуется или обновляется без ретроспективных данных, поэтому приводить проценты здесь было бы нечестно. Общая закономерность, которую подтверждают и разработчики, и независимые тесты: короткие тексты, короче 300-400 слов, детекторы оценивают менее надёжно, чем длинные; тексты на неанглийских языках — менее надёжно, чем англоязычные; текст, прошедший ручное редактирование после генерации, — менее надёжно, чем нетронутый вывод модели.

Что повышает ИИ-процент даже в самостоятельном тексте

  • ровный, «учебниковый» стиль без личных оборотов и разговорных вставок
  • одинаковая по длине структура предложений
  • обильные канцелярские клише, которые часто встречаются и в текстах нейросетей: «таким образом», «важно отметить», «в заключение хочется сказать»
  • сухой пересказ учебника без собственных примеров и аргументации
  • текст, переведённый через онлайн-переводчик с иностранного источника

Как снизить риск ложного срабатывания при написании работы

Живая интонация — защита не от конкретного алгоритма, а от совпадения признаков, которые эти алгоритмы ищут. Помогает разное: чередование коротких и длинных предложений, собственные примеры вместо абстрактных формулировок, точные ссылки на то, что вы читали или считали лично («по данным ГОСТ 7.32-2017», а не «согласно нормативным документам»), обоснованные переходы между абзацами вместо шаблонных связок.

ПовышаетСнижает
Однородная длина предложенийЧередование коротких и длинных фраз
Канцелярские клишеКонкретные примеры и цифры
Пересказ без своей позицииЛичная аргументация и выводы
Текст без ссылок на источникиТочные ссылки на ГОСТ, статьи, методички
Что снижает и что повышает ИИ-процент

Что будет, если детектор показал высокий процент ИИ

Итоговое решение почти всегда принимает научный руководитель или комиссия, а не автоматический отчёт. На практике это разговор: вас могут попросить объяснить отдельные формулировки, показать черновики или источники. Если текст писали сами — сохраняйте промежуточные версии файла и заметки по источникам, это самый весомый аргумент. Если часть текста дорабатывал сервис вроде Pomogator.Ai, важно пройтись по готовому файлу самостоятельно — переписать формулировки своими словами и добавить примеры из своей практики, это снижает и формальный ИИ-процент, и риск вопросов на защите.

Частые вопросы

Можно ли обмануть детектор ИИ-текста?

Формально да — ручная переработка текста снижает статистические признаки генерации. Но задача не в том, чтобы обойти проверку, а в том, чтобы текст реально соответствовал вашему уровню и понимался вами на защите.

Какой процент ИИ считается допустимым?

Единого норматива нет — порог устанавливает конкретный вуз или кафедра в своих методических указаниях. Уточните этот показатель у научного руководителя до сдачи, а не после.

Проверяет ли Антиплагиат.ВУЗ текст на ИИ автоматически при обычной загрузке?

Да, если вуз подключил соответствующий модуль — тогда отчёт по ИИ-генерации формируется вместе с отчётом об оригинальности, отдельно загружать текст никуда не нужно.

Отличаются ли детекторы для русского и английского текста?

Да, большинство популярных зарубежных сервисов обучены преимущественно на английском языке, и их точность на русском тексте ниже, чем у решений, специально откалиброванных под русский, вроде модуля Антиплагиат.ВУЗ.

Если использовал сервис вроде Pomogator.Ai для черновика, это увидит детектор?

Черновик, сгенерированный сервисом, детектор в среднем распознаёт с той же вероятностью, что и любой другой ИИ-текст. Поэтому финальную версию стоит дорабатывать самостоятельно — добавлять свои примеры и переформулировать ключевые абзацы.