Проверка текста на ИИ — это анализ статистических признаков текста, а не поиск цифрового отпечатка конкретной нейросети. Точность таких сервисов ограничена, и это стоит понимать до, а не после сдачи работы.
Как устроен детектор ИИ-текста изнутри
Большинство детекторов не сравнивают ваш текст с базой готовых ответов ChatGPT — это технически невозможно, ответы генерируются заново при каждом запросе. Вместо этого они оценивают два статистических признака. Первый — perplexity, мера того, насколько предсказуемо каждое следующее слово: у сгенерированного текста слова чаще идут «ожидаемо», у живого — с большим числом неожиданных оборотов. Второй — burstiness, разброс длины и структуры предложений: человек естественно чередует короткую фразу и длинный период, нейросеть по умолчанию держит более ровный ритм.
Часть сервисов, включая закрытый сейчас классификатор OpenAI, обучалась на парах «текст человека — текст модели» как задача бинарной классификации. Такой подход зависит от того, какие модели попали в обучающую выборку, поэтому точность падает на новых версиях нейросетей и на текстах, прошедших ручную правку.
Какие сервисы проверяют текст на ИИ в России и за рубежом
Антиплагиат.ВУЗ и модуль поиска нейросетевых текстов
С 2023 года система Антиплагиат, которую используют большинство российских вузов, добавила отдельный модуль поиска текстов, сгенерированных нейросетями. Он работает параллельно с проверкой на заимствования и выдаёт отдельный процент по ИИ-генерации в отчёте — эту цифру видит и студент, и научный руководитель.
Зарубежные детекторы — GPTZero, Copyleaks, Originality.ai
GPTZero, Copyleaks и Originality.ai работают по схожему принципу perplexity и burstiness, но откалиброваны в основном на англоязычные тексты — на русском их точность заметно ниже, и полагаться на них при сдаче работы в российский вуз смысла немного. Показательный факт: летом 2023 года OpenAI закрыла собственный публичный классификатор ИИ-текста, прямо указав низкую точность как причину закрытия.
Насколько точны такие проверки
Открытая статистика по конкретным цифрам точности у большинства сервисов не публикуется или обновляется без ретроспективных данных, поэтому приводить проценты здесь было бы нечестно. Общая закономерность, которую подтверждают и разработчики, и независимые тесты: короткие тексты, короче 300-400 слов, детекторы оценивают менее надёжно, чем длинные; тексты на неанглийских языках — менее надёжно, чем англоязычные; текст, прошедший ручное редактирование после генерации, — менее надёжно, чем нетронутый вывод модели.
Что повышает ИИ-процент даже в самостоятельном тексте
- ровный, «учебниковый» стиль без личных оборотов и разговорных вставок
- одинаковая по длине структура предложений
- обильные канцелярские клише, которые часто встречаются и в текстах нейросетей: «таким образом», «важно отметить», «в заключение хочется сказать»
- сухой пересказ учебника без собственных примеров и аргументации
- текст, переведённый через онлайн-переводчик с иностранного источника
Как снизить риск ложного срабатывания при написании работы
Живая интонация — защита не от конкретного алгоритма, а от совпадения признаков, которые эти алгоритмы ищут. Помогает разное: чередование коротких и длинных предложений, собственные примеры вместо абстрактных формулировок, точные ссылки на то, что вы читали или считали лично («по данным ГОСТ 7.32-2017», а не «согласно нормативным документам»), обоснованные переходы между абзацами вместо шаблонных связок.
| Повышает | Снижает |
|---|---|
| Однородная длина предложений | Чередование коротких и длинных фраз |
| Канцелярские клише | Конкретные примеры и цифры |
| Пересказ без своей позиции | Личная аргументация и выводы |
| Текст без ссылок на источники | Точные ссылки на ГОСТ, статьи, методички |
Что будет, если детектор показал высокий процент ИИ
Итоговое решение почти всегда принимает научный руководитель или комиссия, а не автоматический отчёт. На практике это разговор: вас могут попросить объяснить отдельные формулировки, показать черновики или источники. Если текст писали сами — сохраняйте промежуточные версии файла и заметки по источникам, это самый весомый аргумент. Если часть текста дорабатывал сервис вроде Pomogator.Ai, важно пройтись по готовому файлу самостоятельно — переписать формулировки своими словами и добавить примеры из своей практики, это снижает и формальный ИИ-процент, и риск вопросов на защите.
Частые вопросы
Можно ли обмануть детектор ИИ-текста?
Формально да — ручная переработка текста снижает статистические признаки генерации. Но задача не в том, чтобы обойти проверку, а в том, чтобы текст реально соответствовал вашему уровню и понимался вами на защите.
Какой процент ИИ считается допустимым?
Единого норматива нет — порог устанавливает конкретный вуз или кафедра в своих методических указаниях. Уточните этот показатель у научного руководителя до сдачи, а не после.
Проверяет ли Антиплагиат.ВУЗ текст на ИИ автоматически при обычной загрузке?
Да, если вуз подключил соответствующий модуль — тогда отчёт по ИИ-генерации формируется вместе с отчётом об оригинальности, отдельно загружать текст никуда не нужно.
Отличаются ли детекторы для русского и английского текста?
Да, большинство популярных зарубежных сервисов обучены преимущественно на английском языке, и их точность на русском тексте ниже, чем у решений, специально откалиброванных под русский, вроде модуля Антиплагиат.ВУЗ.
Если использовал сервис вроде Pomogator.Ai для черновика, это увидит детектор?
Черновик, сгенерированный сервисом, детектор в среднем распознаёт с той же вероятностью, что и любой другой ИИ-текст. Поэтому финальную версию стоит дорабатывать самостоятельно — добавлять свои примеры и переформулировать ключевые абзацы.