Антиплагиат не читает текст и не понимает смысл — он режет документ на короткие пересекающиеся фрагменты слов и ищет точные и близкие совпадения этих фрагментов в базе источников. Дальше — как устроен этот механизм, что ловит модуль поиска перефразирований и почему разные сервисы дают разный процент на одном и том же тексте.

Принцип шинглов — основа любой проверки

Система делит текст на короткие пересекающиеся отрезки слов длиной 3-5 слов — их называют шинглами. Каждый такой отрезок превращается в числовой отпечаток (хэш), и весь документ становится набором хэшей. Этот набор сравнивается с хэшами документов из базы источников: если совпадает достаточная доля шинглов подряд, фрагмент помечается как заимствование. Именно поэтому замена одного слова из пяти в предложении иногда не спасает — соседние шинглы всё равно совпадают.

Из чего состоит база сравнения

У Антиплагиат.ВУЗ несколько источников сравнения одновременно: открытый интернет, коллекция научных статей и диссертаций eLIBRARY, издания из электронно-библиотечных систем, по которым у вуза оформлена подписка, и закрытая база работ, уже сданных студентами этого конкретного вуза за прошлые годы. Последний пункт объясняет, почему скачанный из сети готовый реферат почти всегда даёт низкий процент — если его хотя бы раз сдавали в любом вузе, подключённом к системе, он уже в базе.

Модуль поиска перефразирований

Отдельный модуль в Антиплагиат.ВУЗ ищет не дословные совпадения, а близкие по смыслу конструкции — синонимичные замены, изменённый порядок слов в предложении, перестановку частей сложного предложения. Он сравнивает не сами слова, а их семантические классы, поэтому механическая синонимизация через автоматический сервис часто не помогает: структура предложения и связи между понятиями остаются теми же, что и в источнике, а система именно на это и настроена.

Детектор текста, сгенерированного нейросетью

Этот модуль работает отдельно от процента оригинальности и не ищет совпадения с базой источников вообще. Он анализирует статистические признаки самого текста: предсказуемость выбора следующего слова, равномерность длины предложений, характерные для генеративных моделей обороты и связки. Текст может быть уникальным по формальному проценту и одновременно получить высокую отметку «вероятно сгенерировано нейросетью» — это два разных показателя, и вуз может учитывать оба отдельно в итоговом решении.

Почему система не понимает смысл текста

Шингл-анализ работает с последовательностями символов и слов, а не с логикой рассуждения. Система не отличит грамотный вывод от бессвязного набора уникальных фраз, если оба текстовно не совпадают с базой. Поэтому высокий процент оригинальности не гарантирует качество работы — оценивать содержание всё равно будет научный руководитель, а антиплагиат отвечает только на вопрос «встречался ли уже такой набор слов».

Насколько строгими бывают разные сервисы

СервисЧто сравниваетОсобенность
Антиплагиат.ВУЗинтернет, eLIBRARY, ЭБС вуза, архив работ студентовсамая строгая база за счёт архива прошлых работ конкретного вуза
Антиплагиат.ру (открытая версия)открытый интернет и часть коллекции eLIBRARYбез доступа к закрытому архиву вуза, цифра ориентировочная
Руконтекстоткрытый интернет и партнёрские базы изданийиспользуется рядом издательств и научных журналов
eTXT Антиплагиатоткрытые источники и биржи контентав основном для проверки копирайтинга, не научных работ
Логика проверки в популярных сервисах

Что это значит на практике при подготовке текста

  • Скачанные из интернета готовые рефераты почти всегда уже в базе — система сравнивает не только с открытым вебом, но и с архивом сданных работ
  • Синонимизация без изменения структуры предложения ловится модулем перефразирований — меняйте порядок мысли, а не только слова
  • Дословная цитата с указанием источника не считается нарушением — система лишь помечает её отдельно
  • Отметка о признаках нейросети выводится отдельно от процента оригинальности и может насторожить руководителя даже при высоком проценте

Частые вопросы

Может ли антиплагиат ошибочно посчитать оригинальный текст заимствованным

Да, если формулировка случайно совпадает с распространённым устойчивым выражением или общепринятым определением термина из учебника — система засчитывает совпадение по шинглам независимо от того, кто писал текст первым.

Почему один и тот же текст даёт разный процент в разных сервисах

У каждого сервиса своя база источников — Антиплагиат.ВУЗ сравнивает ещё и с закрытым архивом работ конкретного института, которого нет у открытых бесплатных проверок.

Проверяет ли антиплагиат картинки и формулы

Нет, базовый шингл-анализ работает с текстом; изображения, таблицы и формулы в редакторе формул система обычно пропускает при подсчёте процента.

Что делает модуль обнаружения текста нейросети конкретно

Он анализирует статистические признаки самого текста — предсказуемость выбора слов и однородность предложений — и не связан с поиском совпадений в базе источников, поэтому это отдельный показатель в отчёте.

Влияет ли объём цитат на итоговую оценку антиплагиата

Большая доля корректно оформленных цитат снижает процент оригинальности, но не приравнивается к плагиату — многие вузы устанавливают отдельный допустимый порог именно для процента корректных заимствований.