← Блог

Как Антиплагиат определяет ИИ-текст

ИИ для науки12 мин чтения

Как Антиплагиат определяет ИИ-текст и что делать честному автору

Вы написали главу диссертации сами, вычитали каждый абзац, сверили все ссылки. А система проверки пометила часть текста как «подозрение на искусственный интеллект». Знакомая ситуация становится всё чаще: детектор ИИ в Антиплагиате реагирует не только на тех, кто скормил задание ChatGPT, но и на аккуратный, сухой академический стиль. Разберём, как антиплагиат определяет ИИ-текст на самом деле, почему честные работы попадают под подозрение и что делать, если пометили именно вашу.

Исходная позиция статьи такова: использовать ИИ как инструмент поиска и анализа литературы, а затем писать текст самостоятельно, это нормальная исследовательская практика. Проблема не в инструментах, а в подмене: когда нейросеть генерирует и текст, и «источники», которых не существует. Разница между этими двумя сценариями и есть главный сюжет статьи.

Как вообще работает детектор ИИ-текста

Без общего принципа разговор про Антиплагиат превращается в гадание. Детекторы сгенерированного текста, независимо от разработчика, устроены похоже. Они не «понимают» смысл и не сверяют вашу работу с базой готовых нейросетевых текстов. Они оценивают статистику.

Языковая модель, когда пишет текст, каждое следующее слово выбирает как самое вероятное продолжение предыдущих. Она статистически «приглаживает» фразу. Человек так не пишет. Живой автор нет-нет да и вставит неожиданный оборот, редкое слово, кривоватую, но свою конструкцию. Вот эту разницу в предсказуемости детекторы и ловят.

Есть два понятия, которыми это описывают. Их полезно понимать по-человечески, без формул.

Перплексия это мера «удивления» модели. Представьте, что языковая модель читает ваш текст слово за словом и на каждом шаге пытается угадать следующее. Если текст легко предсказуем, модель почти не удивляется, перплексия низкая. Если то и дело попадаются неожиданные для модели слова, перплексия высокая. Машинный текст обычно гладкий и предсказуемый, поэтому перплексия у него ниже, чем у живого. Детектор примерно так и рассуждает: слишком ровно и предсказуемо, похоже на генерацию.

Вариативность (в англоязычных работах её называют burstiness) это про ритм. Люди пишут неровно: длинное предложение, потом короткое, потом опять развёрнутое. Нейросеть склонна выдавать более однородные по длине и структуре фразы. Ровный, монотонный ритм это ещё один сигнал для детектора.

Отсюда сразу видно слабое место всей технологии. Детектор измеряет форму, а не факт авторства. Он не знает, кто сидел за клавиатурой. Он знает только, насколько текст статистически похож на то, что обычно выдаёт генеративная модель. А «гладко и предсказуемо» пишет не только ChatGPT. Так пишет любой человек, который старается излагать по-научному: нейтрально, терминологично, без эмоций и авторских вольностей. Держите эту мысль, к ней вернёмся в разделе про ложные срабатывания.

Что реально известно о детекторе Антиплагиата

Теперь конкретно про систему Антиплагиат. Здесь важно отделить проверяемые факты от домыслов, которых в сети полно.

Компания «Антиплагиат» встроила в свои сервисы отдельный модуль для выявления сгенерированного текста, детектор признаков ИИ-генерации. Он анализирует работу и помечает фрагменты, которые с высокой вероятностью написаны языковой моделью. В отчёте такие места выделяются, а документ получает статус подозрительного.

Как именно устроен алгоритм? По словам исполнительного директора компании Юрия Чеховича, в основе лежит ИИ-классификатор: система относит текст к одной из двух категорий, «искусственный» или «естественный», опираясь на большой набор признаков. Конкретные признаки компания не раскрывает, и это разумно с их стороны, иначе детектор было бы проще обходить. Так что любой, кто на форуме уверенно расписывает «внутреннюю кухню» Антиплагиата, скорее всего фантазирует. Достоверно известно одно: это статистический классификатор, а не сверка с базой.

Один публичный пример признаков представители компании всё же приводили. Чехович упоминал «эффект Дори» (по имени рыбки из мультфильма, которая всё забывает): сгенерированный текст часто по кругу повторяет одну и ту же мысль разными словами или выдаёт логически противоречащие друг другу выводы. Модель не удерживает связность на длинной дистанции. Для человека, который пишет осмысленно, это как раз нехарактерно.

И вот ключевое, ради чего стоит дочитать до этого места. Позиция самой компании: детектор это инструмент, который подсвечивает подозрительные фрагменты, а не выносит вердикт. Финальное решение принимает человек. Формулировка Чеховича прямая: система лишь выделяет подозрительные места, а дальше дело за человеком, который должен внимательно их прочитать. То есть метка «подозрение на ИИ» это не приговор и не доказательство. Это повод присмотреться, и присматривается живой проверяющий, нормоконтролёр, научный руководитель, комиссия.

Из этого следуют две вещи. Первая: спорить есть с кем и есть о чём, потому что решение за людьми. Вторая: сам разработчик признаёт, что полностью исключить ошибку нельзя, генеративные модели меняются, и детектор не может быть стопроцентным. Значит, ложные срабатывания это не миф недовольных студентов, а встроенное свойство метода.

Почему честный академический текст попадает под подозрение

Теперь самая болезненная часть для научного автора. Вы ничего не генерировали, а вас пометили. Как так?

Вернёмся к тому, что детектор измеряет форму. А научный стиль по своей природе такой, какой детектор считает «подозрительным».

  • Нейтральность и безличность. Академический текст избегает эмоций, авторского «я», разговорных оборотов. Ровно то же самое делает языковая модель. По статистике два текста выглядят похоже.
  • Терминологическая плотность и клише жанра. «Целью настоящего исследования является», «полученные результаты свидетельствуют о», «в ходе анализа было установлено». Это устойчивые обороты научной речи. Они предсказуемы по определению, а предсказуемость это низкая перплексия, то есть сигнал для детектора.
  • Ровный ритм. Методология, описание выборки, статистика. Такие разделы пишутся однородными, выверенными фразами. Мало вариативности, снова совпадение с машинным профилем.
  • Стандартизованные разделы. Введение, обзор литературы, ограничения исследования строятся по шаблону, которому вас годами учили. Шаблонность на руку детектору, ему проще принять её за генерацию.

Добавьте сюда перевод. Многие исследователи пишут на русском, а часть материала читают и конспектируют на английском, потом переводят формулировки. Переведённый и приглаженный текст тоже теряет «живую неровность» и статистически смещается в сторону машинного.

Отдельная зона риска это короткие технические фрагменты: определения, аннотация, описание процедуры. Детекторы, и это признают сами разработчики, точнее работают на длинных текстах и заметно чаще ошибаются на коротких. Аннотация в двести слов может получить метку просто потому, что материала для статистики мало.

Вывод неприятный, но честный: сам факт метки не говорит о том, что текст сгенерирован. Он говорит, что текст статистически похож на генерацию. Для сухой научной прозы это похоже слишком часто.

«ИИ написал текст» против «ИИ помог найти источники»: где проходит граница

Это различие стоит проговорить отдельно, потому что вокруг него и крутится весь этический спор, и именно оно решает, есть вам о чём беспокоиться или нет.

Сценарий, который создаёт реальные проблемы. Автор просит нейросеть «написать обзор литературы по теме», получает готовый текст и вставляет его в работу. Беда даже не в детекторе. Беда в том, что генеративная модель вроде ChatGPT в таком режиме выдумывает источники: правдоподобные фамилии, названия, годы, журналы и DOI, которых не существует в природе. Про этот механизм мы подробно писали в разборе, почему ChatGPT выдумывает источники. Когда комиссия начнёт проверять список литературы и не найдёт половину ссылок, метка детектора станет наименьшей из бед. Это уже вопрос научной добросовестности.

Сценарий, который проблем не создаёт. Автор использует ИИ-инструмент, чтобы найти реальные публикации по теме, отобрать релевантные, вытащить из них данные, а выводы и текст пишет сам. Здесь ИИ работает как ускоритель рутины: поиск, скрининг, систематизация. Все источники настоящие, каждый можно открыть и проверить. Текст авторский. С точки зрения научной этики это то же самое, что пользоваться поисковой системой, менеджером ссылок или статистическим пакетом. Инструмент помогает работать с литературой, а не подменяет автора.

Разница, если свести к одному предложению, вот в чём: в первом случае ИИ порождает и содержание, и «доказательства», причём доказательства фальшивые. Во втором ИИ помогает найти настоящие доказательства, а содержание и ответственность остаются за исследователем.

Понимание этой границы, кстати, снимает часть страха перед детектором. Если вы во втором сценарии, у вас на руках есть то, чего нет у недобросовестного автора: реальные источники, история работы, черновики. Всё это проверяемо. И именно это спасает, если метка всё-таки появилась.

Что делать, если работу пометили как ИИ

План действий для случая, когда вы писали честно, а статус «подозрение на ИИ» всё равно стоит. По шагам.

1. Не паникуйте и перечитайте формулировку отчёта. Метка это «подозрение», а не «установлено, что текст сгенерирован». Решение принимает человек. Значит, ваша задача не оправдываться, а показать проверяющему процесс вашей работы.

2. Найдите подсвеченные фрагменты и посмотрите на них трезво. Часто под метку попадают именно шаблонные, гладко написанные куски: введение, определения, переходные абзацы. Спросите себя, можно ли переписать их живее и конкретнее, не в ущерб научности. Добавить пример, уточнение, ссылку на конкретные данные. Не ради обмана детектора, а потому что конкретный текст объективно лучше обтекаемого. Заодно снизится и статистическое сходство с генерацией.

3. Соберите доказательства авторства. Это самый сильный аргумент, и он есть у любого, кто реально работал:

  • История версий. Документы в Word, Google Docs или облаке хранят историю изменений и даты. Черновики, промежуточные варианты, правки по замечаниям руководителя. Текст, «написанный за один вечер нейросетью», такой истории не имеет.
  • Рабочие материалы. Конспекты, выписки, заметки на полях PDF, таблицы с данными, расчёты. Всё, что показывает, как рождался текст.
  • Реальность всех источников. Откройте свой список литературы и проверьте, что каждая ссылка ведёт на существующую публикацию: есть DOI, статья находится в базе, страницы и цитаты совпадают. Это ваш козырь. У сгенерированного «под ключ» текста источники не выдерживают проверки, у вашего выдерживают.

4. Поговорите с научным руководителем или комиссией по существу. Объясните, чем вы пользовались и как. «Я искал литературу через такой-то инструмент, отобрал статьи по критериям, данные извлекал вручную из полных текстов, выводы и текст писал сам, вот черновики и вот источники». Это разговор взрослых людей о методе, а не попытка проскочить.

Чего делать не нужно. Не гоняйтесь за «гуманизаторами» и перефразировщиками, которые обещают «убрать метку ИИ». Во-первых, это игра в кошки-мышки с постоянно меняющимся детектором, вы её не выиграете стабильно. Во-вторых, машинный рерайт как раз портит текст: плодит корявые синонимы и логические швы, те самые повторы и противоречия из «эффекта Дори», на которые детектор и настроен. В-третьих, и это главное, если ваш текст честный, вам нечего прятать. Прятать надо подделку, а её лучше не создавать.

Мы отдельно разбирали, как устроены инструменты проверки на оригинальность и на ИИ и на что реально можно полагаться, а на что нет. Если коротко: относитесь к любому детектору как к сигналу для человека, а не как к судье.

Где здесь Нейросинт и чем он отличается от генератора текста

Отдельно о том, какое место в этой теме занимает Нейросинт. Сервис сознательно сделан не как генератор текста. Он не пишет за вас главу и не сочиняет «обзор литературы под ключ». Он делает другую работу, ту, что законна и полезна: находит и анализирует реальные публикации.

Как это выглядит на практике. Вы формулируете исследовательский вопрос, а семантический поиск прочёсывает официальные базы: OpenAlex, PubMed, Semantic Scholar, Crossref, arXiv, а также русскоязычные eLibrary и КиберЛенинку. На выходе не выдуманные ссылки, а настоящие статьи, каждую можно открыть. Дальше система помогает отобрать релевантные по вашим критериям в логике PRISMA и извлечь данные из полных текстов PDF. И вот принципиальный момент: за каждым выводом стоит проверяемая цитата с привязкой к странице. Если данных в источниках нет, система так и скажет, а не подставит правдоподобную выдумку.

Почему это важно именно в контексте детектора ИИ. В сценарии с Нейросинтом вы получаете ровно то, что защищает вас перед комиссией: реальные источники, прозрачную историю отбора, данные, привязанные к первоисточникам. А текст и выводы пишете сами. Инструмент закрывает рутину поиска и систематизации, но авторство и ответственность остаются вашими. Подробнее про этот подход, как ИИ ускоряет систематический обзор без подмены исследователя, есть отдельный разбор.

Разница с «ИИ, который пишет диссертацию» в одной фразе: одни инструменты порождают текст и фальшивые ссылки, другие помогают найти настоящие знания и работать с ними честно. Метка детектора страшна только для первых.

FAQ

Если Антиплагиат пометил текст как ИИ, работу точно не примут? Нет. Метка означает «подозрение», а не доказанный факт генерации. По позиции самой компании, детектор лишь подсвечивает подозрительные фрагменты, а решение принимает человек: нормоконтроль, научный руководитель, комиссия. С ними можно и нужно разговаривать по существу, показывая историю работы и реальность источников.

Может ли детектор ошибиться на честном тексте? Да, и разработчики этого не отрицают. Детектор оценивает статистическую форму текста, а не факт авторства. Сухой, нейтральный, терминологичный научный стиль по статистике похож на машинный, поэтому честные академические работы попадают под подозрение регулярно. Особенно короткие фрагменты вроде аннотации.

Как антиплагиат определяет ИИ-текст технически? В основе ИИ-классификатор, который относит текст к «искусственному» или «естественному» по большому набору признаков. Конкретные признаки компания не раскрывает. Публично упоминался «эффект Дори»: сгенерированный текст склонен повторять одну мысль и выдавать противоречивые выводы. Никакой сверки с базой готовых нейротекстов там нет, это статистический анализ.

Законно ли использовать ИИ для поиска литературы в диссертации? Использовать ИИ как инструмент поиска и систематизации реальных публикаций это нормальная практика, аналогичная работе с поисковыми базами и менеджерами ссылок. Проблема возникает, когда нейросеть генерирует текст и выдумывает несуществующие источники. Пока все источники настоящие и проверяемые, а текст и выводы ваши, этических вопросов к методу нет.

Стоит ли «гуманизировать» текст, чтобы убрать метку? Нет. Перефразировщики и «гуманизаторы» ведут проигрышную гонку с меняющимся детектором и обычно ухудшают текст, добавляя корявые синонимы и логические разрывы. Если работа честная, прятать нечего: сильнее любого рерайта работают история версий, черновики и проверяемость источников.

Хотите, чтобы за каждым выводом в вашей работе стоял реальный, открываемый источник, а не правдоподобная выдумка? Попробуйте Нейросинт для поиска и анализа литературы: поиск по базам без лимита доступен на бесплатном тарифе, без привязки карты.

Попробуйте Нейросинт на своём обзоре.

Начать бесплатно →

Читайте также