← Блог

ChatGPT выдумывает источники: почему и как проверить ссылки

ИИ для науки15 мин чтения

ChatGPT и другие языковые модели выдумывают источники потому, что собирают ссылку из вероятных деталей (реальный автор, реальный журнал, правдоподобный год и DOI) и не сверяют её с базой. В экспериментах 2023-2025 годов выдуманными оказывались от 18 до 55% ссылок, а у моделей с поиском в интернете от 3 до 13% ссылок вели на адреса, которых, судя по веб-архиву, никогда не существовало. Поэтому каждую ссылку от ИИ проверяют до того, как она попадёт в работу: DOI через doi.org, название через Crossref, eLibrary, КиберЛенинку или каталог библиотеки, а затем открывают сам текст и ищут в нём нужный тезис.

Ниже разобрано, откуда берутся такие ссылки, как часто они встречаются, как проверить одну ссылку или весь список и чем заканчивались случаи, когда проверки не было.

Почему языковая модель выдумывает ссылки

Языковая модель (large language model, LLM) не хранит каталог публикаций. Она предсказывает следующий фрагмент текста по вероятностям, выученным на огромном корпусе. На вопрос «какие работы есть по теме» модель отвечает текстом, который похож на список литературы, и не проверяет, существует ли каждая позиция.

Библиографическая ссылка особенно уязвима. Каждую её часть модель видела тысячи раз по отдельности: фамилии авторов из нужной области, названия журналов, формат года и тома, шаблон DOI вида 10.1038/.... Модель знает, как выглядит правильная ссылка, и собирает новую из знакомых деталей. На выходе получается запись, которая проходит проверку «на глаз», но за ней нет публикации.

Почему модель не отвечает «не знаю»? Исследователи OpenAI и Технологического института Джорджии объяснили это в 2025 году: обучение и оценка моделей поощряют догадку сильнее, чем признание неуверенности, как на экзамене, где угаданный ответ приносит баллы, а пустая строка не приносит ничего (Kalai и соавторы, 2025). Список из десяти правдоподобных ссылок выглядит лучшим ответом, чем честное признание, что таких работ модель не знает.

Режим с поиском в интернете меняет характер ошибок, но не убирает их. Модель опирается на найденные страницы, и типичными становятся две другие ошибки: ссылка на страницу, которой нет, и настоящая работа, приписанная утверждению, которого в ней нет.

Как часто ИИ выдумывает ссылки: данные исследований

Цифры заметно различаются по моделям, темам и методике. Ниже сводка трёх работ: две опубликованы в рецензируемых журналах, третья пока выложена как препринт.

ИсследованиеЧто проверялиРезультат
Walters, Wilder, Scientific Reports, 2023636 ссылок из 84 кратких обзоров литературы на 42 темы, GPT-3.5 и GPT-4Выдуманы 55% ссылок GPT-3.5 и 18% ссылок GPT-4. Среди настоящих ссылок существенные ошибки (том, номер, страницы) у 43% и 24%
Linardon и соавторы, JMIR Mental Health, 2025176 ссылок из 6 обзоров по психическому здоровью, GPT-4o, июнь 2025 годаВыдуманы 35 ссылок (19,9%). Среди 141 настоящей ссылки ошибки у 64 (45,4%), чаще всего неверный DOI
Rao, Wong, Callison-Burch, arXiv, 2026Более 221 тысячи ссылок-адресов от моделей и агентов с поиском в интернете (10 на одном наборе вопросов, 3 на другом), в том числе от OpenAI, Google и Anthropic; проверяли в основном версии 2025 года3-13% адресов не нашлись даже в веб-архиве Wayback Machine, то есть, вероятно, никогда не существовали; 5-18% не открывались. У агентов глубокого исследования (deep research) доля выдуманных адресов 10,7%, у моделей с простым поиском 4,8%

Как читать цифры Walters и Wilder. Доля ошибок считается только среди настоящих ссылок, поэтому складывать проценты напрямую нельзя. Правильный подсчёт для GPT-4: 18% выдуманных плюс 24% от оставшихся 82%, итого около 38%, то есть проблемной оказывается больше трети ссылок, почти две из пяти. Для GPT-3.5 так же получается около 74%, три ссылки из четырёх.

По сравнению с GPT-3.5 (55%) новые модели выдумывают реже, но не перестали. GPT-4o в 2025 году выдумал около 20% ссылок по темам психического здоровья, примерно столько же, сколько GPT-4 в 2023 году (18%), а по менее известным темам (дисморфофобия, компульсивное переедание) доля доходила до 28-29%. Темы и методика у двух работ разные, поэтому проценты сопоставимы лишь приблизительно. Linardon и соавторы показали и закономерность, полезную на практике: чем менее известна и уже тема, тем выше риск выдуманной ссылки.

Какими бывают ошибочные ссылки

Выдуманная целиком ссылка легко ловится. Опаснее ссылки, которые выглядят живыми.

Тип ошибкиКак выглядитКак ловится
Выдуманная работаРеальный автор и журнал, но такой статьи нетНазвание не находится ни в одной базе, у журнала нет такого номера или страниц
DOI от чужой статьиDOI открывается, но ведёт на другую работуСравнить название и авторов на странице DOI с названием в ссылке
Несуществующий DOIdoi.org отвечает «DOI Not Found»Открыть https://doi.org/ плюс DOI
Настоящая работа с ошибкамиНеверный год, том, страницы или соавторыСверить все поля с карточкой в базе или на сайте журнала
Неверно приписанный тезисСтатья существует, но утверждает другоеОткрыть текст и найти место, на которое ссылаетесь

Второй тип встречается часто. В исследовании Linardon и соавторов модель дала DOI для 33 выдуманных ссылок: 21 из них (64%) были настоящими идентификаторами, которые вели на посторонние статьи, и только 12 (36%) не открывались вовсе. Человек переходит по ссылке, видит живую страницу журнала и не замечает, что статья другая.

Как быстро проверить ссылку и DOI

Если идти по порядку, на ссылку с DOI уходит около минуты, на русскоязычную без DOI чуть больше. Каждый шаг отсекает свой тип ошибки из таблицы выше.

Если у ссылки есть DOI

  1. Откройте адрес https://doi.org/ и допишите DOI, например https://doi.org/10.1038/s41598-023-41032-5. Если страница отвечает «DOI Not Found», идентификатора не существует.
  2. Если DOI открылся, сравните название, первого автора, журнал и год на странице издателя с тем, что написано в ссылке. Совпасть должно всё. Другое название означает, что модель подставила чужой DOI.
  3. Если DOI не открылся, выводы делать рано: модель могла исказить настоящий идентификатор. Вставьте название статьи в поиск Crossref (search.crossref.org) и посмотрите, есть ли такая работа с другим DOI.

Если DOI нет, а статья зарубежная

Ищите точное название в кавычках в Crossref, PubMed (для медицины и биологии), OpenAlex или Google Академии. Если работа существует, она обычно находится хотя бы в одной из этих баз по полному названию. Если по названию ничего нет, ищите по автору и году: нередко модель берёт реального автора и приписывает ему несуществующую статью, и тогда в его списке публикаций такой работы нет.

Если ссылка русскоязычная и DOI у неё нет

У многих русскоязычных журналов DOI нет, поэтому проверка идёт через национальные ресурсы.

  • eLibrary (elibrary.ru). Найдите статью по названию или по автору. В карточке статьи указаны журнал, год, номер и страницы: сравните их со ссылкой. Если статьи нет, откройте карточку журнала и проверьте, выходил ли номер с такими страницами.
  • КиберЛенинка (cyberleninka.ru). Открытые полные тексты статей из научных журналов. Если статья там есть, её можно сразу открыть и найти нужный тезис.
  • Сайт журнала. У большинства журналов есть архив номеров с оглавлениями. Если в оглавлении указанного номера нет такой статьи, ссылка выдумана или искажена.
  • Каталоги библиотек для книг и сборников. В Беларуси: электронный каталог Национальной библиотеки Беларуси и Сводный электронный каталог библиотек Беларуси (unicat.nlb.by). В России: каталог Российской государственной библиотеки, где можно найти и российские диссертации.

Одна база покрывает не всё. Если работа не нашлась в eLibrary, проверьте КиберЛенинку, сайт журнала и каталог библиотеки. Выдумку выдают противоречия: у журнала нет такого номера, страницы выходят за пределы выпуска, автор в те годы писал о другом. Подробный справочник баз, включая белорусские репозитории, собран в статье «Где искать научные статьи».

Если нужно проверить весь список сразу

Список из десятков ссылок удобнее проверять пакетом.

  1. Crossref Simple Text Query (apps.crossref.org/SimpleTextQuery). Вставьте список литературы как есть, и сервис попытается найти DOI для каждой ссылки на журнальную статью, книгу или главу. По документации Crossref, в одну отправку помещается до 1000 ссылок, а для подбора DOI достаточно вставить список и нажать Submit (на сентябрь 2026 года). Ссылки, для которых DOI не нашёлся, проверяйте вручную в первую очередь.
  2. Менеджер ссылок Zotero. Команда «Add Item by Identifier» принимает DOI, ISBN, PubMed ID и arXiv ID. Несколько идентификаторов можно вставить сразу, разделив их пробелами, запятыми или переносами строк. Zotero подтянет метаданные из реестра, и дальше остаётся сравнить полученные названия с названиями в исходном списке: несовпадение означает чужой DOI, а отсутствие записи означает, что по идентификатору ничего не нашлось.
  3. Сверка названий. Выпишите в таблицу две колонки: название из исходной ссылки и название, которое пришло по DOI из Crossref или Zotero. Расхождение в одно-два слова часто означает ошибку в ссылке на настоящую работу, полное несовпадение означает подставленный DOI.

Когда DOI проверены, описание по ним можно собрать в ГОСТ-конструкторе: он заполняет поля по DOI для ГОСТ Р 7.0.100-2018 и для образцов ВАК РБ.

Последний шаг: найти тезис в тексте

Настоящая статья ещё не доказывает, что она подтверждает ваш вывод. Откройте полный текст или хотя бы аннотацию и найдите место, на которое ссылаетесь. Если тезиса в работе нет, ссылку убирают, даже если сама публикация реальна. Этот шаг нельзя передать ни менеджеру ссылок, ни пакетной проверке.

Шпаргалка: что проверять и где

Что есть в ссылкеПервый шагЕсли не нашлось
DOIdoi.org, затем сверка названияПоиск названия в Crossref
Зарубежная статья без DOIТочное название в Crossref, PubMed, OpenAlexСписок публикаций автора
Русскоязычная статья без DOIeLibrary, КиберЛенинкаАрхив номеров на сайте журнала
Книга, сборникКаталог НББ (Беларусь) или РГБ (Россия)Сводный каталог, ISBN в Zotero
ДиссертацияРоссия: каталог РГБ. Беларусь: каталог НББСайт организации, где проходила защита
Список из 20+ ссылокCrossref Simple Text Query или ZoteroРучная проверка ненайденных

Реальные случаи: чем заканчивались непроверенные ссылки

Springer Nature отозвал книгу, 2025

В апреле 2025 года издательство Springer Nature выпустило учебник «Mastering Machine Learning: From Basics to Advanced» (автор Govindakumar Madhavan), электронная версия стоила 169 долларов. Журналисты Retraction Watch проверили 18 из 46 ссылок в книге: примерно две трети либо не существовали, либо содержали существенные ошибки. Трое учёных, чьи работы цитировались, подтвердили, что таких публикаций у них нет или что данные искажены. Например, препринт на arXiv был указан как статья в IEEE Signal Processing Magazine.

Автор не ответил прямо, пользовался ли он языковой моделью. Летом 2025 года книгу официально отозвали (Retraction Watch сообщил об этом 4 августа). В уведомлении об отзыве сказано, что издательство не смогло подтвердить источник 25 из 46 ссылок, а редактор серии и издательство больше не доверяют надёжности книги.

Mata v. Avianca, 2023

Самый известный случай произошёл в суде. В деле Mata v. Avianca (Южный округ Нью-Йорка) адвокаты подали документ со ссылками на шесть судебных решений, которых не существовало: их сгенерировал ChatGPT. Когда один из адвокатов спросил ChatGPT, реально ли одно из дел, тот ответил, что дело существует и доступно в базах Westlaw и LexisNexis. 22 июня 2023 года судья Кевин Кастел назвал юридический анализ в одном из выдуманных решений бессмыслицей (gibberish) и наложил штраф 5000 долларов солидарно на двух адвокатов и их фирму.

Чем это грозит исследователю

  • Отклонение или отзыв статьи. Несуществующая ссылка даёт редакции формальное основание. Разбираться, ошиблись вы или доверились ИИ, никто не обязан.
  • Вопрос на защите. Выдуманный источник в списке литературы диссертации трудно объяснить, и подозрение переходит на всю работу.
  • Цепная ошибка. Ложное утверждение с «ссылкой» цитируют другие авторы, и оно расходится по литературе.

Отдельный вопрос: нужно ли раскрывать, что ИИ помогал с работой. Правила журналов и требования к диссертациям в Беларуси и России разобраны в статье «Нейросеть в диссертации и научной статье: что разрешено».

Где ChatGPT полезен, а где нет

Граница проходит по одному признаку: даёте ли исходные данные вы сами. Переформулировать ваш абзац, выправить язык, предложить структуру раздела, пересказать простыми словами статью, которую вы загрузили, перевести термин, набросать письмо редактору: во всех этих задачах модель работает с текстом, который вы ей дали, и проверить результат легко.

Запросы «подбери литературу», «дай ссылки по теме», «какие исследования это подтверждают», «приведи статистику с источником» требуют внешних фактов. Здесь модель без доступа к проверяемой базе выдаёт правдоподобную выдумку. Рабочее правило: ChatGPT можно доверить текст, который вы потом проверите, и нельзя доверить факт, который вы примете на веру.

Как снизить риск, если ИИ помогает с литературой

Надёжнее работают инструменты, которые сначала находят записи в реальных базах (OpenAlex, PubMed, Crossref и других), а уже потом дают модели работать с найденными текстами. Такой подход называют привязкой к источникам (grounding) или генерацией с опорой на поиск (retrieval-augmented generation, RAG). Ссылка в таком инструменте указывает на запись из базы, и её можно открыть.

Риск при этом снижается, но не исчезает. Исследование Rao и соавторов проверяло как раз модели с поиском, и у них 3-13% адресов, вероятно, никогда не существовали. Модель может неточно пересказать найденную статью или приписать ей чужой вывод. Поэтому последний шаг проверки (найти тезис в тексте) обязателен при любом инструменте. Как работает поиск по смыслу и какие сервисы его предлагают, разобрано в статье «Нейросеть для поиска научных статей», а где ИИ помогает при отборе и извлечении данных в систематическом обзоре, в статье «Нейросеть для обзора литературы». Какие из таких сервисов работают на русском и доступны из Беларуси и России, сравнивается в статье «Elicit и Consensus на русском: чем заменить».

Частые вопросы

Почему ChatGPT придумывает ссылки, если настоящие статьи существуют? Без поиска в интернете модель не обращается к базам, а собирает ссылку из вероятных деталей: реального автора, реального журнала, правдоподобного года и DOI. Обучение поощряет уверенный ответ сильнее, чем признание «не знаю». В режиме с поиском модель опирается на найденные страницы, но и там встречаются несуществующие адреса и тезисы, приписанные не той статье.

Если ChatGPT дал DOI, ссылка настоящая? Не обязательно. В исследовании 2025 года 64% DOI у выдуманных ссылок были настоящими идентификаторами посторонних статей. Откройте doi.org с этим DOI и сравните название и авторов на странице с тем, что написано в ссылке.

Как проверить русскоязычную статью без DOI? Найдите её по названию в eLibrary и КиберЛенинке, затем сверьте журнал, год, номер и страницы. Если статьи нет в базах, откройте архив номеров на сайте журнала. Книги и диссертации проверяют по каталогам НББ в Беларуси и РГБ в России.

Как быстро проверить весь список литературы? Вставьте список в Crossref Simple Text Query, который подбирает DOI к каждой ссылке, или добавьте все DOI в Zotero через «Add Item by Identifier». Затем сравните названия из списка с названиями, которые пришли по DOI. Ссылки без найденного DOI проверяйте вручную.

Новые версии ChatGPT всё ещё выдумывают источники? Реже, чем GPT-3.5, но выдумывают. GPT-4o в 2025 году выдумал около 20% ссылок в обзорах по психическому здоровью, а в исследовании 2026 года модели и агенты с поиском в интернете давали от 3 до 13% адресов, которых, судя по веб-архиву, никогда не было. Это другая мера, чем доля выдуманных ссылок, но вывод тот же: проверять нужно каждую ссылку.

Можно ли пользоваться ИИ для подбора литературы? Можно, если инструмент ищет записи в реальных базах и показывает, откуда взят каждый вывод. Даже тогда найденную статью открывают и проверяют, что в ней действительно есть нужный тезис.

Источники

Попробуйте Нейросинт на своём обзоре.

Начать бесплатно →

Читайте также

ИИ для науки17 мин чтения

Нейросеть для обзора литературы: что можно доверить ИИ

Что ИИ умеет на каждом этапе систематического обзора, насколько точен ИИ-скрининг, что требуют Cochrane и RAISE и что известно о позиции ВАК Беларуси и России.

Читать→
ИИ для науки16 мин чтения

Elicit и Consensus на русском: чем заменить в 2026 году

Сравнение Elicit, Consensus, SciSpace, Perplexity, Semantic Scholar, Undermind и Нейросинта для русскоязычного исследователя. Язык, русскоязычные источники, ГОСТ и ВАК, оплата и цены на сентябрь 2026 года.

Читать→
ИИ для науки17 мин чтения

Нейросеть в диссертации и статье: что разрешено и как раскрыть

Нейросеть в научной работе использовать можно, если результат проверен автором, а применение раскрыто. Разбираем правила Беларуси, России и журналов и даём готовый образец декларации об использовании ИИ.

Читать→