← Блог

Форма извлечения данных для систематического обзора: шаблон

Методология19 мин чтения

Формой извлечения данных (data collection form) называют единый шаблон, по которому из полного текста каждого включённого исследования переносят одни и те же сведения: дизайн, участников, вмешательства, исходы и числовые результаты. По стандартам Cochrane MECIR извлекают только по форме, прошедшей пилотную проверку (C43), а данные об исходах извлекают как минимум два человека независимо друг от друга (C46). Из заполненных форм собирают таблицу характеристик включённых исследований и данные для синтеза.

Ниже приведены готовый шаблон полей, порядок пилотирования, правила двойного извлечения с примером сверки, способы восстановить недостающие числа, пример заполненной таблицы и образец текста для раздела «Методы». Опора на первоисточники: Cochrane Handbook (главы 5 и 6), стандарты MECIR и PRISMA 2020.

Что такое извлечение данных

Извлечением данных (data extraction, в Cochrane Handbook чаще data collection) называют перенос сведений об исследовании из его отчётов в структурированную форму. Данными Handbook считает любую информацию об исследовании: методы, участников, условия, вмешательства, исходы, результаты, сведения о публикациях и авторах (Cochrane Handbook, глава 5, раздел 5.3.1).

Этап следует за отбором полных текстов и предшествует оценке риска смещения и синтезу. Место этапа в общем маршруте обзора показано в статье «Систематический обзор литературы: как написать по шагам».

Собранные данные решают четыре задачи (Handbook, 5.3.1):

  • описать включённые исследования (в Cochrane-обзоре это обязательная таблица «Characteristics of included studies», стандарт C44);
  • построить таблицы и рисунки обзора;
  • дать материал для оценки риска смещения;
  • обеспечить синтез и, если он запланирован, мета-анализ.

Форма служит ещё и журналом происхождения данных: по ней видно, откуда взято каждое значение и какие решения принимались по ходу работы (Handbook, 5.4.1).

Шаблон формы извлечения данных

Шаблон ниже составлен по контрольному списку Cochrane Handbook (таблица 5.3.a) и рассчитан на обзор вмешательств. Для обзоров в педагогике, психологии или экономике блоки те же, меняются только поля внутри них: вместо дозы препарата записывают, например, продолжительность и формат учебной программы.

БлокПолеКак заполнять
СлужебноеID исследования, ID публикации, кто извлекал, дата, версия формыОдно исследование может иметь несколько публикаций, поэтому нужны оба ID
Соответствие критериямПодтверждено ли включение; причина исключенияВыбор из списка причин, заданного в протоколе
МетодыДизайн (параллельное рандомизированное контролируемое исследование (РКИ), перекрёстное, с рандомизацией групп, когортное и т. д.), число центров, сроки набора, длительность наблюденияЗакрытый список вариантов плюс «другое (укажите)»
МетодыРандомизация, сокрытие распределения, ослепление; для нерандомизированных исследований меры против вмешивающихся факторовДословная цитата из статьи и страница
МетодыКак обрабатывали пропущенные данные; единица анализа; статистические методы и ковариатыЦитата и страница
МетодыИсточник финансирования, конфликт интересов авторовЦитата или «не сообщается»
УчастникиСтрана и условия (стационар, школа, вуз), критерии включения, диагностические критерииКоротко, по возможности из закрытого списка
УчастникиИсходные характеристики: возраст, пол, тяжесть состоянияЧисло и вид статистики (среднее и стандартное отклонение (standard deviation, SD), медиана и размах)
Вмешательство и контрольКомпоненты, дозировка, частота, длительность, кто проводил, сопутствующие вмешательства; что получала контрольная группаДетально, чтобы вмешательство можно было воспроизвести
ИсходыДля каждого исхода из протокола: название, инструмент или шкала (границы, какое направление лучше), метрика, способ агрегирования, срок измеренияПять элементов исхода, см. ниже
РезультатыДля каждой группы, исхода и срока: сколько рандомизировано, сколько проанализировано, сколько выбыло и почемуЧисла и страница или таблица статьи
РезультатыСводные данные по группам: 2×2 для бинарных исходов; среднее, SD и n для непрерывныхРовно в том виде, как в статье; пересчёт отдельно
РезультатыОценка эффекта между группами (отношение рисков (ОР), отношение шансов (ОШ), разность средних) и её точность (доверительный интервал (ДИ), стандартная ошибка (standard error, SE), p)В том виде, как в статье
ПрочееВыводы авторов; нужна ли переписка с авторами; примечанияСвободный текст

Исход Handbook предлагает описывать пятью элементами (раздел 5.3.5):

  1. домен исхода (например, тревожность);
  2. инструмент измерения; для шкалы ещё её название, границы и то, какое значение считается лучшим;
  3. метрика (значение после вмешательства или изменение от исходного уровня);
  4. способ агрегирования (среднее и SD по группе или доля участников с событием);
  5. срок измерения (например, конец восьминедельного курса).

Полную схему описания вмешательства Handbook находит в чек-листе TIDieR (Template for Intervention Description and Replication): что делали, кто, где, как часто и насколько точно выполнили план (раздел 5.3.4).

Как составить и опробовать форму

Handbook описывает четыре шага (раздел 5.4.3).

  1. Набросайте таблицы и рисунки будущего обзора. Сравнения и исходы, которые войдут в отчёт, подсказывают, какие поля нужны. Лишние поля делают форму длиннее самой статьи, а из-за пропущенных придётся возвращаться к PDF.
  2. Сгруппируйте поля в том порядке, в каком сведения обычно идут в статье: библиография, критерии, вмешательство, статистика, исходные характеристики, результаты.
  3. Сформулируйте вопросы так, чтобы ответ не оставался пустым. Где возможно, давайте закрытый список вариантов с пунктом «другое (укажите)». Добавьте варианты «не сообщается», «неприменимо» и «неясно»: пометка «неясно» подсказывает, где писать авторам. Спрашивайте о том, что сообщено в статье: вопрос «Сообщают ли авторы об ослеплении участников?» точнее, чем «Были ли участники ослеплены?». Где нужно суждение, записывайте дословную цитату и её место в статье.
  4. Опробуйте форму. Несколько человек заполняют её по нескольким статьям, затем значения сверяют с первоисточником. Handbook не называет точного числа статей для пилота; полезнее взять статьи, разные по дизайну и формату отчёта. На пилотных статьях стоит заодно набросать строки таблицы характеристик и оценку риска смещения: так видно, всех ли полей хватает. После серьёзной переделки пилот повторяют.

Числовые данные извлекают в том формате, в каком их дали авторы, а пересчёт делают отдельным шагом. Пересчитанные значения хранят отдельно от извлечённых, с записью формулы; удобнее считать в электронной таблице, где сохраняются и исходные числа, и сам расчёт (раздел 5.7).

Если форму меняют в ходе извлечения, номер версии и дату обновляют, а к уже обработанным статьям при необходимости возвращаются. Критерии, которые проверяются в блоке «Соответствие критериям», задают заранее; как их сформулировать, разобрано в отдельной статье о критериях включения и исключения.

Откуда брать данные: полный текст, приложения и все публикации исследования

Аннотации недостаточно. В ней обычно нет деталей рандомизации и ослепления, числа выбывших, определений исходов и данных по группам. Кроме того, цифры в аннотации не всегда совпадают с основным текстом: в выборках статей из шести крупных медицинских журналов 1996-1997 годов доля аннотаций с данными, которые расходились с текстом или отсутствовали в нём, составила от 18% до 68% в зависимости от журнала (Pitkin и соавт., JAMA, 1999). Извлекают из полного текста, таблиц, рисунков и дополнительных материалов. Какой раздел считать главным при противоречии внутри одной статьи (например, таблицу результатов), Handbook советует заранее указать в протоколе (раздел 5.4.3).

Единицей обзора служит исследование, даже если о нём несколько статей. Одно исследование нередко публикуют в нескольких статьях, тезисах и в регистре испытаний. Стандарт MECIR C42 (обязательный) требует связать все публикации одного исследования, чтобы не посчитать одних и тех же участников дважды. Связывают по номеру регистрации, авторам, спонсору, месту проведения, деталям вмешательства, численности и срокам. Данные можно извлекать из каждой публикации отдельно и затем сводить или сразу вносить всё в одну форму. При неустранимом противоречии между публикациями заранее выбирают основной источник и обосновывают выбор (Handbook, 5.2.1 и 5.5.4).

Проверяйте исправления и отзывы статей. По стандарту C48 (обязательный) нужно просмотреть опубликованные исправления (errata) и уведомления об отзыве: они могут выявить серьёзные ошибки или стать причиной исключения исследования (MECIR C43-C51).

Регистры испытаний (например, ClinicalTrials.gov) помогают сравнить опубликованные исходы с запланированными и иногда содержат результаты, которых нет в статье (Handbook, 5.2).

Двойное независимое извлечение: что обязательно по Cochrane

В стандартах MECIR требования к двойному извлечению разной силы (MECIR C43-C51):

СтандартЧто требуетСтатус
C43Извлекать по форме, которая прошла пилотОбязательно
C45Характеристики исследований извлекают минимум двое независимо, порядок разрешения разногласий задан заранееКрайне желательно
C46Данные об исходах извлекают минимум двое независимо, порядок разрешения разногласий задан заранееОбязательно
C49Запрашивать у авторов ключевые сведения, которых нет в публикацииКрайне желательно
C51Сверять величину и направление эффектов в обзоре с тем, что сообщают исследованияОбязательно

Handbook объясняет строгость так: ошибки этапа извлечения редко замечают рецензенты, редакторы и читатели обзора (раздел 5.5.2). Там же советуют подбирать извлекающих из разных областей, например методолога и специалиста по теме.

Насколько часто ошибаются, показывают методологические исследования:

  • при повторном извлечении данных во всех 34 обзорах одной Cochrane-группы ошибки нашлись в 20 обзорах; все ошибки обработки данных меняли сводные результаты, хотя выводы обзоров не изменились (Jones и соавт., 2005);
  • в 27 мета-анализах со стандартизированной разностью средних авторы проверки не смогли воспроизвести результат хотя бы одного из двух выбранных испытаний с точностью до 0,1 в 10 случаях (37%); полная перепроверка этих десяти подтвердила ошибки в семи, в двух статистически значимая разница исчезла или появилась (Gøtzsche и соавт., 2007). Типичные ошибки: неверное число пациентов, средние, SD и знак эффекта;
  • в пилотном рандомизированном сравнении извлечение одним человеком с последующей проверкой вторым дало на 21,7% больше ошибок, чем двойное независимое извлечение, но заняло на 36,1% меньше времени (Buscemi и соавт., 2006).

Как проходит сверка

После независимого извлечения две формы сравнивают поле за полем. Большинство расхождений объясняется ошибкой одного из извлекающих и снимается обсуждением с возвратом к PDF. Если договориться не удалось, решает третий участник; спор, который не разрешился и после письма авторам, описывают в обзоре. Handbook советует сохранять и исходные версии обеих форм, и согласованную (раздел 5.5.5). Так выглядит журнал сверки (исследования вымышленные):

Исследование, полеИзвлекающий 1Извлекающий 2Решение и основание
Сидоров 2022, SD изменения по шкале боли, основная группа1,40,261,4: в табл. 2 подписано «SD»; 0,26 оказалось SE (1,4 / √30 ≈ 0,26)
Иванов 2021, число проанализированных в основной группе747074: протокол обзора отдаёт приоритет анализу по назначенному лечению (ITT), 70 относится к анализу по протоколу
Petrova 2020, финансирование«не сообщается»фармкомпанияФармкомпания: указано в разделе Funding на с. 9

Если одно и то же поле раз за разом вызывает расхождения, стоит уточнить инструкцию к нему. Согласие до обсуждения можно выразить каппой Коэна, но в Cochrane-обзорах её обычно не считают; Handbook советует, если уж считать, ограничиться самыми важными данными, например ключевыми оценками риска смещения и тем, сообщены ли в статье ключевые исходы (5.5.5).

Если нужного значения нет в статье

Пустая ячейка не должна появляться молча: в форме отмечают «не сообщается», «неясно» или «неприменимо». Дальше действуют по порядку.

  1. Проверьте все источники исследования: дополнительные материалы, другие публикации того же исследования, запись в регистре.
  2. Напишите авторам. Handbook советует для описательных сведений задавать открытые вопросы, а для чисел прислать короткую форму с нужными полями. Если контактный автор не отвечает, пишут соавторам; переписку сохраняют (раздел 5.2.3).
  3. Рассчитайте из других статистик. Стандарт C47 (обязательный) требует извлекать самые подробные числа, из которых можно получить нужные: SE, доверительный интервал, t, F или точное p. Например, SD группы равно SE, умноженной на корень из численности группы. Из 95% ДИ среднего при численности больше 100 в группе SD получают так: ширину интервала делят на 3,92 и умножают на √n. Если в группе 120 участников, а 95% ДИ от -3,0 до -2,0, то SD = √120 × 1,0 / 3,92 ≈ 2,79. При численности меньше 60 вместо 3,92 берут значение из t-распределения: для 25 участников это 2 × 2,064 ≈ 4,13. Формулы относятся к ДИ среднего внутри одной группы; для разности между группами расчёт другой, он описан в разделе 6.5.2.3 (Handbook, глава 6, раздел 6.5.2.2).
  4. Снимите данные с графика. Если числа есть только на рисунке, их оцифровывают специальной программой: Handbook называет WebPlotDigitizer, Engauge, Plot Digitizer и другие и отмечает, что программа точнее линейки и оценки на глаз (раздел 5.5.8). У WebPlotDigitizer открытый исходный код. В форме помечают, что значение снято с графика.

Размах для оценки SD Handbook использовать не советует: метод неустойчив (глава 6, раздел 6.5.2.6). Как объединять полученные числа и выбирать меру эффекта, разобрано в статье о мета-анализе и его отличиях от систематического обзора.

Частые ошибки при ручном извлечении

  • Перепутаны SD и SE. Handbook называет это особенно обманчивой ошибкой (глава 6, 6.5.2): SE меньше SD в √n раз, и перепутанное значение резко завышает точность исследования и его вес в синтезе.
  • Значение из соседней строки или столбца. Цифра одной группы попадает в колонку другой: эффект искажается, а если группы перепутаны целиком, меняет знак.
  • Не та версия анализа. В статье бывают анализ по назначенному лечению и по протоколу, скорректированная и нескорректированная модели, разные сроки. Правило выбора (иерархию предпочтительных результатов) задают в протоколе до начала извлечения (раздел 5.3.6).
  • Лишние группы многорукавного исследования. По стандарту C50 в обзор берут только группы, подходящие под критерии, а остальные упоминают в таблице характеристик.
  • Округление при переносе. Значения копируют с тем числом знаков, которое дали авторы.
  • Нет ссылки на место в статье. Через месяц уже невозможно сказать, откуда взялось число: из таблицы 2, текста или приложения. Записывайте страницу, таблицу или рисунок рядом с каждым значением.
  • Нежелательные явления: «не упомянуты» прочитано как «не было». Handbook предупреждает, что отсутствие упоминания в отчёте ещё не означает, что явлений не было (5.3.5.1).

Итоговую проверку задаёт стандарт C51: направление и величина эффекта в обзоре должны совпадать с тем, что сообщает само исследование, с поправкой на обоснованные различия в методах расчёта.

Пример таблицы характеристик и результатов

Исследования и числа ниже вымышленные, поля сокращены. Результаты пересчитаны: для Иванова разность средних -1,8 балла, 95% ДИ от -2,19 до -1,41; для Сидорова -0,9, 95% ДИ от -1,57 до -0,23; значения p в таблице с этим согласуются.

ИсследованиеДизайнВыборка (n)ГруппыИсход и срокРезультат (основная vs контроль)Где в статье
Иванов и др., 2021, РоссияРКИ, двойное слепое148 (74/74)Препарат A vs плацебоИзменение боли по визуальной аналоговой шкале (ВАШ), баллы, 12 нед-3,2 (SD 1,1) vs -1,4 (SD 1,3); p<0,001С. 6, табл. 2
Petrova et al., 2020, КазахстанПроспективное когортное96 (52/44)Препарат A vs стандартная терапияДоля ответивших на лечение, 24 нед67% (35/52) vs 48% (21/44); ОР 1,41 (95% ДИ 0,98-2,03)С. 5, табл. 3
Сидоров и др., 2022, БеларусьРКИ, открытое60 (30/30)Препарат A vs плацебоИзменение боли по ВАШ, баллы, 8 нед-2,8 (SD 1,4) vs -1,9 (SD 1,2); p=0,01С. 4, табл. 2

На что обратить внимание в примере:

  • у Petrova доверительный интервал ОР включает 1, значит на уровне 0,05 разница статистически незначима, хотя доли в группах заметно различаются;
  • исследования различаются дизайном и сроком наблюдения; решать, можно ли их объединять, будут на этапе синтеза, а таблица должна показать эти различия явно;
  • колонка «Где в статье» позволяет соавтору проверить любое число за минуту.

Чем заполнять форму: таблица, электронная форма или специальная система

Handbook сопоставляет три варианта инструментов (раздел 5.4.2, таблица 5.4.a):

ИнструментПримерыДля какого обзора, по HandbookПлюсыМинусы
Бумажная или текстовая формаДокумент WordМалый, до 10 исследований, 2-3 извлекающих рядомНе нужны навыки и сетьДанные придётся перенабирать, выше риск ошибок
Электронная формаGoogle Forms, Microsoft Access10-20 исследований, 4-6 извлекающихДанные сразу в электронном виде, сверку можно автоматизироватьНужно уметь строить формы
Система для обзоровCovidence, EPPI-Reviewer, SRDR, DistillerSRЛюбой размер, в том числе более 20 исследований; команда любого размера, особенно больше 6 извлекающихПривязка значения к месту в статье, автоматическая сверка двух извлечений, экспорт в программы анализаНастройка, обучение, у части систем платный доступ

Нейросети и автоматизация. В главе 5 Handbook (последнее обновление в октябре 2019 года) авторы писали, что не могут рекомендовать конкретный инструмент для автоматического извлечения и что такие инструменты сначала стоит использовать как проверку ручного извлечения (раздел 5.5.9). В совместном заявлении 2025 года Cochrane, Campbell Collaboration, JBI и Collaboration for Environmental Evidence допускают ИИ при условии человеческого контроля: авторы должны показать, что инструмент не снижает методологическую строгость, и полностью описать его использование в отчёте (заявление об ИИ в синтезе доказательств, 2025). Универсальный чат-бот может выдать правдоподобное число, которого в статье нет, так же как он выдумывает ссылки на источники. Поэтому каждое значение, извлечённое машиной, должно сопровождаться цитатой из статьи и проверяться человеком. Где ИИ помогает на этапах скрининга и извлечения, разобрано в статье «Нейросеть для обзора литературы».

Что написать в разделе «Методы»

PRISMA 2020 требует описать процесс сбора данных (пункт 9: сколько человек извлекали из каждой публикации, независимо ли, как получали или подтверждали данные у авторов, какие инструменты автоматизации применяли), перечислить и определить исходы, для которых искали данные (пункт 10a), и остальные переменные с допущениями о пропущенных или неясных сведениях (пункт 10b) (PRISMA 2020, пояснения). В пояснениях к пункту 9 просят также назвать программу, которой снимали данные с графиков, и правила выбора данных из нескольких публикаций одного исследования. Handbook добавляет к этому пилот формы и инструкции для извлекающих (5.5.11). Все пункты чек-листа разобраны в статье «PRISMA 2020: чек-лист и блок-схема на русском».

Образец формулировки (имена, даты и числа замените своими):

Данные извлекали по форме, разработанной для этого обзора и опробованной на пяти исследованиях разного дизайна (версия 2 от 12.03.2026). Характеристики исследований извлекал один автор (А. А.), второй (Б. Б.) проверял их по полному тексту; данные об исходах оба автора извлекали независимо. Расхождения разрешали обсуждением с возвратом к первоисточнику, при сохранении разногласий решение принимал третий автор (В. В.). Недостающие данные запрашивали у авторов исследований по электронной почте, с одним повторным письмом через две недели. Стандартные отклонения, не приведённые в статьях, рассчитывали из стандартных ошибок или 95% доверительных интервалов по формулам Cochrane Handbook (раздел 6.5.2.2); значения, доступные только на графиках, оцифровывали в WebPlotDigitizer. Публикации одного исследования объединяли под общим идентификатором, результаты брали из основной публикации. Инструменты автоматизации для извлечения данных не применяли.

Частые вопросы

Можно ли извлекать данные одному, если обзор пишется для диссертации? Стандарты Cochrane рассчитаны на команду: данные об исходах извлекают двое независимо (MECIR C46). Если второго человека нет, попросите научного руководителя или коллегу независимо извлечь хотя бы данные об исходах, а характеристики проверить по полному тексту. Если и это невозможно, прямо укажите в ограничениях, что извлекал один человек, и сохраните для каждого значения ссылку на страницу и таблицу статьи.

Чем таблица доказательств отличается от таблицы характеристик исследований? «Таблица характеристик включённых исследований» (Characteristics of included studies) является формальным разделом Cochrane-обзора, обязательным по стандарту C44. Таблицей доказательств (evidence table) обычно называют сводку тех же исследований вместе с результатами. Обе строятся из заполненных форм извлечения.

Можно ли брать числа из аннотации? Нет. В аннотации нет большинства нужных полей, а её цифры иногда расходятся с основным текстом. Аннотация подходит для скрининга; данные извлекают из полного текста, таблиц и приложений.

Что делать, если в статье нет стандартного отклонения? Проверьте приложения и другие публикации исследования, затем напишите авторам. Если ответа нет, рассчитайте SD из SE, доверительного интервала, t-статистики или точного p по формулам Cochrane Handbook (глава 6) и отметьте в форме, что значение рассчитано.

Нужна ли форма, если включённых исследований меньше десяти? Да. По стандарту MECIR C43 извлечение ведут по опробованной форме при любом числе исследований; при небольшом обзоре Handbook допускает простую текстовую или бумажную форму.

Можно ли поручить извлечение данных нейросети? Как вспомогательный инструмент можно, если каждое значение проверяет человек по цитате из статьи. Совместное заявление Cochrane, Campbell, JBI и CEE 2025 года требует человеческого контроля и полного описания использования ИИ в отчёте, а PRISMA 2020 (пункт 9) просит назвать применённые инструменты автоматизации.

Источники

Попробуйте Нейросинт на своём обзоре.

Начать бесплатно →

Читайте также