Форма извлечения данных для систематического обзора: шаблон
Формой извлечения данных (data collection form) называют единый шаблон, по которому из полного текста каждого включённого исследования переносят одни и те же сведения: дизайн, участников, вмешательства, исходы и числовые результаты. По стандартам Cochrane MECIR извлекают только по форме, прошедшей пилотную проверку (C43), а данные об исходах извлекают как минимум два человека независимо друг от друга (C46). Из заполненных форм собирают таблицу характеристик включённых исследований и данные для синтеза.
Ниже приведены готовый шаблон полей, порядок пилотирования, правила двойного извлечения с примером сверки, способы восстановить недостающие числа, пример заполненной таблицы и образец текста для раздела «Методы». Опора на первоисточники: Cochrane Handbook (главы 5 и 6), стандарты MECIR и PRISMA 2020.
Что такое извлечение данных
Извлечением данных (data extraction, в Cochrane Handbook чаще data collection) называют перенос сведений об исследовании из его отчётов в структурированную форму. Данными Handbook считает любую информацию об исследовании: методы, участников, условия, вмешательства, исходы, результаты, сведения о публикациях и авторах (Cochrane Handbook, глава 5, раздел 5.3.1).
Этап следует за отбором полных текстов и предшествует оценке риска смещения и синтезу. Место этапа в общем маршруте обзора показано в статье «Систематический обзор литературы: как написать по шагам».
Собранные данные решают четыре задачи (Handbook, 5.3.1):
- описать включённые исследования (в Cochrane-обзоре это обязательная таблица «Characteristics of included studies», стандарт C44);
- построить таблицы и рисунки обзора;
- дать материал для оценки риска смещения;
- обеспечить синтез и, если он запланирован, мета-анализ.
Форма служит ещё и журналом происхождения данных: по ней видно, откуда взято каждое значение и какие решения принимались по ходу работы (Handbook, 5.4.1).
Шаблон формы извлечения данных
Шаблон ниже составлен по контрольному списку Cochrane Handbook (таблица 5.3.a) и рассчитан на обзор вмешательств. Для обзоров в педагогике, психологии или экономике блоки те же, меняются только поля внутри них: вместо дозы препарата записывают, например, продолжительность и формат учебной программы.
| Блок | Поле | Как заполнять |
|---|---|---|
| Служебное | ID исследования, ID публикации, кто извлекал, дата, версия формы | Одно исследование может иметь несколько публикаций, поэтому нужны оба ID |
| Соответствие критериям | Подтверждено ли включение; причина исключения | Выбор из списка причин, заданного в протоколе |
| Методы | Дизайн (параллельное рандомизированное контролируемое исследование (РКИ), перекрёстное, с рандомизацией групп, когортное и т. д.), число центров, сроки набора, длительность наблюдения | Закрытый список вариантов плюс «другое (укажите)» |
| Методы | Рандомизация, сокрытие распределения, ослепление; для нерандомизированных исследований меры против вмешивающихся факторов | Дословная цитата из статьи и страница |
| Методы | Как обрабатывали пропущенные данные; единица анализа; статистические методы и ковариаты | Цитата и страница |
| Методы | Источник финансирования, конфликт интересов авторов | Цитата или «не сообщается» |
| Участники | Страна и условия (стационар, школа, вуз), критерии включения, диагностические критерии | Коротко, по возможности из закрытого списка |
| Участники | Исходные характеристики: возраст, пол, тяжесть состояния | Число и вид статистики (среднее и стандартное отклонение (standard deviation, SD), медиана и размах) |
| Вмешательство и контроль | Компоненты, дозировка, частота, длительность, кто проводил, сопутствующие вмешательства; что получала контрольная группа | Детально, чтобы вмешательство можно было воспроизвести |
| Исходы | Для каждого исхода из протокола: название, инструмент или шкала (границы, какое направление лучше), метрика, способ агрегирования, срок измерения | Пять элементов исхода, см. ниже |
| Результаты | Для каждой группы, исхода и срока: сколько рандомизировано, сколько проанализировано, сколько выбыло и почему | Числа и страница или таблица статьи |
| Результаты | Сводные данные по группам: 2×2 для бинарных исходов; среднее, SD и n для непрерывных | Ровно в том виде, как в статье; пересчёт отдельно |
| Результаты | Оценка эффекта между группами (отношение рисков (ОР), отношение шансов (ОШ), разность средних) и её точность (доверительный интервал (ДИ), стандартная ошибка (standard error, SE), p) | В том виде, как в статье |
| Прочее | Выводы авторов; нужна ли переписка с авторами; примечания | Свободный текст |
Исход Handbook предлагает описывать пятью элементами (раздел 5.3.5):
- домен исхода (например, тревожность);
- инструмент измерения; для шкалы ещё её название, границы и то, какое значение считается лучшим;
- метрика (значение после вмешательства или изменение от исходного уровня);
- способ агрегирования (среднее и SD по группе или доля участников с событием);
- срок измерения (например, конец восьминедельного курса).
Полную схему описания вмешательства Handbook находит в чек-листе TIDieR (Template for Intervention Description and Replication): что делали, кто, где, как часто и насколько точно выполнили план (раздел 5.3.4).
Как составить и опробовать форму
Handbook описывает четыре шага (раздел 5.4.3).
- Набросайте таблицы и рисунки будущего обзора. Сравнения и исходы, которые войдут в отчёт, подсказывают, какие поля нужны. Лишние поля делают форму длиннее самой статьи, а из-за пропущенных придётся возвращаться к PDF.
- Сгруппируйте поля в том порядке, в каком сведения обычно идут в статье: библиография, критерии, вмешательство, статистика, исходные характеристики, результаты.
- Сформулируйте вопросы так, чтобы ответ не оставался пустым. Где возможно, давайте закрытый список вариантов с пунктом «другое (укажите)». Добавьте варианты «не сообщается», «неприменимо» и «неясно»: пометка «неясно» подсказывает, где писать авторам. Спрашивайте о том, что сообщено в статье: вопрос «Сообщают ли авторы об ослеплении участников?» точнее, чем «Были ли участники ослеплены?». Где нужно суждение, записывайте дословную цитату и её место в статье.
- Опробуйте форму. Несколько человек заполняют её по нескольким статьям, затем значения сверяют с первоисточником. Handbook не называет точного числа статей для пилота; полезнее взять статьи, разные по дизайну и формату отчёта. На пилотных статьях стоит заодно набросать строки таблицы характеристик и оценку риска смещения: так видно, всех ли полей хватает. После серьёзной переделки пилот повторяют.
Числовые данные извлекают в том формате, в каком их дали авторы, а пересчёт делают отдельным шагом. Пересчитанные значения хранят отдельно от извлечённых, с записью формулы; удобнее считать в электронной таблице, где сохраняются и исходные числа, и сам расчёт (раздел 5.7).
Если форму меняют в ходе извлечения, номер версии и дату обновляют, а к уже обработанным статьям при необходимости возвращаются. Критерии, которые проверяются в блоке «Соответствие критериям», задают заранее; как их сформулировать, разобрано в отдельной статье о критериях включения и исключения.
Откуда брать данные: полный текст, приложения и все публикации исследования
Аннотации недостаточно. В ней обычно нет деталей рандомизации и ослепления, числа выбывших, определений исходов и данных по группам. Кроме того, цифры в аннотации не всегда совпадают с основным текстом: в выборках статей из шести крупных медицинских журналов 1996-1997 годов доля аннотаций с данными, которые расходились с текстом или отсутствовали в нём, составила от 18% до 68% в зависимости от журнала (Pitkin и соавт., JAMA, 1999). Извлекают из полного текста, таблиц, рисунков и дополнительных материалов. Какой раздел считать главным при противоречии внутри одной статьи (например, таблицу результатов), Handbook советует заранее указать в протоколе (раздел 5.4.3).
Единицей обзора служит исследование, даже если о нём несколько статей. Одно исследование нередко публикуют в нескольких статьях, тезисах и в регистре испытаний. Стандарт MECIR C42 (обязательный) требует связать все публикации одного исследования, чтобы не посчитать одних и тех же участников дважды. Связывают по номеру регистрации, авторам, спонсору, месту проведения, деталям вмешательства, численности и срокам. Данные можно извлекать из каждой публикации отдельно и затем сводить или сразу вносить всё в одну форму. При неустранимом противоречии между публикациями заранее выбирают основной источник и обосновывают выбор (Handbook, 5.2.1 и 5.5.4).
Проверяйте исправления и отзывы статей. По стандарту C48 (обязательный) нужно просмотреть опубликованные исправления (errata) и уведомления об отзыве: они могут выявить серьёзные ошибки или стать причиной исключения исследования (MECIR C43-C51).
Регистры испытаний (например, ClinicalTrials.gov) помогают сравнить опубликованные исходы с запланированными и иногда содержат результаты, которых нет в статье (Handbook, 5.2).
Двойное независимое извлечение: что обязательно по Cochrane
В стандартах MECIR требования к двойному извлечению разной силы (MECIR C43-C51):
| Стандарт | Что требует | Статус |
|---|---|---|
| C43 | Извлекать по форме, которая прошла пилот | Обязательно |
| C45 | Характеристики исследований извлекают минимум двое независимо, порядок разрешения разногласий задан заранее | Крайне желательно |
| C46 | Данные об исходах извлекают минимум двое независимо, порядок разрешения разногласий задан заранее | Обязательно |
| C49 | Запрашивать у авторов ключевые сведения, которых нет в публикации | Крайне желательно |
| C51 | Сверять величину и направление эффектов в обзоре с тем, что сообщают исследования | Обязательно |
Handbook объясняет строгость так: ошибки этапа извлечения редко замечают рецензенты, редакторы и читатели обзора (раздел 5.5.2). Там же советуют подбирать извлекающих из разных областей, например методолога и специалиста по теме.
Насколько часто ошибаются, показывают методологические исследования:
- при повторном извлечении данных во всех 34 обзорах одной Cochrane-группы ошибки нашлись в 20 обзорах; все ошибки обработки данных меняли сводные результаты, хотя выводы обзоров не изменились (Jones и соавт., 2005);
- в 27 мета-анализах со стандартизированной разностью средних авторы проверки не смогли воспроизвести результат хотя бы одного из двух выбранных испытаний с точностью до 0,1 в 10 случаях (37%); полная перепроверка этих десяти подтвердила ошибки в семи, в двух статистически значимая разница исчезла или появилась (Gøtzsche и соавт., 2007). Типичные ошибки: неверное число пациентов, средние, SD и знак эффекта;
- в пилотном рандомизированном сравнении извлечение одним человеком с последующей проверкой вторым дало на 21,7% больше ошибок, чем двойное независимое извлечение, но заняло на 36,1% меньше времени (Buscemi и соавт., 2006).
Как проходит сверка
После независимого извлечения две формы сравнивают поле за полем. Большинство расхождений объясняется ошибкой одного из извлекающих и снимается обсуждением с возвратом к PDF. Если договориться не удалось, решает третий участник; спор, который не разрешился и после письма авторам, описывают в обзоре. Handbook советует сохранять и исходные версии обеих форм, и согласованную (раздел 5.5.5). Так выглядит журнал сверки (исследования вымышленные):
| Исследование, поле | Извлекающий 1 | Извлекающий 2 | Решение и основание |
|---|---|---|---|
| Сидоров 2022, SD изменения по шкале боли, основная группа | 1,4 | 0,26 | 1,4: в табл. 2 подписано «SD»; 0,26 оказалось SE (1,4 / √30 ≈ 0,26) |
| Иванов 2021, число проанализированных в основной группе | 74 | 70 | 74: протокол обзора отдаёт приоритет анализу по назначенному лечению (ITT), 70 относится к анализу по протоколу |
| Petrova 2020, финансирование | «не сообщается» | фармкомпания | Фармкомпания: указано в разделе Funding на с. 9 |
Если одно и то же поле раз за разом вызывает расхождения, стоит уточнить инструкцию к нему. Согласие до обсуждения можно выразить каппой Коэна, но в Cochrane-обзорах её обычно не считают; Handbook советует, если уж считать, ограничиться самыми важными данными, например ключевыми оценками риска смещения и тем, сообщены ли в статье ключевые исходы (5.5.5).
Если нужного значения нет в статье
Пустая ячейка не должна появляться молча: в форме отмечают «не сообщается», «неясно» или «неприменимо». Дальше действуют по порядку.
- Проверьте все источники исследования: дополнительные материалы, другие публикации того же исследования, запись в регистре.
- Напишите авторам. Handbook советует для описательных сведений задавать открытые вопросы, а для чисел прислать короткую форму с нужными полями. Если контактный автор не отвечает, пишут соавторам; переписку сохраняют (раздел 5.2.3).
- Рассчитайте из других статистик. Стандарт C47 (обязательный) требует извлекать самые подробные числа, из которых можно получить нужные: SE, доверительный интервал, t, F или точное p. Например, SD группы равно SE, умноженной на корень из численности группы. Из 95% ДИ среднего при численности больше 100 в группе SD получают так: ширину интервала делят на 3,92 и умножают на √n. Если в группе 120 участников, а 95% ДИ от -3,0 до -2,0, то SD = √120 × 1,0 / 3,92 ≈ 2,79. При численности меньше 60 вместо 3,92 берут значение из t-распределения: для 25 участников это 2 × 2,064 ≈ 4,13. Формулы относятся к ДИ среднего внутри одной группы; для разности между группами расчёт другой, он описан в разделе 6.5.2.3 (Handbook, глава 6, раздел 6.5.2.2).
- Снимите данные с графика. Если числа есть только на рисунке, их оцифровывают специальной программой: Handbook называет WebPlotDigitizer, Engauge, Plot Digitizer и другие и отмечает, что программа точнее линейки и оценки на глаз (раздел 5.5.8). У WebPlotDigitizer открытый исходный код. В форме помечают, что значение снято с графика.
Размах для оценки SD Handbook использовать не советует: метод неустойчив (глава 6, раздел 6.5.2.6). Как объединять полученные числа и выбирать меру эффекта, разобрано в статье о мета-анализе и его отличиях от систематического обзора.
Частые ошибки при ручном извлечении
- Перепутаны SD и SE. Handbook называет это особенно обманчивой ошибкой (глава 6, 6.5.2): SE меньше SD в √n раз, и перепутанное значение резко завышает точность исследования и его вес в синтезе.
- Значение из соседней строки или столбца. Цифра одной группы попадает в колонку другой: эффект искажается, а если группы перепутаны целиком, меняет знак.
- Не та версия анализа. В статье бывают анализ по назначенному лечению и по протоколу, скорректированная и нескорректированная модели, разные сроки. Правило выбора (иерархию предпочтительных результатов) задают в протоколе до начала извлечения (раздел 5.3.6).
- Лишние группы многорукавного исследования. По стандарту C50 в обзор берут только группы, подходящие под критерии, а остальные упоминают в таблице характеристик.
- Округление при переносе. Значения копируют с тем числом знаков, которое дали авторы.
- Нет ссылки на место в статье. Через месяц уже невозможно сказать, откуда взялось число: из таблицы 2, текста или приложения. Записывайте страницу, таблицу или рисунок рядом с каждым значением.
- Нежелательные явления: «не упомянуты» прочитано как «не было». Handbook предупреждает, что отсутствие упоминания в отчёте ещё не означает, что явлений не было (5.3.5.1).
Итоговую проверку задаёт стандарт C51: направление и величина эффекта в обзоре должны совпадать с тем, что сообщает само исследование, с поправкой на обоснованные различия в методах расчёта.
Пример таблицы характеристик и результатов
Исследования и числа ниже вымышленные, поля сокращены. Результаты пересчитаны: для Иванова разность средних -1,8 балла, 95% ДИ от -2,19 до -1,41; для Сидорова -0,9, 95% ДИ от -1,57 до -0,23; значения p в таблице с этим согласуются.
| Исследование | Дизайн | Выборка (n) | Группы | Исход и срок | Результат (основная vs контроль) | Где в статье |
|---|---|---|---|---|---|---|
| Иванов и др., 2021, Россия | РКИ, двойное слепое | 148 (74/74) | Препарат A vs плацебо | Изменение боли по визуальной аналоговой шкале (ВАШ), баллы, 12 нед | -3,2 (SD 1,1) vs -1,4 (SD 1,3); p<0,001 | С. 6, табл. 2 |
| Petrova et al., 2020, Казахстан | Проспективное когортное | 96 (52/44) | Препарат A vs стандартная терапия | Доля ответивших на лечение, 24 нед | 67% (35/52) vs 48% (21/44); ОР 1,41 (95% ДИ 0,98-2,03) | С. 5, табл. 3 |
| Сидоров и др., 2022, Беларусь | РКИ, открытое | 60 (30/30) | Препарат A vs плацебо | Изменение боли по ВАШ, баллы, 8 нед | -2,8 (SD 1,4) vs -1,9 (SD 1,2); p=0,01 | С. 4, табл. 2 |
На что обратить внимание в примере:
- у Petrova доверительный интервал ОР включает 1, значит на уровне 0,05 разница статистически незначима, хотя доли в группах заметно различаются;
- исследования различаются дизайном и сроком наблюдения; решать, можно ли их объединять, будут на этапе синтеза, а таблица должна показать эти различия явно;
- колонка «Где в статье» позволяет соавтору проверить любое число за минуту.
Чем заполнять форму: таблица, электронная форма или специальная система
Handbook сопоставляет три варианта инструментов (раздел 5.4.2, таблица 5.4.a):
| Инструмент | Примеры | Для какого обзора, по Handbook | Плюсы | Минусы |
|---|---|---|---|---|
| Бумажная или текстовая форма | Документ Word | Малый, до 10 исследований, 2-3 извлекающих рядом | Не нужны навыки и сеть | Данные придётся перенабирать, выше риск ошибок |
| Электронная форма | Google Forms, Microsoft Access | 10-20 исследований, 4-6 извлекающих | Данные сразу в электронном виде, сверку можно автоматизировать | Нужно уметь строить формы |
| Система для обзоров | Covidence, EPPI-Reviewer, SRDR, DistillerSR | Любой размер, в том числе более 20 исследований; команда любого размера, особенно больше 6 извлекающих | Привязка значения к месту в статье, автоматическая сверка двух извлечений, экспорт в программы анализа | Настройка, обучение, у части систем платный доступ |
Нейросети и автоматизация. В главе 5 Handbook (последнее обновление в октябре 2019 года) авторы писали, что не могут рекомендовать конкретный инструмент для автоматического извлечения и что такие инструменты сначала стоит использовать как проверку ручного извлечения (раздел 5.5.9). В совместном заявлении 2025 года Cochrane, Campbell Collaboration, JBI и Collaboration for Environmental Evidence допускают ИИ при условии человеческого контроля: авторы должны показать, что инструмент не снижает методологическую строгость, и полностью описать его использование в отчёте (заявление об ИИ в синтезе доказательств, 2025). Универсальный чат-бот может выдать правдоподобное число, которого в статье нет, так же как он выдумывает ссылки на источники. Поэтому каждое значение, извлечённое машиной, должно сопровождаться цитатой из статьи и проверяться человеком. Где ИИ помогает на этапах скрининга и извлечения, разобрано в статье «Нейросеть для обзора литературы».
Что написать в разделе «Методы»
PRISMA 2020 требует описать процесс сбора данных (пункт 9: сколько человек извлекали из каждой публикации, независимо ли, как получали или подтверждали данные у авторов, какие инструменты автоматизации применяли), перечислить и определить исходы, для которых искали данные (пункт 10a), и остальные переменные с допущениями о пропущенных или неясных сведениях (пункт 10b) (PRISMA 2020, пояснения). В пояснениях к пункту 9 просят также назвать программу, которой снимали данные с графиков, и правила выбора данных из нескольких публикаций одного исследования. Handbook добавляет к этому пилот формы и инструкции для извлекающих (5.5.11). Все пункты чек-листа разобраны в статье «PRISMA 2020: чек-лист и блок-схема на русском».
Образец формулировки (имена, даты и числа замените своими):
Данные извлекали по форме, разработанной для этого обзора и опробованной на пяти исследованиях разного дизайна (версия 2 от 12.03.2026). Характеристики исследований извлекал один автор (А. А.), второй (Б. Б.) проверял их по полному тексту; данные об исходах оба автора извлекали независимо. Расхождения разрешали обсуждением с возвратом к первоисточнику, при сохранении разногласий решение принимал третий автор (В. В.). Недостающие данные запрашивали у авторов исследований по электронной почте, с одним повторным письмом через две недели. Стандартные отклонения, не приведённые в статьях, рассчитывали из стандартных ошибок или 95% доверительных интервалов по формулам Cochrane Handbook (раздел 6.5.2.2); значения, доступные только на графиках, оцифровывали в WebPlotDigitizer. Публикации одного исследования объединяли под общим идентификатором, результаты брали из основной публикации. Инструменты автоматизации для извлечения данных не применяли.
Частые вопросы
Можно ли извлекать данные одному, если обзор пишется для диссертации? Стандарты Cochrane рассчитаны на команду: данные об исходах извлекают двое независимо (MECIR C46). Если второго человека нет, попросите научного руководителя или коллегу независимо извлечь хотя бы данные об исходах, а характеристики проверить по полному тексту. Если и это невозможно, прямо укажите в ограничениях, что извлекал один человек, и сохраните для каждого значения ссылку на страницу и таблицу статьи.
Чем таблица доказательств отличается от таблицы характеристик исследований? «Таблица характеристик включённых исследований» (Characteristics of included studies) является формальным разделом Cochrane-обзора, обязательным по стандарту C44. Таблицей доказательств (evidence table) обычно называют сводку тех же исследований вместе с результатами. Обе строятся из заполненных форм извлечения.
Можно ли брать числа из аннотации? Нет. В аннотации нет большинства нужных полей, а её цифры иногда расходятся с основным текстом. Аннотация подходит для скрининга; данные извлекают из полного текста, таблиц и приложений.
Что делать, если в статье нет стандартного отклонения? Проверьте приложения и другие публикации исследования, затем напишите авторам. Если ответа нет, рассчитайте SD из SE, доверительного интервала, t-статистики или точного p по формулам Cochrane Handbook (глава 6) и отметьте в форме, что значение рассчитано.
Нужна ли форма, если включённых исследований меньше десяти? Да. По стандарту MECIR C43 извлечение ведут по опробованной форме при любом числе исследований; при небольшом обзоре Handbook допускает простую текстовую или бумажную форму.
Можно ли поручить извлечение данных нейросети? Как вспомогательный инструмент можно, если каждое значение проверяет человек по цитате из статьи. Совместное заявление Cochrane, Campbell, JBI и CEE 2025 года требует человеческого контроля и полного описания использования ИИ в отчёте, а PRISMA 2020 (пункт 9) просит назвать применённые инструменты автоматизации.
Источники
- Cochrane Handbook for Systematic Reviews of Interventions, version 6.5. Chapter 5: Collecting data
- Cochrane Handbook, version 6.5. Chapter 6: Choosing effect measures and computing estimates of effect
- MECIR Manual: Collecting data from included studies (C43-C51)
- Page M. J. et al. PRISMA 2020 explanation and elaboration. BMJ, 2021; 372: n160
- Buscemi N. et al. Single data extraction generated more errors than double data extraction in systematic reviews. J Clin Epidemiol, 2006
- Jones A. P. et al. High prevalence but low impact of data extraction and reporting errors were found in Cochrane systematic reviews. J Clin Epidemiol, 2005
- Gøtzsche P. C. et al. Data extraction errors in meta-analyses that use standardized mean differences. JAMA, 2007
- Pitkin R. M. et al. Accuracy of data in abstracts of published research articles. JAMA, 1999
- Position statement on AI use in evidence synthesis across Cochrane, the Campbell Collaboration, JBI and the Collaboration for Environmental Evidence, 2025
Попробуйте Нейросинт на своём обзоре.
Начать бесплатно →Читайте также
Систематический обзор литературы: как написать по шагам
Маршрут систематического обзора от вопроса до отчёта: протокол и реестры PROSPERO, OSF, INPLASY, поиск, скрининг вдвоём, риск смещения и GRADE по Cochrane.
Читать→PRISMA 2020: чек-лист и блок-схема на русском
Полный перевод чек-листа PRISMA 2020 и чек-листа для аннотации, разбор каждого блока схемы отбора с примером расчёта. Отдельно: отличия от PRISMA 2009 и расширения PRISMA-P, PRISMA-S, PRISMA-ScR.
Читать→Критерии включения и исключения в обзоре: примеры и шаблон
Критерии включения и исключения по Cochrane Handbook и PRISMA 2020: какую схему выбрать, почему исходы редко служат критерием и как записать причины исключения. С примерами и шаблоном для протокола.
Читать→