Нейроны
Методология

Как читать исследования и не обмануться

Девять вопросов к любой публикации, разбор терминов из аннотации и объяснение, почему фраза «статистически значимо» сама по себе не значит почти ничего.

примерно 12 минут чтения · 8 источников

Хорошая новость: чтобы отличить сильную работу от слабой, не нужно быть ученым. Достаточно знать, куда смотреть, и потратить пять минут вместо тридцати секунд на заголовок.

Раздел 1Дизайн исследования решает почти все

Тип исследования определяет, что вообще можно из него заключить. Никакой объем данных не спасет плохой дизайн.

ДизайнЧто позволяет утверждатьСлабое место
Рандомизированное двойное слепое плацебо-контролируемое испытаниеПричинную связь между вмешательством и исходомДорого, часто короткие сроки и отобранные участники
Когортное исследованиеСвязь между фактором и исходом во времениВлияние неучтенных факторов
Случай-контрольСвязь при редких исходахОшибки припоминания у участников
Поперечный срезКартину в один момент времениНе позволяет судить, что было раньше
Серия случаевТолько описание, гипотезаНет группы сравнения вообще
Эксперимент на животныхМеханизм и обоснование дальнейшей проверкиПереносимость на человека низкая
Правило большого пальцаЕсли в работе нет контрольной группы, любой наблюдаемый эффект может объясняться естественным течением, ожиданиями участника или регрессией к среднему. Это не придирка, это основа.

Раздел 2Девять вопросов к любой публикации

  1. Кто участники и сколько их? Вид, возраст, состояние здоровья, численность групп.
  2. Была ли рандомизация? Если группы формировались не случайно, они могли изначально различаться.
  3. Было ли ослепление? И участников, и тех, кто оценивает результат. Второе забывают чаще.
  4. Что было в контрольной группе? Плацебо, отсутствие вмешательства или другое лечение - это три разных сравнения.
  5. Какой исход измеряли? Клинически значимый или суррогатный маркер.
  6. Как долго длилось наблюдение? Для когнитивных вмешательств две недели - это очень мало.
  7. Сколько участников выбыло? Потеря заметной части группы способна развернуть результат.
  8. Был ли протокол зарегистрирован заранее? Это защищает от подгонки гипотезы под полученные данные.
  9. Кто оплатил работу? Не приговор, но требует более внимательного чтения.

Раздел 3Что означает p-значение

Самое неправильно понимаемое число в науке. Значение p менее 0,05 не означает «вероятность того, что вещество работает, составляет 95 процентов». Оно означает следующее: если бы эффекта не существовало вовсе, вероятность получить такие или более выраженные различия по случайности была бы меньше пяти процентов.

Разница принципиальная. Порог 0,05 - это конвенция, а не закон природы. И при большом числе одновременно проверяемых гипотез что-то обязательно пересечет этот порог случайно.

Множественные сравненияЕсли в исследовании измерили двадцать показателей и один из них оказался значимым, это ровно то, чего следует ожидать при полном отсутствии эффекта. Смотрите, был ли основной исход заявлен заранее.

Раздел 4Размер эффекта важнее значимости

При достаточно большой выборке статистически значимым становится любое, даже мизерное различие. Поэтому опытный читатель смотрит не на p, а на величину эффекта и на доверительный интервал.

  • Величина эффекта отвечает на вопрос «насколько сильно». Условно: около 0,2 - слабый эффект, около 0,5 - средний, от 0,8 - сильный.
  • Доверительный интервал показывает диапазон правдоподобных значений. Широкий интервал говорит о высокой неопределенности, даже если формально результат значим.
  • Клиническая значимость отвечает на вопрос «заметит ли это человек в жизни». Она не выводится из статистики.

Раздел 5Типичные ловушки

Корреляция вместо причины

Наблюдение, что любители кофе реже страдают определенным заболеванием, не означает, что кофе защищает. Возможно, различаются доход, образ жизни или доступность медицины. Наблюдательные исследования дают гипотезы, а не выводы.

Публикационное смещение

Работы с положительным результатом публикуются чаще и быстрее. Поэтому метаанализ, собранный только из опубликованного, систематически завышает эффект. Хорошие обзоры это проверяют специальными методами.

Суррогатные исходы

Улучшение лабораторного показателя не равно улучшению состояния. История медицины знает случаи, когда препарат уверенно улучшал маркер и при этом ухудшал реальные исходы.

Подгонка после факта

Если основной исход не подтвердился, а в тексте акцент сделан на подгруппе - например, «эффект наблюдался у женщин старше пятидесяти» - это гипотеза для следующего исследования, а не результат текущего.

Раздел 6Практика: разбираем аннотацию

Возьмем условную формулировку, каких много: «Прием экстракта в течение 30 дней достоверно улучшил показатели памяти по сравнению с исходным уровнем у 24 добровольцев».

Что здесь видно.

  • «По сравнению с исходным уровнем» - контрольной группы нет. Сравнивают участников с ними же до начала. Такой дизайн не отделяет эффект вмешательства от привыкания к тесту и от ожиданий.
  • 24 добровольца - очень малая выборка. Доверительные интервалы будут широкими.
  • 30 дней - короткий срок для оценки памяти, при этом эффект тренировки на повторных тестах уже успевает проявиться.
  • «Достоверно» - о величине эффекта не сказано ничего. Может оказаться, что различие в пределах статистического шума на практике.

Вывод: работа не бесполезна, она обосновывает проведение нормального рандомизированного испытания. Но заголовок «доказано улучшение памяти» из нее не следует.

Источники

  1. Higgins J.P.T., Thomas J. et al. Cochrane Handbook for Systematic Reviews of Interventions.
  2. Schulz K.F., Altman D.G., Moher D. CONSORT 2010 Statement: updated guidelines for reporting parallel group randomised trials. BMJ, 2010.
  3. Ioannidis J.P.A. Why most published research findings are false. PLoS Medicine, 2005.
  4. Wasserstein R.L., Lazar N.A. The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 2016.
  5. Sterne J.A.C. et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ, 2019.
  6. Dwan K. et al. Systematic review of the empirical evidence of study publication bias. PLoS ONE, 2008.
  7. Cohen J. Statistical Power Analysis for the Behavioral Sciences, 1988.
  8. Guyatt G. et al. GRADE guidelines: rating the quality of evidence. Journal of Clinical Epidemiology, 2011.