Хорошая новость: чтобы отличить сильную работу от слабой, не нужно быть ученым. Достаточно знать, куда смотреть, и потратить пять минут вместо тридцати секунд на заголовок.
Раздел 1Дизайн исследования решает почти все
Тип исследования определяет, что вообще можно из него заключить. Никакой объем данных не спасет плохой дизайн.
| Дизайн | Что позволяет утверждать | Слабое место |
|---|---|---|
| Рандомизированное двойное слепое плацебо-контролируемое испытание | Причинную связь между вмешательством и исходом | Дорого, часто короткие сроки и отобранные участники |
| Когортное исследование | Связь между фактором и исходом во времени | Влияние неучтенных факторов |
| Случай-контроль | Связь при редких исходах | Ошибки припоминания у участников |
| Поперечный срез | Картину в один момент времени | Не позволяет судить, что было раньше |
| Серия случаев | Только описание, гипотеза | Нет группы сравнения вообще |
| Эксперимент на животных | Механизм и обоснование дальнейшей проверки | Переносимость на человека низкая |
Раздел 2Девять вопросов к любой публикации
- Кто участники и сколько их? Вид, возраст, состояние здоровья, численность групп.
- Была ли рандомизация? Если группы формировались не случайно, они могли изначально различаться.
- Было ли ослепление? И участников, и тех, кто оценивает результат. Второе забывают чаще.
- Что было в контрольной группе? Плацебо, отсутствие вмешательства или другое лечение - это три разных сравнения.
- Какой исход измеряли? Клинически значимый или суррогатный маркер.
- Как долго длилось наблюдение? Для когнитивных вмешательств две недели - это очень мало.
- Сколько участников выбыло? Потеря заметной части группы способна развернуть результат.
- Был ли протокол зарегистрирован заранее? Это защищает от подгонки гипотезы под полученные данные.
- Кто оплатил работу? Не приговор, но требует более внимательного чтения.
Раздел 3Что означает p-значение
Самое неправильно понимаемое число в науке. Значение p менее 0,05 не означает «вероятность того, что вещество работает, составляет 95 процентов». Оно означает следующее: если бы эффекта не существовало вовсе, вероятность получить такие или более выраженные различия по случайности была бы меньше пяти процентов.
Разница принципиальная. Порог 0,05 - это конвенция, а не закон природы. И при большом числе одновременно проверяемых гипотез что-то обязательно пересечет этот порог случайно.
Раздел 4Размер эффекта важнее значимости
При достаточно большой выборке статистически значимым становится любое, даже мизерное различие. Поэтому опытный читатель смотрит не на p, а на величину эффекта и на доверительный интервал.
- Величина эффекта отвечает на вопрос «насколько сильно». Условно: около 0,2 - слабый эффект, около 0,5 - средний, от 0,8 - сильный.
- Доверительный интервал показывает диапазон правдоподобных значений. Широкий интервал говорит о высокой неопределенности, даже если формально результат значим.
- Клиническая значимость отвечает на вопрос «заметит ли это человек в жизни». Она не выводится из статистики.
Раздел 5Типичные ловушки
Корреляция вместо причины
Наблюдение, что любители кофе реже страдают определенным заболеванием, не означает, что кофе защищает. Возможно, различаются доход, образ жизни или доступность медицины. Наблюдательные исследования дают гипотезы, а не выводы.
Публикационное смещение
Работы с положительным результатом публикуются чаще и быстрее. Поэтому метаанализ, собранный только из опубликованного, систематически завышает эффект. Хорошие обзоры это проверяют специальными методами.
Суррогатные исходы
Улучшение лабораторного показателя не равно улучшению состояния. История медицины знает случаи, когда препарат уверенно улучшал маркер и при этом ухудшал реальные исходы.
Подгонка после факта
Если основной исход не подтвердился, а в тексте акцент сделан на подгруппе - например, «эффект наблюдался у женщин старше пятидесяти» - это гипотеза для следующего исследования, а не результат текущего.
Раздел 6Практика: разбираем аннотацию
Возьмем условную формулировку, каких много: «Прием экстракта в течение 30 дней достоверно улучшил показатели памяти по сравнению с исходным уровнем у 24 добровольцев».
Что здесь видно.
- «По сравнению с исходным уровнем» - контрольной группы нет. Сравнивают участников с ними же до начала. Такой дизайн не отделяет эффект вмешательства от привыкания к тесту и от ожиданий.
- 24 добровольца - очень малая выборка. Доверительные интервалы будут широкими.
- 30 дней - короткий срок для оценки памяти, при этом эффект тренировки на повторных тестах уже успевает проявиться.
- «Достоверно» - о величине эффекта не сказано ничего. Может оказаться, что различие в пределах статистического шума на практике.
Вывод: работа не бесполезна, она обосновывает проведение нормального рандомизированного испытания. Но заголовок «доказано улучшение памяти» из нее не следует.
Источники
- Higgins J.P.T., Thomas J. et al. Cochrane Handbook for Systematic Reviews of Interventions.
- Schulz K.F., Altman D.G., Moher D. CONSORT 2010 Statement: updated guidelines for reporting parallel group randomised trials. BMJ, 2010.
- Ioannidis J.P.A. Why most published research findings are false. PLoS Medicine, 2005.
- Wasserstein R.L., Lazar N.A. The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 2016.
- Sterne J.A.C. et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ, 2019.
- Dwan K. et al. Systematic review of the empirical evidence of study publication bias. PLoS ONE, 2008.
- Cohen J. Statistical Power Analysis for the Behavioral Sciences, 1988.
- Guyatt G. et al. GRADE guidelines: rating the quality of evidence. Journal of Clinical Epidemiology, 2011.