Заголовок «кофе снижает риск болезни» может описывать очень разные данные. В одном исследовании людей спросили, сколько кофе они пьют, и наблюдали за их здоровьем. В другом участников случайно распределили по группам и заранее задали вмешательство. Оба подхода могут быть полезны, но отвечают на вопрос с разной степенью уверенности.
Главная ошибка при чтении новостей — автоматически превращать статистическую связь в причинное утверждение. Чтобы этого избежать, сначала определите дизайн исследования, затем посмотрите, как сформированы сравниваемые группы, что именно измеряли и насколько результат применим к реальной жизни.
В наблюдательном исследовании авторы не назначают участникам воздействие случайным образом. Они фиксируют уже существующие различия: рацион, привычки, лекарства, диагнозы или условия жизни — и сравнивают исходы.
К распространённым вариантам относятся когортные исследования, исследования «случай — контроль» и поперечные срезы. Когорта помогает увидеть последовательность событий во времени. Дизайн «случай — контроль» удобен для редких исходов. Поперечный срез описывает показатели в один момент, но часто не позволяет понять, что появилось раньше.
Наблюдательные данные незаменимы, когда эксперимент невозможен или неэтичен. Нельзя случайно назначить людям курить десятилетиями, жить в загрязнённом районе или иметь определённый социальный статус. Большие регистры также помогают изучать редкие нежелательные явления и долгосрочные исходы.
Основная проблема — смешение. Третий фактор может быть связан и с воздействием, и с исходом. Например, люди, которые чаще занимаются спортом, могут одновременно лучше питаться, меньше курить и чаще проходить обследования. Если часть этих различий не учтена, наблюдаемая связь со спортом будет включать влияние других факторов.
Статистическая поправка, сопоставление и propensity score помогают сбалансировать измеренные характеристики, но не гарантируют контроль того, что исследователи не измерили или измерили плохо. Руководство AHRQ подчёркивает, что остаточное смешение редко удаётся полностью исключить в наблюдательных данных.
Возможна и обратная причинность. Человек может изменить питание не потому, что оно вызвало болезнь, а потому, что ранние симптомы уже повлияли на выбор еды. Поэтому важно смотреть на временную последовательность и исключение ранних случаев.
В рандомизированном испытании случайный механизм определяет, какое вмешательство получит участник. При корректном выполнении это в среднем распределяет между группами известные и неизвестные исходные прогностические факторы. Cochrane Handbook объясняет, что успешная рандомизация разрывает систематическую связь между прогнозом и назначением вмешательства.
Однако слово «рандомизированное» само по себе не гарантирует качество. Последовательность распределения должна быть действительно случайной, а её сокрытие — не позволять заранее угадать следующую группу. Важно, сколько участников выбыло, знали ли люди и исследователи о назначении, были ли исходы заявлены заранее и не менялся ли анализ после просмотра данных.
После рандомизации также возможны систематические ошибки из-за выбывания, отклонений от вмешательства и выборочного сообщения результатов. Поэтому оценивают не ярлык исследования, а конкретный результат и его риск систематической ошибки.
Сначала определите исход: относительный риск, абсолютное число событий, изменение массы, балл симптомов или биомаркер. Относительное снижение на 50% звучит сильно, но если риск уменьшился с 2 случаев на 10 000 до 1 случая, абсолютная разница невелика.
Доверительный интервал показывает диапазон значений, совместимых с данными при выбранной модели. Широкий интервал означает низкую точность. Значение p не сообщает размер эффекта, клиническую важность или отсутствие систематической ошибки.
Проверьте, был ли исход первичным и заранее зарегистрированным. Чем больше авторы перебрали групп, временных точек и показателей, тем выше вероятность случайной «значимости», особенно без поправки на множественные сравнения.
Наблюдательное исследование не обязательно слабое, а РКИ не обязательно хорошее. Уверенность повышают воспроизводимость в разных выборках, временная последовательность, дозозависимая связь, правдоподобный механизм, отрицательные контрольные анализы и чувствительность результата к возможному неизмеренному смешению.
Особенно ценна триангуляция: разные методы с разными источниками ошибки приходят к совместимому выводу. РКИ, когорта, естественный эксперимент и механистическая работа не заменяют друг друга, а складываются в общую картину.
Наблюдательные исследования хорошо показывают, что происходит в больших и реальных популяциях, помогают находить сигналы и изучать вопросы, для которых эксперимент невозможен. Рандомизированные испытания лучше защищают оценку вмешательства от исходного смешения, но могут быть короткими, небольшими или плохо применимыми к конкретному человеку.
Вместо вопроса «какой дизайн выше в иерархии» полезнее спросить: соответствует ли метод поставленному вопросу, какие ошибки он снижает и какие оставляет. Тогда научный заголовок превращается из обещания в проверяемое утверждение с понятными границами.
