Заголовок «исследование на 100 тысячах человек» звучит убедительно. Большое число участников действительно может уменьшить случайную погрешность и сделать оценку более точной. Но размер выборки отвечает лишь на один вопрос: насколько устойчиво измерен результат при прочих равных. Если сами данные собраны с систематической ошибкой, большая выборка способна лишь очень точно воспроизвести эту ошибку.
При разумном дизайне больше участников обычно повышают статистическую мощность: исследователю легче заметить небольшой реальный эффект и получить более узкий доверительный интервал. Это особенно важно для редких исходов и анализа подгрупп. Однако мощность не подтверждает причинность, не делает измерение правильным и не говорит, насколько эффект важен в жизни.
Рандомизированное испытание, когортное наблюдение, исследование «случай — контроль» и одномоментный опрос отвечают на разные вопросы. Если люди сами выбирают рацион, добавку или режим, группы могут изначально различаться по доходу, активности, доступу к медицине и десяткам других признаков. Статистическая поправка помогает, но не гарантирует устранение всех смешивающих факторов.
Для наблюдательных работ STROBE предлагает явно описывать дизайн, участников, переменные, источники смещения и статистические методы. Сам чек-лист не оценивает качество автоматически, но показывает, достаточно ли информации для критического чтения.
Даже миллион анкет не представляет всех людей, если отвечают преимущественно пользователи одного приложения, жители одного региона или люди с высокой мотивацией следить за здоровьем. Проверьте критерии включения, долю отказов, потери при наблюдении и сходство участников с той группой, к которой авторы относят вывод.
Опрос «что вы ели в прошлом году» зависит от памяти и представлений о порциях. Однократный анализ крови может не отражать обычное состояние. Умные часы и приложения тоже ошибаются. Важно, одинаково ли измеряли группы, были ли методы проверены и знали ли оценщики, к какой группе относится участник.
Фраза «больше овощей связано с меньшим риском» неполна без референтной группы, длительности наблюдения и перечня учтённых факторов. Иногда результат меняется после поправки на курение, возраст, общую калорийность или социальные условия. Полезно смотреть заранее заявленный протокол и отличать основной анализ от множества дополнительных сравнений.
В огромной выборке статистически значимым может стать очень маленькое различие. Поэтому одного p-значения недостаточно. Ищите абсолютный риск, размер эффекта и доверительный интервал. Снижение относительного риска на 20% выглядит крупно, но если исход меняется с 5 случаев на 10 000 до 4, абсолютная разница составляет один случай на 10 000.
Одна работа — часть общей картины. Важны повторяемость результата, исследования с другими методами, систематические обзоры и правдоподобный механизм. Несогласие не означает, что новая работа плохая, но требует осторожной интерпретации.
Большая выборка — сильная сторона, когда она встроена в прозрачный дизайн. Но впечатляющее число участников не заменяет правильный вопрос, сопоставимые группы, качественные измерения и честный анализ.
