2) средними значениями по выборке
3) пристрастного подбора
4) на основе регрессионной модели
Наименее пригоден метод заполнения пропусков случайными значениями. При таком подходе отсутствующее наблюдение заменяется величиной, не связанной с профилем пациента, другими признаками или механизмом возникновения пропуска. Это вносит дополнительный случайный шум, может искажать распределение показателя, ослаблять корреляционные связи и приводить к неверным статистическим выводам. Даже случайная выборка из общей совокупности сохраняет лишь отдельные маргинальные характеристики, но не восстанавливает взаимосвязи между переменными.
Среднее значение является простым детерминированным способом, хотя оно уменьшает дисперсию и искусственно повышает сходство наблюдений. Подбор значения с учётом клинического контекста или сходства объектов может быть более информативным, но требует чётких правил и несёт риск систематической ошибки. Регрессионная модель использует доступные предикторы и поэтому лучше сохраняет зависимость между признаками; при корректном применении предпочтительно учитывать неопределённость прогноза, например с помощью множественной импутации.
| Подход | Принцип | Основное ограничение | Методологическая оценка |
|---|---|---|---|
| Случайные значения | Замена пропуска произвольной или случайно сгенерированной величиной | Не учитываются данные пациента и связи между признаками; возникает дополнительный шум | Наименее пригоден как самостоятельный метод |
| Среднее значение | Пропуск заменяется средним по выборке или подгруппе | Снижается дисперсия, ослабляются корреляции, возможна ошибка при неоднородной выборке | Допустим только для ориентировочных расчётов и простых описательных задач |
| Пристрастный подбор | Выбор значения по сходству объектов, экспертному правилу или клиническому контексту | Субъективность и риск систематического смещения при отсутствии формализованного алгоритма | Может быть информативнее случайной замены, но требует стандартизации |
| Регрессионная импутация | Прогнозирование пропущенного значения по наблюдаемым предикторам | Обычная одиночная импутация недооценивает неопределённость и может переоценивать точность | Предпочтительна при обоснованной модели и достаточном наборе предикторов |
| Множественная импутация | Формируется несколько наборов данных с разными правдоподобными значениями, затем результаты объединяются | Требует корректной спецификации модели и проверки её согласия с данными | Современный предпочтительный подход при механизмах MCAR или MAR |
| Механизм пропусков MNAR | Вероятность пропуска зависит от самого отсутствующего значения даже после учёта известных факторов | Обычная импутация может быть смещённой; необходим анализ чувствительности и предметные допущения | Требует специальных моделей и клинической интерпретации |
Выбор метода импутации должен начинаться с анализа доли и структуры пропусков, а также проверки, связаны ли они с наблюдаемыми характеристиками. В медицинских базах данных необходимо отдельно оценивать влияние заполнения на средние, дисперсии, частоты событий и диагностические модели. Результаты анализа следует сопровождать описанием алгоритма импутации и сравнением с альтернативными сценариями обработки пропусков.
