2) факторный
3) дискриминантный
4) кластерный (+)
Кластерной классификацией называют отнесение объектов к группам на основании их сходства без заранее заданных эталонных классов и правильных ответов. Алгоритм самостоятельно выявляет структуру множества данных, используя выбранную меру близости или расстояния между объектами. В медицинской кибернетике объектами могут быть пациенты, результаты лабораторных исследований, показатели мониторинга или признаки медицинских изображений.
При кластеризации формируются однородные группы, внутри которых объекты максимально похожи, а между группами различаются. Применяются, например, метод k-средних, иерархические методы и DBSCAN; выбор алгоритма зависит от формы кластеров, типа данных и наличия выбросов. Полученные группы могут использоваться для выявления фенотипов заболеваний, стратификации риска и обнаружения ранее не описанных вариантов течения болезни, однако их клиническое значение требует последующей экспертной интерпретации и валидации.
Другие методы решают иные задачи: регрессионный анализ прогнозирует количественный показатель, дискриминантный анализ распределяет наблюдения по заранее известным классам, а факторный анализ выявляет скрытые факторы, объясняющие корреляции между признаками. Поэтому именно кластерный анализ соответствует принципу классификации без учителя.
| Метод или подход | Наличие заранее известных классов | Основная задача | Результат | Пример медицинского применения |
|---|---|---|---|---|
| Кластерный анализ | Не требуется | Поиск естественных групп по сходству признаков | Набор кластеров, состав которых определяется данными | Выделение фенотипов пациентов с хроническим заболеванием |
| Метод k-средних | Не требуется; число кластеров задаётся заранее | Минимизация внутрикластерного разброса | Распределение объектов по k группам вокруг центроидов | Группировка пациентов по профилю лабораторных показателей |
| Иерархическая кластеризация | Не требуется | Построение последовательной структуры объединения или разделения объектов | Дендрограмма и возможные уровни разбиения на группы | Оценка сходства генетических или клинических профилей |
| Кластеризация DBSCAN | Не требуется | Поиск плотных областей и выделение выбросов | Кластеры произвольной формы и объекты, не отнесённые к группам | Обнаружение нетипичных паттернов мониторинга пациента |
| Дискриминантный анализ | Требуются известные классы для обучения | Классификация новых объектов по обучающей выборке | Прогноз принадлежности к заранее определённой категории | Разделение доброкачественных и злокачественных образований |
| Множественная регрессия | Требуется известный количественный исход | Оценка зависимости результата от нескольких факторов | Расчёт прогнозируемого числового значения и коэффициентов влияния | Прогноз уровня глюкозы или длительности госпитализации |
| Факторный анализ | Метки классов обычно не требуются | Выявление латентных факторов, объясняющих взаимосвязи признаков | Скрытые факторы и факторные нагрузки, а не группы пациентов | Выделение компонентов качества жизни или структуры симптомов |
Кластеризация является методом обучения без учителя, поскольку целевая переменная и заранее размеченные классы отсутствуют. Число и состав кластеров зависят от признакового пространства, стандартизации данных и выбранной метрики расстояния. Для медицинского применения необходимо оценивать устойчивость кластеров, клиническую воспроизводимость и их связь с исходами заболевания. Выявленная группировка не заменяет диагноз, а служит инструментом анализа структуры медицинских данных.
