Умное саммари
на шести листах
Главная линия недели: от истории риска — к вероятности, от вероятности — к решению, от решения — к проверке ошибок. Framingham здесь не просто таблица, а целый аналитический сюжет.
Наблюдаем, не фантазируем
Один случай создаёт гипотезу. Большая когорта и годы наблюдений позволяют увидеть устойчивые связи.
Модель даёт риск
Logistic Regression сначала возвращает вероятность класса, а не медицинский приговор.
Ошибки имеют цену
AUC, Accuracy и Confusion Matrix отвечают на разные вопросы. Одной красивой цифры мало.
Framingham:
город стал лабораторией
Исследование стартовало в 1948 году: исходная когорта — 5209 участников, примерно 30–62 лет, с повторными обследованиями примерно каждые два года.
Почему наблюдательное?
Нельзя случайно заставить людей десятилетиями курить «ради науки». Поэтому исследователи наблюдают реальные различия, измеряют признаки и ждут исходов.
Что измеряли?
Возраст, пол, курение, давление, холестерин, BMI, глюкозу, диабет, медицинскую историю и другие характеристики.
Наш датасет — окно, не всё исследование
Реальный FHS намного шире и длиннее. На уроке используется компактный учебный набор, удобный для EDA и Logistic Regression.
Data Table
Сначала смотрим строки, столбцы, типы и пропуски.
Distributions
Смотрим форму, хвосты, редкие значения и дисбаланс target.
Scatter Plot
Ищем связи глазами, но не объявляем причинность.
Запомнить: сначала понять данные, потом звать модель.
Logistic Regression:
сначала вероятность
TenYearCHD записан числами 0 и 1, но это две категории. Поэтому задача — бинарная классификация. Модель получает признаки человека и возвращает вероятность класса.
Коэффициенты
Плюс обычно толкает риск вверх, минус — вниз, при прочих равных.
Но читать нужно осторожно
Коэффициент показывает вклад признака внутри модели. Он не доказывает причинность и не делает самый большой коэффициент «главным фактором навсегда».
Шкалы важны
Размеры коэффициентов нельзя механически сравнивать, если признаки измеряются в разных единицах.
Ключ: тип задачи определяется смыслом target, а не названием алгоритма.
Nomogram:
как модель сложила риск
Nomogram не улучшает Logistic Regression и не заменяет проверку качества. Он помогает объяснить вклад признаков и путь от значений человека к итоговой вероятности.
1. Находим значение
Для каждого признака смотрим, где находится конкретный человек на своей шкале.
2. Получаем баллы
Каждый признак вносит вклад вверх или вниз.
3. Складываем
Сумма вкладов переводится в итоговую вероятность класса.
Что Nomogram умеет
Показывать направление и относительный вклад факторов для конкретного объекта, делать модель объяснимее для врача, студента или коллеги.
Чего он НЕ умеет
Не доказывает причинность, не заменяет AUC, Confusion Matrix или другие проверки, не делает коэффициенты медицинской истиной.
Формула листа: признаки → баллы → сумма → вероятность.
AUC + матрица беспорядков:
качество и цена ошибок
AUC отвечает на вопрос о ранжировании риска, Accuracy — о доле правильных классов при выбранном правиле решения, а Confusion Matrix показывает, где именно модель ошиблась.
AUC ≈ 0.5
Ранжирование близко к случайному. Это не обязательно означает accuracy = 50%.
AUC ближе к 1
Модель лучше ставит объекты с событием выше по риску, чем объекты без события.
AUC = 0.82
Не означает 82% правильных ответов. AUC и Accuracy отвечают на разные вопросы.
Ложная тревога · FP
Модель говорит «опасность», а события нет. Цена: обследования, стресс, расходы, лишние действия.
Пропущенная опасность · FN
Модель говорит «низкий риск», а событие реально произошло. В медицине такой пропуск может быть особенно дорогим.
Правило: сначала задача и цена ошибки, потом метрика и порог.
Финальная проверка:
не влюбляйтесь в одну цифру
Смысл и качество данных
корреляции тоже проверяем
Logistic / Tree / Forest / kNN
одна задача — разные способы
Метрики + ошибки + объяснимость
что нужно реальному пользователю?