← Вернуться в неделю 6
Анализ данных в век ИИ · Урок 6

Умное саммари
на шести листах

Главная линия недели: от истории риска — к вероятности, от вероятности — к решению, от решения — к проверке ошибок. Framingham здесь не просто таблица, а целый аналитический сюжет.

ДАННЫЕВЕРОЯТНОСТЬПРОВЕРКАСТОП, ПРОВЕРЯЕМ!
🫀 Framingham
🔎 EDA
0/1 Классы
📈 Logistic
🧪 Проверка

Наблюдаем, не фантазируем

Один случай создаёт гипотезу. Большая когорта и годы наблюдений позволяют увидеть устойчивые связи.

Модель даёт риск

Logistic Regression сначала возвращает вероятность класса, а не медицинский приговор.

Ошибки имеют цену

AUC, Accuracy и Confusion Matrix отвечают на разные вопросы. Одной красивой цифры мало.

Фильтр урока: корреляция ≠ причинность · фактор риска ≠ доказанная причина · вероятность ≠ диагноз · AUC ≠ Accuracy.
🔗 Страница курса: https://dsall.netlify.app/ · данные, Orange, видео, квиз и задания
FraminghamEDALogistic RegressionNomogramAUCConfusion Matrix
Лист 1 · Карта шестого урока
От истории одного человека — к десятилетиям данных

Framingham:
город стал лабораторией

Исследование стартовало в 1948 году: исходная когорта — 5209 участников, примерно 30–62 лет, с повторными обследованиями примерно каждые два года.

194819712002Original → Offspring → Third Generation

Почему наблюдательное?

Нельзя случайно заставить людей десятилетиями курить «ради науки». Поэтому исследователи наблюдают реальные различия, измеряют признаки и ждут исходов.

Что измеряли?

Возраст, пол, курение, давление, холестерин, BMI, глюкозу, диабет, медицинскую историю и другие характеристики.

Один президент с давлением 300/190 — сильная история. Но статистика отвечает: «Нужна очередь из тысяч людей».
Главная ловушка: один яркий случай не доказывает причину. Нужны большие группы, длительное наблюдение и осторожный анализ.
Учебный targetTenYearCHD
Смыслсобытие в ближайшие 10 лет: 0/1

Наш датасет — окно, не всё исследование

Реальный FHS намного шире и длиннее. На уроке используется компактный учебный набор, удобный для EDA и Logistic Regression.

Data Table

Сначала смотрим строки, столбцы, типы и пропуски.

Distributions

Смотрим форму, хвосты, редкие значения и дисбаланс target.

Scatter Plot

Ищем связи глазами, но не объявляем причинность.

Запомнить: сначала понять данные, потом звать модель.

Лист 2 · Framingham и EDA
Несмотря на слово regression — задача классификации

Logistic Regression:
сначала вероятность

TenYearCHD записан числами 0 и 1, но это две категории. Поэтому задача — бинарная классификация. Модель получает признаки человека и возвращает вероятность класса.

agesysBPsmokerBMIp=.731
P(0)=0.27события нет
P(1)=0.73событие есть
73% ≠ диагноз. Это оценка риска по модели. Даже 82% не означает «болезнь обязательно случится».
Логистическая регрессия не говорит: «Я врач». Она говорит: «У меня есть число от 0 до 1, а теперь думайте аккуратно».

Коэффициенты

Плюс обычно толкает риск вверх, минус — вниз, при прочих равных.

Но читать нужно осторожно

Коэффициент показывает вклад признака внутри модели. Он не доказывает причинность и не делает самый большой коэффициент «главным фактором навсегда».

Шкалы важны

Размеры коэффициентов нельзя механически сравнивать, если признаки измеряются в разных единицах.

Признаки
Коэффициенты
Вероятность
Класс 0/1

Ключ: тип задачи определяется смыслом target, а не названием алгоритма.

Лист 3 · Логистическая регрессия на пальцах
Переводчик между моделью и человеком

Nomogram:
как модель сложила риск

Nomogram не улучшает Logistic Regression и не заменяет проверку качества. Он помогает объяснить вклад признаков и путь от значений человека к итоговой вероятности.

agesysBPsmokeBMIзначение → баллы → общий риск

1. Находим значение

Для каждого признака смотрим, где находится конкретный человек на своей шкале.

2. Получаем баллы

Каждый признак вносит вклад вверх или вниз.

3. Складываем

Сумма вкладов переводится в итоговую вероятность класса.

Что Nomogram умеет

Показывать направление и относительный вклад факторов для конкретного объекта, делать модель объяснимее для врача, студента или коллеги.

Чего он НЕ умеет

Не доказывает причинность, не заменяет AUC, Confusion Matrix или другие проверки, не делает коэффициенты медицинской истиной.

Ловушка: если age и sysBP дали большой вклад в прогноз конкретного пациента, это значит, что они сильно повлияли на это предсказание модели — а не что они «доказанно вызвали» событие.
Nomogram — это переводчик. Он переводит «β₁, β₂, β₃…» на человеческое: «вот кто сколько принёс баллов».

Формула листа: признаки → баллы → сумма → вероятность.

Лист 4 · Nomogram и интерпретация
Красивой одной метрики недостаточно

AUC + матрица беспорядков:
качество и цена ошибок

AUC отвечает на вопрос о ранжировании риска, Accuracy — о доле правильных классов при выбранном правиле решения, а Confusion Matrix показывает, где именно модель ошиблась.

AUCTNFPFNTP

AUC ≈ 0.5

Ранжирование близко к случайному. Это не обязательно означает accuracy = 50%.

AUC ближе к 1

Модель лучше ставит объекты с событием выше по риску, чем объекты без события.

AUC = 0.82

Не означает 82% правильных ответов. AUC и Accuracy отвечают на разные вопросы.

Ложная тревога · FP

Модель говорит «опасность», а события нет. Цена: обследования, стресс, расходы, лишние действия.

Пропущенная опасность · FN

Модель говорит «низкий риск», а событие реально произошло. В медицине такой пропуск может быть особенно дорогим.

Но нельзя объявить FN всегда хуже. Какая ошибка опаснее — решает конкретная медицинская, бизнес- или безопасностная задача.
Матрица беспорядков честна: она не говорит «модель ошиблась 17 раз». Она показывает, каким именно способом она устроила беспорядок.

Правило: сначала задача и цена ошибки, потом метрика и порог.

Лист 5 · AUC, Accuracy и Confusion Matrix
Секретная карта недели 6 · модель должна быть полезна человеку

Финальная проверка:
не влюбляйтесь в одну цифру

ПРИЗНАКИ
Смысл и качество данных
корреляции тоже проверяем
МОДЕЛЬ
Logistic / Tree / Forest / kNN
одна задача — разные способы
РЕШЕНИЕ
Метрики + ошибки + объяснимость
что нужно реальному пользователю?
Мультиколлинеарность: sysBP и diaBP на учебной матрице связаны примерно на 0.78. Это повод проверить смысл и интерпретацию, а не автоматически удалять один столбец.

1. AUC = 0.82. Значит accuracy = 82%?

Нет. AUC оценивает ранжирование, Accuracy — долю правильных итоговых классов при выбранном правиле решения.

2. Положительный коэффициент доказал причину?

Нет. Он показывает направление связи внутри модели при прочих равных, но не превращает наблюдательные данные в эксперимент.

3. Random Forest дал AUC на 0.01 выше. Берём его автоматически?

Не обязательно. Если врачу важна объяснимость, Logistic Regression может быть сильнее как решение задачи при почти том же качестве.

4. Возраст нельзя изменить. Значит он бесполезен?

Нет. Неизменяемые факторы помогают оценить базовый риск и выбрать стратегию наблюдения или профилактики.
1. ПричинностьСвязь не называем причиной.
2. ВероятностьРиск не называем диагнозом.
3. AUCНе называем процентом правильных.
4. ОшибкиСмотрим FP и FN отдельно.
5. ПризнакиКорреляцию не рубим топором.
6. МодельВыбираем под задачу и человека.
СНАЧАЛА ЗАДАЧА · ПОТОМ ДАННЫЕ · ПОТОМ МЕТРИКА · ПОТОМ МОДЕЛЬ · СТОП, ПРОВЕРЯЕМ!