← Вернуться в неделю 5
Анализ данных в век ИИ · Урок 5

Умное саммари
на шести листах

Главная идея урока: построить модель мало. Нужно понять признаки, правильно определить задачу и устроить модели честную проверку на новых данных.

РАСПУТАЙ. ОПРЕДЕЛИ. ПРОВЕРЬ!
❓ Вопрос
🧩 Признаки
🎯 Тип задачи
🤖 Модель
🧪 Проверка

Мультиколлинеарность

Признаки могут повторять информацию друг друга. Тогда коэффициенты модели начинают вести себя странно.

Тип задачи

Число, категория или группы без готового ответа? Сначала вопрос — потом алгоритм.

Train / test

Модель учится на одной части данных и сдаёт экзамен на другой, которую раньше не видела.

Фильтр урока: хороший результат на знакомых данных ещё не доказывает, что модель поняла закономерность и будет полезна в реальности.
🔗 Страница курса: https://dsall.netlify.app/ · слайды, Orange, практика и задания
мультиколлинеарностьклиматрегрессияклассификациякластеризацияtrain/test
Лист 1 · Карта пятого урока
Когда признаки слишком хорошо знакомы

Мультиколлинеарность:
модель слышит эхо

В практике эти термины используют близко: мультиколлинеарность — это сильная линейная зависимость между двумя или несколькими признаками, когда один из них можно хорошо объяснить по остальным.

ПЛОЩАДЬКОМНАТЫНАЛОГЦЕНА
Площадь квартиры
Количество комнат
Налог по метражу
Цена квартиры
Цель 1Хорошо предсказывать
Цель 2Правильно объяснять коэффициенты
Эти цели могут разойтись. Прогноз остаётся неплохим, но коэффициенты становятся нестабильными: знак и величина могут резко меняться.
Модель спрашивает: «Кто поднял цену?» Площадь, комнаты и налог хором: «Я!»
КорреляцииИщем большие по модулю связи между признаками.
VIFПроверяем, насколько признак объясняется остальными.
СтабильностьСмотрим, меняются ли коэффициенты при небольшом изменении данных.
СмыслПонимаем, какие признаки дублируют один механизм.
Удалитьявный дубль
Объединитьсвязанные признаки
Преобразоватьпространство признаков
Не паниковатьсначала определить цель
Важно: высокая корреляция — подсказка, а не автоматический приговор. Не удаляем признаки механически: сначала понимаем задачу и происхождение данных.

Запомнить: мультиколлинеарность прежде всего мешает устойчивому объяснению влияния отдельных признаков.

Лист 2 · Признаки, которые повторяют друг друга
Климатическая задача · данные связаны не случайно

Глобальное потепление:
две цели одной модели

В климатической таблице CO₂, CH₄, N₂O, Солнце, аэрозоли и климатические колебания описывают сложную систему. Некоторые признаки связаны между собой — и это часть реальности.

CO₂CH₄N₂OСолнцеАэрозолиEl NiñoTEMP
CO₂
углекислый газ
CH₄
метан
N₂O
закись азота

Солнце
🌫
Аэрозоли
🌊
Эль-Ниньо

Что хотим от модели?

ПрогнозПредсказывать температуру по набору признаков.
ОбъяснениеПонимать вклад каждого фактора.
одна модель · разные вопросы к ней

Не удалять автоматически

Связанные признаки могут описывать разные физические механизмы.

Не путать прогноз и причину

Хорошая точность не доказывает, что каждый коэффициент интерпретируется буквально.

Смотреть на контекст

Данные, период наблюдений и смысл переменных важнее механического правила.

Стоп, проверяем: признаки дублируют одну и ту же информацию или отражают разные части климатической системы? Ответ нельзя получить только из корреляционной матрицы.

Формула листа: статистика показывает связь; предметный смысл помогает понять, что эта связь означает.

Лист 3 · Глобальное потепление и смысл признаков
Сначала определяем задачу · потом выбираем модель

Три главных ворота
машинного обучения

Один и тот же набор данных может породить разные задачи. Тип задачи определяется вопросом и тем, какой ответ должен появиться на выходе.

ЧИСЛОКЛАССГРУППЫ
📈

Регрессия

Зависимая переменная численная.

Какой будет температура?

На выходе — число: цена, рост, время, температура.

🏷️

Классификация

Зависимая переменная категориальная.

Будет ли год аномально жарким?

На выходе — класс: да/нет, спам/не спам, болезнь/нет.

🪐

Без учителя

Нет зависимой переменной.

Какие годы похожи друг на друга?

Ищем структуру и группы; кластеризация — один из методов.

Главная ловушка: нельзя выбирать модель только потому, что она знакома или красиво называется. Сначала спросите: «Что должно быть на выходе?»

Данные не диктуют вопрос

Одна таблица подходит для описания, прогноза, классификации или поиска групп.

Обучение с учителем

Есть известная целевая переменная: число или категория.

Другие типы существуют

Например, обучение с подкреплением — это уже отдельная история курса.

Правило: тип задачи определяет не программа и не таблица, а аналитический вопрос.

Лист 4 · Регрессия, классификация и обучение без учителя
Построить модель недостаточно

Оценка качества:
обязательный этап

Нормальный аналитический процесс не заканчивается кнопкой «обучить». После моделирования нужно проверить, насколько результату можно доверять и полезен ли он для исходной задачи.

МОДЕЛЬОЦЕНКА
CRISP-DM напоминает: оценка — отдельный этап
1. Задачачто нужно решить?
2. Данныечто у нас есть?
3. Подготовкачто исправить?
4. Модельстроим правило
5. Оценкаможно ли доверять?
6. Внедрениечто изменится?

Что нельзя делать

Обучить модель → увидеть красивый результат → сразу объявить победу.

Почему? Модель могла запомнить шум, воспользоваться утечкой или хорошо работать только на знакомых примерах.

Что делает аналитик

Сравнивает модели, проверяет качество на новых данных, смотрит на тип ошибок и возвращается к задаче.

Вопрос: достаточно ли качество для решения, ради которого всё началось?

«Все модели неверны… но некоторые полезны» — модель всегда упрощает реальность.

Шум существует

Идеальных данных и идеальных моделей не бывает.

Цена ошибок разная

Ошибка в рекомендации фильма и ошибка в медицине требуют разной строгости.

Польза важнее красоты

Главное — устойчивость и качество на новых наблюдениях.

Переход: чтобы оценка была честной, нужно отделить обучение от экзамена.

Лист 5 · Почему модели нужен контроль качества
Секретная карта недели 5 · честный экзамен модели

Train и test:
не показывайте ответы заранее

TRAIN
Примеры для обучения
задачи, разобранные на занятии
АЛГОРИТМ → МОДЕЛЬ
Ищет закономерности
подбирает параметры
TEST
Новые вопросы
закрытый экзаменационный конверт
Главное правило: test не участвует в обучении. Он открывается после построения модели и показывает, как она ведёт себя на новых данных.

1. Можно обучить и проверить на одних данных?

Для честной оценки — нет. Модель уже видела эти примеры, поэтому результат будет слишком оптимистичным.

2. Что делает train?

Показывает примеры, помогает подобрать коэффициенты и построить правило предсказания.

3. Что случится, если показать test заранее?

Проверка перестанет быть честной: модель или аналитик начнут подстраиваться под экзаменационные вопросы.

4. Высокое качество на train — победа?

Ещё нет. Настоящий вопрос — сохранится ли качество на test и затем в реальной работе.
1. ВопросЧто должно быть на выходе?
2. ПризнакиНе повторяют ли они друг друга?
3. СмыслМожно ли интерпретировать коэффициенты?
4. Тип задачиЧисло, класс или группы?
5. РазделениеTrain отдельно, test отдельно.
6. РешениеПолезно ли качество для реальной задачи?
ИИ предлагает · Orange обучает · аналитик устраивает честный экзамен · СТОП, ПРОВЕРЯЕМ!