🎤Мультиколлинеарность: признаки поют хором
Когда несколько признаков сильно линейно связаны, модель может неплохо предсказывать, но ей трудно честно объяснить вклад каждого участника. Коэффициенты меняются, знаки удивляют, а каждый признак заявляет: «Температуру объяснил именно я!»
🔎Корреляция и VIF — не кнопка «удалить всё»
Корреляционная матрица помогает заметить пары, а VIF показывает, насколько один признак объясняется остальными. Но высокий показатель — повод расследовать происхождение данных, а не устраивать массовое увольнение столбцов.
🌍Климат напомнил, что смысл важнее механики
Связанные климатические показатели могут описывать разные физические механизмы. Поэтому нельзя удалить CO₂ только потому, что он дружит с другой переменной. Сначала предметный смысл, потом ножницы.
🎯Тип задачи определяет вопрос
Нужно число — это регрессия. Нужен класс — классификация. Нужно найти группы без готовых ответов — кластеризация. Алгоритм выбирают после вопроса, а не потому, что его название красиво смотрится на слайде.
📝Train учится, test принимает экзамен
Модель разбирает примеры на train, а test хранит вопросы в запечатанном конверте. Подсматривать туда во время обучения нельзя: это утечка данных, а не выдающаяся интуиция модели.
🚀В Orange мы проверяем, а не любуемся
Сначала строим простую базовую модель, затем сравниваем её с более серьёзной, смотрим качество на новых данных и анализируем ошибки. Красивый коэффициент ещё не диплом, а высокий результат на train — только допуск к экзамену.