На этой неделе мы не просто провели прямую через точки. Мы прошли полный путь аналитика: сформулировали вопрос, разобрались с ролями переменных, увидели связь на графике, измерили её корреляцией и превратили в числовой прогноз.
Главная мысль: линейная регрессия — это не «линия на картинке», а проверяемая модель связи между признаками и числовой целью.
Эксперт пробует вино. Аналитик пробует гипотезу.
ВопросДанныеГрафикКорреляцияРегрессияВывод
История
Орли Ашенфельтер спросил: можно ли прогнозировать будущую цену бордоского вина по измеримым условиям урожая?
Метод
Сначала увидеть структуру данных, затем описать связь числом и только потом строить модель.
Ответственность
Не путать связь с причиной, обучение с проверкой и красивую формулу с истиной.
Тема 1 · Постановка задачи
До формулы нужно понять: что именно мы предсказываем?
Одна из главных ошибок начинающего аналитика — сразу тащить таблицу в модель. Сначала переводим реальный вопрос на язык данных.
1Бизнес-вопрос: сколько будет стоить урожай вина?
2Единица наблюдения: один год урожая — одна строка.
3Target: цена или логарифм цены — число, которое хотим предсказать.
4Features: измеримые условия, известные до прогноза.
5Meta: подпись строки, полезная человеку, но не обязательно модели.
Переменная
Роль
Смысл
Price / log(Price)
Target
Будущая цена
AGST
Feature
Температура сезона
WinterRain
Feature
Зимние осадки
HarvestRain
Feature
Дождь во время сбора
Age
Feature
Возраст вина
Year
Meta
Подпись урожая
Утечка данных: нельзя давать модели признак, который становится известен только после события, которое мы пытаемся предсказать. Иначе модель сдаёт экзамен с ответами в кармане.
Тема 2 · Диаграмма рассеивания
Scatter plot: каждая точка — отдельная история
Y: log(price)X: Age →
1. Направление В среднем вверх, вниз или без направления?
2. Форма Прямая, дуга, порог, несколько групп?
3. Сила Точки плотно держатся около общей формы?
4. Выбросы Есть ли наблюдение, которое спорит со всеми?
5. Диапазон Не пытаемся ли мы судить за пределами увиденных X?
Правильный порядок: сначала график, потом коэффициент. Число без картинки может аккуратно описать не ту историю.
Jittering: раздвигает совпавшие точки только на экране. Он не лечит данные и не создаёт новые наблюдения.
Тема 2 · Корреляция
Pearson r: сжимаем линейное облако в одно число
−1 ≤ r ≤ 1
−1 сильная обратная
−0.6
0 линейной нет
+0.6
+1 сильная прямая
Что делает Pearson: сравнивает, как отклонения X от своего среднего сочетаются с отклонениями Y от своего среднего, и нормирует результат по разбросам обеих переменных.
Знак: направление связи.
|r|: сила именно линейной связи.
Без единиц: метры и сантиметры дадут тот же r.
Симметрия: corr(X,Y) = corr(Y,X).
Не процент: r = 0.7 не означает «70% точности».
r = +0.85Сильная прямая линейная связь.
r = −0.85Та же сила, обратное направление.
r ≈ 0Прямой линии почти нет; кривая всё ещё возможна.
Пирсон не читает мысли данных. Он проверяет, насколько им подходит прямая.
Тема 2 · Ловушки связи
Четыре способа слишком быстро поверить корреляции
ПричинностьСвязь X и Y не доказывает, что X вызывает Y. Возможна третья переменная или обратное влияние.
НелинейностьСильная U-образная зависимость может иметь r около нуля.
ВыбросОдна точка иногда создаёт или уничтожает красивую корреляцию.
Много сравненийЕсли проверить сотни пар, несколько «сенсаций» появятся случайно.
✅ Делает аналитик
Смотрит scatter plot.
Проверяет смысл переменных и время их измерения.
Ищет группы и выбросы.
Формулирует альтернативные объяснения.
🚨 Делает охотник за сенсацией
Берёт только красивое r.
Называет связь причиной.
Игнорирует неудобную точку.
Пишет заголовок раньше анализа.
Корреляция — хороший детектор дыма. Но она ещё не сообщает, что именно горит.
Тема 3 · Линейная регрессия
Что делает прямая: прогнозирует и оставляет остатки
ŷ = b₀ + b₁x
ŷпрогноз
b₀свободный член
b₁наклон
xпризнак
1Для каждого X линия выдаёт прогноз ŷ.
2Наблюдаемое значение y обычно не совпадает с прогнозом.
3Остаток: e = y − ŷ — вертикальная ошибка для одной точки.
4Метод наименьших квадратов выбирает коэффициенты, уменьшающие сумму квадратов остатков.
наблюдение y прогноз ŷ остаток
Почему квадраты? Положительные и отрицательные ошибки не взаимоуничтожаются, а большие промахи получают больший штраф.
Коэффициент показывает изменение прогноза при увеличении одного признака на единицу, если остальные признаки фиксированы.
Почему это важно
Простая корреляция смотрит на пару переменных. Множественная регрессия пытается отделить вклад признака от информации других признаков.
+0.616более тёплый сезон связан с большим прогнозом log(price)
−0.00386больше дождя во время сбора связано с меньшим прогнозом
+0.0238возраст увеличивает прогноз при прочих равных
−3.42свободный член собирает базовый уровень формулы
Тонкость с логарифмом: модель предсказывает не саму цену, а log(price). Поэтому коэффициенты нельзя бездумно читать как прибавку в денежных единицах. Для возврата к шкале цены нужен обратный переход.
Коэффициент — не личная характеристика признака. Он зависит от модели, масштаба и набора остальных переменных.
Тема 4 · Практика в Orange
Рабочий маршрут: не просто соединить виджеты
File
Data Table
Select Columns
Scatter Plot
Correlations
Linear Regression
Predictions
До модели
Проверить число строк, типы и пропуски.
Назначить Target, Features и Meta.
Посмотреть распределения и scatter plots.
Записать ожидаемые направления связей.
После модели
Прочитать знаки и масштабы коэффициентов.
Сравнить прогнозы с наблюдениями.
Найти самые большие ошибки.
Проверить, согласуется ли результат со здравым смыслом.
Test & Score — предварительный взгляд: он нужен, чтобы оценивать модель не только на тех данных, на которых она училась. Метрики качества и корректное сравнение моделей подробно разберём дальше.
Orange считает быстро. Но роль «назначить смысл каждой колонке» всё ещё не автоматизирована.
Тема 4 · Проверка и границы
Когда прямая выглядит умно, но ведёт себя глупо
R² описывает согласование
Он показывает, какую долю наблюдаемого разброса цели модель описывает в рассматриваемых данных. Это не процент точности, не шанс правильного ответа и не доказательство причины.
Остатки показывают промахи
Если остатки имеют заметную форму, группы или веер, одной прямой может быть недостаточно.
Новые данные важнее памяти
Модель может хорошо запомнить знакомые наблюдения и хуже работать там, где ей действительно придётся прогнозировать.
✂️
Бритва Оккама: если более сложная модель не даёт устойчивого выигрыша на новых данных, простая модель предпочтительнее.
1Интерполяция: прогноз внутри знакомого диапазона признаков обычно безопаснее.
2Экстраполяция: продолжать прямую далеко за пределы данных рискованно.
3Сдвиг условий: модель прошлого может перестать работать в другой стране, эпохе или рынке.
4Смысл: статистически аккуратный результат может быть практически бессмысленным.
Модель имеет область применения. За её пределами прямая превращается в художественную литературу.
Секретная карта недели 4 · глубокая проверка
Соберите весь путь аналитика
1. Зачем смотреть scatter plot до r?
Чтобы увидеть форму, группы и выбросы. Одинаковое r может скрывать совершенно разные структуры данных.
2. r = 0 означает независимость?
Нет. Он говорит об отсутствии заметной линейной связи; нелинейная зависимость может оставаться.
3. Что такое остаток?
Разность между наблюдаемым значением и прогнозом: e = y − ŷ. Это ошибка модели для конкретной строки.
4. Как читать коэффициент?
Как изменение прогноза при росте признака на единицу при фиксированных остальных признаках модели.
5. Высокий R² доказал причинность?
Нет. R² описывает согласование модели с данными, а причинный вывод требует другого дизайна и дополнительных аргументов.
6. Когда усложнять модель?
Когда более сложная модель даёт устойчивое улучшение на новых данных и это улучшение важно для задачи.
ВопросКто объект наблюдения и что предсказываем?
ДанныеКакие признаки известны в момент прогноза?
ГрафикКаковы направление, форма, группы и выбросы?
СвязьЧто показывает r и чего он не доказывает?
МодельКак читаются ŷ, коэффициенты и остатки?
ПроверкаГде модель работает и где начинается экстраполяция?
ИИ предлагает · Orange считает · аналитик формулирует вопрос, проверяет смысл и отвечает за вывод