← Вернуться в неделю 5
Практическая миссия Orange · Урок 5

Операция
«Космический ланчбокс»

В 2042 году станция «Арго» готовит длинные экспедиции. Экипажу нельзя остаться без еды — но каждый лишний килограмм приходится доставлять в космос.

Срочное сообщение из Центра управления

Получены данные о 180 проектах питания. Нужно построить модель стоимости, проверить её честно и выяснить, не запутались ли признаки между собой.

Учебная легенда. Все миссии, названия и числа в наборе синтетические. Это не реальные цены NASA, ESA, SpaceX или других организаций.
⬇ Скачать данные CSV
FOOD CARGO
Данные загружены. Бюджет дрожит. Мультиколлинеарность где-то рядом.
Брифинг миссии

Что требуется от аналитической команды

Главная цель

Предсказать actual_food_program_cost_musd — фактическую стоимость программы питания в миллионах условных долларов.

1

Понять данные

Кто является объектом? Что означает одна строка? Какие признаки числовые, а какие категориальные?

2

Построить базовую модель

Сравнить линейную регрессию с более гибкими моделями и с простым базовым прогнозом.

3

Провести расследование

Проверить, есть ли среди признаков сильные зависимости, и выяснить, мешают ли они объяснять модель.

4

Предложить ремонт

Создать улучшенный набор признаков и честно сравнить качество до и после изменений.

$ МАССА ЦЕНА
Не ищите один «правильный» столбец. В задаче намеренно есть несколько признаков, описывающих почти один и тот же масштаб миссии.
Шутка инженера: «Мы посчитали рацион три раза — в калориях, килограммах и деньгах. Теперь модель уверена, что это три разных открытия».
Карта данных

Что лежит в файле

🚀 Масштаб миссии

mission_id — идентификатор проекта.

destination — тип направления.

mission_days — длительность экспедиции.

crew_size — число членов экипажа.

crew_days — суммарные человеко-дни.

🥗 Меню и питание

menu_type, daily_calories_per_person, total_calories_million.

dehydrated_food_share_pct — доля обезвоженной еды.

special_diet_share_pct — доля специальных рационов.

menu_variety_score — разнообразие меню.

local_food_growth_share_pct — доля еды, выращенной на месте.

📦 Масса и запасы

packaging_tech — технология упаковки.

reserve_share_pct — доля резерва.

food_mass_kg — масса еды.

packaging_mass_kg — масса упаковки.

reserve_food_mass_kg — масса запаса.

launch_mass_kg — масса, доставляемая при старте.

💰 Цены и результат

food_price_usd_per_kg — закупочная цена еды.

packaging_cost_usd_per_kg — стоимость упаковки.

supplier_price_index — индекс дороговизны поставщика.

launch_cost_kusd_per_kg — стоимость доставки, тыс. усл. долларов за кг.

actual_food_program_cost_musdцелевая переменная.

В наборе нет пропусков. Это сделано специально: сейчас нас интересует не очистка данных, а поведение моделей при связанных признаках.
Подсказка без решения

Сильная корреляция может возникнуть не только потому, что две переменные похожи по смыслу. Иногда один столбец почти вычисляется из других. Проверьте это графиками и числами.

Этап 1 · Базовый маршрут в Orange

Сначала построим честную точку отсчёта

File
CSV
Data Info
Data Table
Select Columns
Constant
Linear Regression
Tree
Random Forest
Test & Score
1

Загрузите файл

Откройте CSV в File. Проверьте: 180 строк, все столбцы распознаны, целевая переменная пока не назначена.

2

Назначьте роли

В Select Columns перенесите actual_food_program_cost_musd в Target, а mission_id — в Meta.

3

Соберите модели

Подключите Constant, Linear Regression, Tree и Random Forest к Test & Score.

4

Проверьте на новых данных

Выберите 5-fold cross-validation. Зафиксируйте MAE, RMSE и R².

5

Сделайте таблицу результатов

Какая модель лучше по каждой метрике? Есть ли практическая разница или значения почти одинаковы?

Запрещённый режим: не выбирайте Test on train data. Такая проверка почти всегда слишком оптимистична.
Контрольный вопрос: почему хорошее качество линейной регрессии ещё не означает, что её коэффициенты можно спокойно интерпретировать?
Этап 2 · Расследование мультиколлинеарности

Признаки начали говорить хором

1

Найдите связанные пары

Подключите Correlations. Начните с Pearson. Отметьте пары с большим по модулю коэффициентом, например выше 0.90.

2

Посмотрите глазами

Соедините Correlations со Scatter Plot и изучите самые сильные пары. Прямая ли это связь? Есть ли отдельные группы по направлениям?

3

Откройте коэффициенты

Обучите Linear Regression на всех данных и передайте выход Coefficients в Data Table. Найдите большие, неожиданные или противоположные по знаку коэффициенты.

ПРИЗНАК A ПРИЗНАК B ПРИЗНАК C ЦЕНА
Симптом, а не приговор: мультиколлинеарность может почти не испортить прогноз, но сделать коэффициенты нестабильными и объяснение ненадёжным.

Версия A

Оставьте все признаки. Сохраните метрики и коэффициенты.

Версия B

Удалите по одному признаку из каждого подозрительного кластера. Выбор объясните смыслом.

Версия C

Попробуйте Ridge или Lasso в Linear Regression. Снова сравните метрики и коэффициенты.

Не выдавайте решение одной цифрой. Нужно ответить и про качество прогноза, и про устойчивость объяснения.
Финальный отчёт командиру миссии

Что нужно сдать

Вопросы, на которые обязательно ответить

• Есть ли в данных мультиколлинеарность?

• Где именно вы её обнаружили?

• Почему эти признаки связаны по смыслу?

• Что вы изменили и почему?

• Стало ли объяснение модели надёжнее?

• Потеряла ли модель качество на новых данных?

Черновик сообщения командиру

ИИ предлагает · Orange считает · аналитик замечает дубли · СТОП, ПРОВЕРЯЕМ!
Финальный этап · ИИ на борту

Можно ли использовать ИИ как помощника?

Да — но именно как помощника

ИИ может помочь сформулировать гипотезу, объяснить незнакомую метрику, предложить варианты исправления и проверить понятность вашего текста.

✓ Можно
Просить объяснить MAE, RMSE, R², Ridge и Lasso простыми словами.
✓ Можно
Попросить предложить причины сильной корреляции между найденными признаками.
✓ Можно
Дать ИИ свой вывод и попросить найти логические пробелы.
✕ Нельзя
Копировать готовое решение, не проверяя его в Orange и в данных.

След цифрового помощника

Контроль шлюза

Для сертификата отметьте все пункты отчёта на предыдущем листе и пройдите короткую проверку.

1. Целевая переменная

2. Роль mission_id

3. Честная проверка

4. Главный риск мультиколлинеарности

5. Правильная работа с ИИ

0% миссии
Сертификат пока закрыт. Завершите отчёт и пройдите контроль шлюза.
ИИ не заменяет проверку. Он даёт ещё одну гипотезу, которую аналитик обязан проверить.
Награда за завершённую миссию

Сертификат и секретная карта

🔒

Шлюз ещё закрыт

Отметьте 8 пунктов отчёта и правильно ответьте на 5 вопросов.

Готовность миссии: 0%

Бесплатный курс «Анализ данных в век ИИ»
Сертификат участника
космической аналитической миссии

Настоящим подтверждается, что

успешно выполнил практическую работу в Orange, построил модели стоимости питания космического экипажа, обнаружил мультиколлинеарность и предложил проверенное исправление.

МИССИЯ
ВЫПОЛНЕНА
Автор курса:
доктор Игорь Клейнер
Дата:
Код миссии:
ARGO-0000
Секретная карта №05 · редкость: легендарная
Помощник космонавта-аналитика данных
Класс: проверяющий спутник
Радар связей +5
Замечает признаки, которые повторяют друг друга.
Щит от утечки +4
Не подпускает тестовые ответы к обучению.
Компас метрик +4
Сравнивает MAE, RMSE и R².
ИИ-переводчик +3
Превращает подсказку ИИ в проверяемую гипотезу.
Особый приём: «СТОП, ПРОВЕРЯЕМ!»
Один раз за проект заставляет команду проверить самый красивый вывод ещё раз.

Инструкция по применению карты

Когда разыгрывать: если модель показывает великолепное качество, но её коэффициенты выглядят как послание из другой галактики.

Ход 1. Откройте Correlations и найдите дублирующие признаки.

Ход 2. Проверьте зависимость на Scatter Plot и по смыслу задачи.

Ход 3. Сравните исходную, сокращённую и регуляризованную модели в Test & Score.

Победа: качество на новых данных сохранилось, а объяснение стало устойчивее.

Нейросеть подсказывает · Orange считает · человек решает
Нажмите на карту, чтобы увидеть обратную сторону.