Операция
«Космический ланчбокс»
В 2042 году станция «Арго» готовит длинные экспедиции. Экипажу нельзя остаться без еды — но каждый лишний килограмм приходится доставлять в космос.
Срочное сообщение из Центра управления
Получены данные о 180 проектах питания. Нужно построить модель стоимости, проверить её честно и выяснить, не запутались ли признаки между собой.
Что требуется от аналитической команды
Главная цель
Предсказать actual_food_program_cost_musd — фактическую стоимость программы питания в миллионах условных долларов.
Понять данные
Кто является объектом? Что означает одна строка? Какие признаки числовые, а какие категориальные?
Построить базовую модель
Сравнить линейную регрессию с более гибкими моделями и с простым базовым прогнозом.
Провести расследование
Проверить, есть ли среди признаков сильные зависимости, и выяснить, мешают ли они объяснять модель.
Предложить ремонт
Создать улучшенный набор признаков и честно сравнить качество до и после изменений.
Что лежит в файле
🚀 Масштаб миссии
mission_id — идентификатор проекта.
destination — тип направления.
mission_days — длительность экспедиции.
crew_size — число членов экипажа.
crew_days — суммарные человеко-дни.
🥗 Меню и питание
menu_type, daily_calories_per_person, total_calories_million.
dehydrated_food_share_pct — доля обезвоженной еды.
special_diet_share_pct — доля специальных рационов.
menu_variety_score — разнообразие меню.
local_food_growth_share_pct — доля еды, выращенной на месте.
📦 Масса и запасы
packaging_tech — технология упаковки.
reserve_share_pct — доля резерва.
food_mass_kg — масса еды.
packaging_mass_kg — масса упаковки.
reserve_food_mass_kg — масса запаса.
launch_mass_kg — масса, доставляемая при старте.
💰 Цены и результат
food_price_usd_per_kg — закупочная цена еды.
packaging_cost_usd_per_kg — стоимость упаковки.
supplier_price_index — индекс дороговизны поставщика.
launch_cost_kusd_per_kg — стоимость доставки, тыс. усл. долларов за кг.
actual_food_program_cost_musd — целевая переменная.
Сильная корреляция может возникнуть не только потому, что две переменные похожи по смыслу. Иногда один столбец почти вычисляется из других. Проверьте это графиками и числами.
Сначала построим честную точку отсчёта
CSV
Data Table
Linear Regression
Tree
Random Forest
Загрузите файл
Откройте CSV в File. Проверьте: 180 строк, все столбцы распознаны, целевая переменная пока не назначена.
Назначьте роли
В Select Columns перенесите actual_food_program_cost_musd в Target, а mission_id — в Meta.
Соберите модели
Подключите Constant, Linear Regression, Tree и Random Forest к Test & Score.
Проверьте на новых данных
Выберите 5-fold cross-validation. Зафиксируйте MAE, RMSE и R².
Сделайте таблицу результатов
Какая модель лучше по каждой метрике? Есть ли практическая разница или значения почти одинаковы?
Признаки начали говорить хором
Найдите связанные пары
Подключите Correlations. Начните с Pearson. Отметьте пары с большим по модулю коэффициентом, например выше 0.90.
Посмотрите глазами
Соедините Correlations со Scatter Plot и изучите самые сильные пары. Прямая ли это связь? Есть ли отдельные группы по направлениям?
Откройте коэффициенты
Обучите Linear Regression на всех данных и передайте выход Coefficients в Data Table. Найдите большие, неожиданные или противоположные по знаку коэффициенты.
Версия A
Оставьте все признаки. Сохраните метрики и коэффициенты.
Версия B
Удалите по одному признаку из каждого подозрительного кластера. Выбор объясните смыслом.
Версия C
Попробуйте Ridge или Lasso в Linear Regression. Снова сравните метрики и коэффициенты.
Что нужно сдать
Вопросы, на которые обязательно ответить
• Есть ли в данных мультиколлинеарность?
• Где именно вы её обнаружили?
• Почему эти признаки связаны по смыслу?
• Что вы изменили и почему?
• Стало ли объяснение модели надёжнее?
• Потеряла ли модель качество на новых данных?
Черновик сообщения командиру
Можно ли использовать ИИ как помощника?
Да — но именно как помощника
ИИ может помочь сформулировать гипотезу, объяснить незнакомую метрику, предложить варианты исправления и проверить понятность вашего текста.
Просить объяснить MAE, RMSE, R², Ridge и Lasso простыми словами.
Попросить предложить причины сильной корреляции между найденными признаками.
Дать ИИ свой вывод и попросить найти логические пробелы.
Копировать готовое решение, не проверяя его в Orange и в данных.
След цифрового помощника
Контроль шлюза
Для сертификата отметьте все пункты отчёта на предыдущем листе и пройдите короткую проверку.
1. Целевая переменная
2. Роль mission_id
3. Честная проверка
4. Главный риск мультиколлинеарности
5. Правильная работа с ИИ
Сертификат и секретная карта
Шлюз ещё закрыт
Отметьте 8 пунктов отчёта и правильно ответьте на 5 вопросов.
Готовность миссии: 0%
космической аналитической миссии
Настоящим подтверждается, что
успешно выполнил практическую работу в Orange, построил модели стоимости питания космического экипажа, обнаружил мультиколлинеарность и предложил проверенное исправление.
ВЫПОЛНЕНА
Замечает признаки, которые повторяют друг друга.
Не подпускает тестовые ответы к обучению.
Сравнивает MAE, RMSE и R².
Превращает подсказку ИИ в проверяемую гипотезу.
Один раз за проект заставляет команду проверить самый красивый вывод ещё раз.
Инструкция по применению карты
Когда разыгрывать: если модель показывает великолепное качество, но её коэффициенты выглядят как послание из другой галактики.
Ход 1. Откройте Correlations и найдите дублирующие признаки.
Ход 2. Проверьте зависимость на Scatter Plot и по смыслу задачи.
Ход 3. Сравните исходную, сокращённую и регуляризованную модели в Test & Score.
Победа: качество на новых данных сохранилось, а объяснение стало устойчивее.