Поймай спамера
Вы получите реальные SMS с меткой spam/ham и самостоятельно пройдёте полный ML-маршрут: от разведки текста до анализа ошибок модели.
Брифинг операции
Это не упражнение «поставьте те же галочки, что на картинке». Вы принимаете решения и объясняете их.
🎯 Главный вопрос
Можно ли доверить вашей модели фильтрацию SMS — и где она наиболее опасна?
Финальный вывод должен опираться не только на Accuracy или AUC, но и на реальные ошибки.
🧰 Что понадобится
- Orange Data Mining
- Text add-on / Text Mining
- File, Data Table, затем Corpus
- Preprocess Text, Bag of Words
- Test & Score, Confusion Matrix
- минимум две модели
Разведка данных
Сначала смотрим на данные, только потом строим модель.
Сбалансированы ли классы? Почему это важно для интерпретации Accuracy?
Дубликат — не обязательно «плохая строка». Но для честной оценки надо понимать, где он находится и почему повторился.
Corpus, текстовая разведка и preprocessing
Только после обычной таблицы начинаем работать с текстом как с корпусом. Не мойте его до стерильности.
Модели и честная проверка
Baseline обязателен. Более сложная модель не получает бонусных очков только за сложность.
Оценивать обобщающую способность просто на тех же данных, на которых модель обучалась.
Использовать cross-validation или корректное train/test-разделение и объяснить выбранную схему.
Расследование ошибок
Это центральная часть проекта: цифры заканчиваются, начинается чтение.
короткие тексты, рекламные маркеры, числа, URL, нестандартные слова, неоднозначность, preprocessing, потерю контекста.
Ошибиться могла не только модель. Ошибка иногда появляется в target или намного раньше в pipeline.
Ваш мини-отчёт
Три коротких ответа превращают workflow в исследование.
Финиш операции
Отметьте все 9 этапов и заполните три поля мини-отчёта. После этого проект будет отмечен в прогрессе недели 7 и откроется сертификат достижения.
СЕРТИФИКАТ ДОСТИЖЕНИЯ
Доктор Игорь Клейнер
2026