↕️Спирмен: важен порядок, а не сантиметры между числами
Перешли от исходных значений к рангам и посмотрели на монотонную связь. Спирмен любит порядок, переживает большие расстояния спокойнее Пирсона, но бессмертным от выбросов всё равно не становится.
🎯Много классов: победитель есть, уверенности может не быть
В мультиклассовой логистической регрессии модель оценивает несколько вероятностей и выбирает максимум. Но 0.40 против 0.35 и 0.25 — это победа скорее «на фотофинише», чем уверенный разгром.
🎛️Простая или сложная модель: больше кнопок ≠ больше мудрости
Сравнивали гибкость, интерпретируемость и вычислительную сложность. Сложнее не означает автоматически лучше: модель должна решать задачу, а не просто впечатлять соседнюю нейросеть.
📰Текстовые данные: несколько слов иногда двигают очень реальные вещи
Новости, письма, отзывы и сообщения — это данные без уютной табличной формы. На примерах потоков новостей, Enron и Panama Papers увидели, зачем машинам учиться читать много текста, а человеку — всё равно проверять важное глазами.
👜Bag of Words: помнит гостей, забывает рассадку
Текст превратился в таблицу «документы × слова». Частоты и веса сохраняются, порядок слов — нет. TF-IDF помогает приглушить слова, которые встречаются почти везде, а embeddings оставили как следующий уровень, когда простой baseline уже понятен.
🏷️Target тоже данные: плохую метку нейросеть не отмоет
Разбирали ручную разметку, crowdsourcing и ИИ-разметку. Несколько независимых оценок можно агрегировать, но спорная или систематически плохая метка остаётся проблемой — даже если модель очень дорогая и смотрит уверенно.
🧼Preprocessing: мойте текст, но не до стерильности
Lowercase, tokenization, stemming, lemmatization, stop words и regex помогают убрать шум. Но not, 😡, !!! или #fail могут быть сигналом. Иногда лучший способ испортить sentiment analysis — слишком старательно «почистить» sentiment.
🍊Orange: построили pipeline и пошли читать его ошибки
Corpus → Corpus Viewer / Word Cloud → Preprocess Text → Bag of Words → Logistic Regression → Test & Score → Confusion Matrix → Nomogram. Главное: не поклоняться одной Accuracy, а открыть ошибочные тексты и понять, где сломались данные, признаки, метка или сама модель.