AI помогает.
Решает аналитик.
На этой неделе мы не меняли профессию аналитика. Мы добавили нового помощника: он умеет объяснять, предлагать, писать код и переводить между инструментами — но не получает право отменить проверку.
AI объясняет
Помогает понять данные, метрики, workflow и следующий шаг.
AI строит
Может создать HTML, Python-проект, diagram, checklist или App.
Человек проверяет
Задача, смысл, ограничения, интерпретация и финальное решение остаются у аналитика.
Карта недели: TASK → PROMPT → AI → ORANGE → PYTHON → APP → CHECK.
Хороший prompt —
это хорошая постановка задачи
Магических слов нет. Есть ясность: что мы анализируем, зачем, что именно просим сделать, какие границы нельзя переходить и в каком виде нужен результат.
P1 · свободный
«Проанализируй и предложи хорошую модель». Быстро и широко, но AI получает много свободы принимать промежуточные решения.
P2 · структурированный
Контекст → цель → задача → ограничения → формат. Высокий контроль над этапом работы.
P3 · диалог
Explore → Plan → Build → Explain → Modify. Больше итераций, зато легче вовремя остановить неверный поворот.
Совет от Игоря: сначала решите, какие решения вы хотите оставить человеку.
Красиво ≠ проверено.
Перевод ≠ копирование.
Один и тот же CSV и prompt дали разные AI-отчёты. Потом AI использовали рядом с Orange и как переводчика уже существующей аналитики в Python и App.
AI A
Хорошо сжимал: ясный EDA, аккуратная структура, хороший баланс краткости и глубины.
AI B
Глубже проверял файл и лучше отделял «видно в CSV» от «мы могли бы предположить».
AI C
Эффектный HTML, но перепутал 645 пропущенных ячеек и 582 строки с пропусками и добавлял сведения вне CSV.
AI рядом с Orange
Навигатор · преподаватель · архитектор workflow · оформитель · рецензент · помощник по изменениям.
СПРОСИТЬ → ПОЛУЧИТЬ → ПРОВЕРИТЬ → ИСПОЛЬЗОВАТЬ.
Orange → Python
Сохраняем аналитический смысл, а не кнопки интерфейса. Поэтому технически необходимый SimpleImputer может появиться в Python, даже если отдельный Impute widget не был виден на screenshot.
Правило: попросите AI отдельно написать «что я увидел» и «что я добавил как решение».
«80% accurate» —
80% чего?
История Эйба показывает типичную ловушку: вероятность положительного теста при болезни — не то же самое, что вероятность болезни при положительном тесте.
10 000 похожих детей
Около 100 имеют болезнь. Из них положительный тест получат примерно 80.
Из 9900 здоровых положительный результат получат примерно 4950.
Что среди положительных?
Всего positive: 80 + 4950 = 5030.
Действительно больны 80.
80 / 5030 ≈ 1.6%.
Среди настоящих positives сколько нашли?
Среди predicted positives сколько настоящих?
Совет от Игоря: увидели процент — спросите «процент чего, при каком условии?»
Один экзамен может повезти.
Сделаем несколько честных.
Один train/test split может быть честным, но шумным. K-fold cross-validation систематически даёт каждой строке один раз побыть в test и несколько раз — в train.
обучение
временно обучаем Model
невидимый test
10-fold
10 раундов. Каждый fold один раз становится test. Каждая строка получает out-of-fold prediction от модели, которая на ней не обучалась.
Learner ≠ Model
Learner — рецепт обучения. Test & Score обучает временные модели внутри folds. Model — уже обученный объект.
Stratified
Старается сохранить похожую долю классов в каждом fold — полезно при редком положительном классе.
И ещё: CV не отменяет untouched final test и не лечит неправильную схему разбиения.
AI сделал результат.
Теперь четыре вопроса аналитика.
тот ли файл · target · пропуски · факты
ту ли задачу решаем · не сменился ли смысл
то ли число · честно ли получено · объяснимо ли