Полный цикл предобработки данных


Предобработка — это не борьба за таблицу без NaN. Сначала нужно понять смысл проблемы, затем выбрать допустимое действие и после преобразования проверить, что данные не потеряли смысл.

В лаборатории вы сохраните исходную таблицу, нормализуете представление данных, сделаете невозможные значения явными пропусками, примените разные стратегии для разных причин пропуска и закончите работу инвариантами и audit.

Полная теория «Предобработка данных: как починить таблицу и не подменить факты» →


Универсальный pipeline отделяет механизм от правил предметной области. Код не знает заранее названий столбцов и допустимых диапазонов: всё это передаётся в rules.

Скрытые тесты меняют и данные, и правила. Поэтому задача проверяет перенос: сможет ли один и тот же алгоритм без изменений обработать другой датасет.

Полная теория по предобработке данных →

Загрузка...
Чтобы оставить комментарий, необходимо авторизоваться
💬
Пока нет комментариев. Будьте первым!