or
Это упражнение является частью курса
В этой главе вы узнаете, что такое конструирование признаков, и начнёте применять его к реальным данным. Вы загрузите, исследуете и визуализируете набор данных с результатами опроса, изучите лежащие в его основе типы данных и поймёте, как они влияют на подход к созданию признаков. С помощью библиотеки pandas вы создадите новые признаки на основе как категориальных, так и непрерывных столбцов.
Эта глава знакомит вас с реальностью неаккуратных и неполных данных. Вы научитесь обнаруживать пропущенные значения и рассмотрите несколько подходов к работе с ними. Кроме того, вы освоите методы обработки строк для устранения нежелательных символов в наборе данных.
В этой главе вы сосредоточитесь на анализе распределения данных и его влиянии на конвейер машинного обучения. Вы узнаете, как работать с асимметричными данными и как поступать в ситуациях, когда выбросы негативно сказываются на результатах анализа.
В заключительной главе вы будете работать с неструктурированными текстовыми данными и изучите способы создания столбцовых признаков на основе текстового корпуса. Вы сравните различные подходы с точки зрения того, сколько контекста они позволяют извлечь, и научитесь находить баланс между достаточным количеством контекста и разумным числом создаваемых признаков.
Текущее упражнение