НачатьНачать бесплатно

Унитарное кодирование и фиктивные переменные

Чтобы использовать категориальные переменные в модели машинного обучения, их необходимо представить в числовом виде. Два наиболее распространённых способа — это унитарное кодирование (one-hot encoding) и фиктивные переменные (dummy variables). В этом упражнении вы создадите оба типа кодирования и сравните полученные наборы столбцов. Мы продолжим работу с тем же DataFrame из предыдущего урока, загруженным как so_survey_df, и сосредоточимся на столбце Country.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')

# Print the columns names
print(one_hot_encoded.columns)
Редактировать и запускать код