Преобразование категориальных переменных
Так как sklearn принимает в качестве входных данных только числовые признаки, категориальные переменные необходимо закодировать в числовые. Самый распространённый способ — «унитарное кодирование» (one-hot encoding) — прост в использовании, однако требует значительного объёма памяти. Поэтому здесь вы воспользуетесь методом хеширования, который преобразует категориальные значения в числовые для каждого категориального столбца.
Модуль pandas доступен в рабочей среде под именем pd, а учебный DataFrame загружен как df.
Это упражнение является частью курса
Прогнозирование CTR с помощью машинного обучения на Python
Инструкции к упражнению
- Выберите категориальные столбцы, отфильтровав их по типу данных.
- Примените функцию хеширования к каждому из категориальных столбцов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Get categorical columns
categorical_cols = df.____(
include = [____]).columns.tolist()
print("Categorical columns: ")
print(categorical_cols)
# Iterate over categorical columns and apply hash function
for col in ____:
df[col] = df[col].____(lambda x: ____(x))
# Print examples of new output
print(df.head(5))