Кодуйте категоріальні змінні та масштабуйте числові
На цьому фінальному кроці ви виконаєте one-hot кодування для категоріальних змінних, а потім масштабування числових стовпців. Бібліотеку pandas уже імпортовано як pd, а також модуль StandardScaler із модуля sklearn.preprocessing.
Сирий набір даних про відтік клієнтів телеком-компанії telco_raw завантажено для вас як датафрейм pandas, а також списки custid, target, categorical і numerical з назвами стовпців, які ви створили у попередній вправі. Ознайомтеся з набором даних, досліджуючи його в консолі.
Ця вправа є частиною курсу
Machine Learning для маркетингу в Python
Інструкції до вправи
- Виконайте one-hot кодування для категоріальних змінних.
- Ініціалізуйте екземпляр
StandardScaler. - Навчіть і перетворіть (
fitіtransform)scalerна числових стовпцях. - Побудуйте DataFrame з
scaled_numerical.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Perform one-hot encoding to categorical variables
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)
# Initialize StandardScaler instance
scaler = ___()
# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])
# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)