Zakódování kategorických a škálování numerických proměnných
V tomto posledním kroku provedeš one-hot encoding kategorických proměnných a následně škálování numerických sloupců. Knihovna pandas je načtena jako pd a modul StandardScaler z sklearn.preprocessing je připraven k použití.
Surový dataset telekomunikačního churn telco_raw je načten jako pandas DataFrame spolu se seznamy custid, target, categorical a numerical, které obsahují názvy sloupců vytvořené v předchozím cvičení. Dataset si můžeš prohlédnout v konzoli.
Toto cvičení je součástí kurzu
Machine Learning for Marketing in Python
Pokyny k cvičení
- Proveď one-hot encoding kategorických proměnných.
- Inicializuj instanci
StandardScaler. - Nafituj a transformuj
scalerna numerických sloupcích. - Vytvoř DataFrame z
scaled_numerical.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Perform one-hot encoding to categorical variables
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)
# Initialize StandardScaler instance
scaler = ___()
# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])
# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)