Kodowanie zmiennych kategorycznych i skalowanie zmiennych numerycznych
W tym ostatnim kroku wykonasz kodowanie one-hot na zmiennych kategorycznych, a następnie przeskalojesz kolumny numeryczne. Biblioteka pandas została wczytana jako pd, a moduł StandardScaler z sklearn.preprocessing jest już dostępny.
Nieprzetworzony zbiór danych o rezygnacji klientów z sektora telekomunikacyjnego – telco_raw – został wczytany jako DataFrame biblioteki pandas. Dostępne są też listy custid, target, categorical i numerical z nazwami kolumn, które zostały utworzone w poprzednim ćwiczeniu. Możesz zapoznać się ze zbiorem danych, eksplorując go w konsoli.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Wykonaj kodowanie one-hot na zmiennych kategorycznych.
- Zainicjalizuj instancję
StandardScaler. - Dopasuj
scalerdo kolumn numerycznych i przekształć je. - Zbuduj DataFrame na podstawie
scaled_numerical.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Perform one-hot encoding to categorical variables
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)
# Initialize StandardScaler instance
scaler = ___()
# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])
# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)