Zacznij terazZacznij za darmo

Kodowanie zmiennych kategorycznych i skalowanie zmiennych numerycznych

W tym ostatnim kroku wykonasz kodowanie one-hot na zmiennych kategorycznych, a następnie przeskalojesz kolumny numeryczne. Biblioteka pandas została wczytana jako pd, a moduł StandardScaler z sklearn.preprocessing jest już dostępny.

Nieprzetworzony zbiór danych o rezygnacji klientów z sektora telekomunikacyjnego – telco_raw – został wczytany jako DataFrame biblioteki pandas. Dostępne są też listy custid, target, categorical i numerical z nazwami kolumn, które zostały utworzone w poprzednim ćwiczeniu. Możesz zapoznać się ze zbiorem danych, eksplorując go w konsoli.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w marketingu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wykonaj kodowanie one-hot na zmiennych kategorycznych.
  • Zainicjalizuj instancję StandardScaler.
  • Dopasuj scaler do kolumn numerycznych i przekształć je.
  • Zbuduj DataFrame na podstawie scaled_numerical.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Perform one-hot encoding to categorical variables 
telco_raw = pd.get_dummies(data = ___, columns = categorical, drop_first=True)

# Initialize StandardScaler instance
scaler = ___()

# Fit and transform the scaler on numerical columns
scaled_numerical = ___.fit_transform(telco_raw[___])

# Build a DataFrame from scaled_numerical
scaled_numerical = pd.DataFrame(___, columns=numerical)
Edytuj i uruchom kod