Rozdzielanie kolumn numerycznych i kategorycznych
W poprzednim ćwiczeniu zapoznałeś się z charakterystyką zbioru danych i możesz teraz przejść do wstępnego przetwarzania danych. Rozdzielisz zmienne kategoryczne i numeryczne z DataFrame telco_raw, używając własnego progu liczby unikalnych wartości. Moduł pandas został już wczytany jako pd.
Nieprzetworzony zbiór danych dotyczący rezygnacji klientów telekomu telco_raw jest dostępny jako DataFrame biblioteki pandas. Możesz zapoznać się z nim, eksplorując go w konsoli.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Zapisz nazwy kolumn
customerIDiChurn. - Przypisz do zmiennej
categoricalnazwy kolumn, które mają mniej niż 5 unikalnych wartości. - Usuń zmienną
targetz listy. - Przypisz do zmiennej
numericalwszystkie nazwy kolumn, które nie znajdują się wcustid,targetanicategorical.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Store customerID and Churn column names
custid = ['___']
target = ['___']
# Store categorical column names
categorical = telco_raw.___()[telco_raw.nunique() < ___].keys().tolist()
# Remove target from the list of categorical variables
categorical.remove(___[0])
# Store numerical column names
numerical = [x for x in telco_raw.___ if x not in custid + ___ + categorical]