Analiza wskaźnika rezygnacji i podział danych
Nawiązując do przeglądu z rozdziału 1., w tej lekcji zagłębisz się w przygotowanie danych potrzebnych do przewidywania rezygnacji klientów (churn) za pomocą uczenia maszynowego. Przeanalizujesz rozkład wskaźnika rezygnacji i podzielisz dane na zbiór treningowy oraz testowy, zanim przejdziesz do modelowania. W tym kroku zrozumiesz, jak rozłożony jest wskaźnik rezygnacji, a następnie wstępnie przetworzysz dane, aby zbudować model na zbiorze treningowym i zmierzyć jego skuteczność na zbiorze testowym.
Zbiór danych telecom został wczytany jako ramka danych pandas o nazwie telcom. Kolumna ze zmienną docelową nazywa się Churn.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Wydrukuj unikalne wartości w kolumnie
Churn. - Oblicz proporcjonalny udział każdej grupy rezygnacji.
- Zaimportuj funkcję służącą do podziału danych na zbiór treningowy i testowy.
- Podziel dane w proporcji 75% trening i 25% test.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)