Zacznij terazZacznij za darmo

Analiza wskaźnika rezygnacji i podział danych

Nawiązując do przeglądu z rozdziału 1., w tej lekcji zagłębisz się w przygotowanie danych potrzebnych do przewidywania rezygnacji klientów (churn) za pomocą uczenia maszynowego. Przeanalizujesz rozkład wskaźnika rezygnacji i podzielisz dane na zbiór treningowy oraz testowy, zanim przejdziesz do modelowania. W tym kroku zrozumiesz, jak rozłożony jest wskaźnik rezygnacji, a następnie wstępnie przetworzysz dane, aby zbudować model na zbiorze treningowym i zmierzyć jego skuteczność na zbiorze testowym.

Zbiór danych telecom został wczytany jako ramka danych pandas o nazwie telcom. Kolumna ze zmienną docelową nazywa się Churn.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w marketingu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wydrukuj unikalne wartości w kolumnie Churn.
  • Oblicz proporcjonalny udział każdej grupy rezygnacji.
  • Zaimportuj funkcję służącą do podziału danych na zbiór treningowy i testowy.
  • Podziel dane w proporcji 75% trening i 25% test.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the unique Churn values
print(___(telcom['Churn']))

# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100

# Import the function for splitting data to train and test
from sklearn.model_selection import ___

# Split the data into train and test
train, test = ___(telcom, test_size = .25)
Edytuj i uruchom kod