Explorează rata de churn și împarte datele
Pornind de la prezentarea generală din Capitolul 1, în această lecție vei aprofunda pregătirea datelor necesară pentru a aplica machine learning în predicția churnului. Vei explora distribuția churnului și vei împărți datele în seturi de antrenament și testare înainte de a trece la modelare. În acest pas vei înțelege cum este distribuită rata de churn și vei preprocesa datele pentru a construi un model pe setul de antrenament, măsurând apoi performanța acestuia pe datele de testare neutilizate.
Setul de date al companiei de telecomunicații a fost încărcat ca un DataFrame pandas denumit telcom. Coloana variabilei țintă se numește Churn.
Acest exercițiu face parte din cursul
Machine Learning pentru Marketing în Python
Instrucțiuni pentru exercițiu
- Afișează valorile unice din coloana
Churn. - Calculează ponderea fiecărui grup de churn.
- Importă funcția pentru împărțirea datelor în antrenament și testare.
- Împarte datele în 75% antrenament și 25% testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)