Utforska churn-frekvens och dela upp data
Med utgångspunkt i den översikt du fick i kapitel 1 ska du nu gå djupare in i den dataförberedelse som krävs för att använda maskininlärning för churn-prediktion. Du utforskar churn-fördelningen och delar upp data i tränings- och testset innan du går vidare till modellering. I det här steget får du en förståelse för hur churn-frekvensen är fördelad, och du förbearbetar data så att du kan bygga en modell på träningsdata och sedan mäta dess prestanda på oanvänd testdata.
Telekomdatamängden har laddats in som en pandas-DataFrame med namnet telcom. Målvariabelkolumnen heter Churn.
Den här övningen är en del av kursen
Maskininlärning för marknadsföring i Python
Övningsinstruktioner
- Skriv ut de unika värdena i kolumnen
Churn. - Beräkna den relativa storleken för varje churn-grupp.
- Importera funktionen för att dela upp data i tränings- och testset.
- Dela upp data i 75 % träning och 25 % test.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)