Začněte nyníZačněte zdarma

Prozkoumání míry odlivu a rozdělení dat

V návaznosti na přehled z kapitoly 1 se v této lekci ponoříš hlouběji do přípravy dat potřebné pro predikci odlivu zákazníků pomocí strojového učení. Prozkoumáš rozložení odlivu a rozdělíš data na trénovací a testovací část, než přistoupíš k samotnému modelování. V tomto kroku pochopíš, jak je míra odlivu rozložena, a data připravíš tak, abys mohl/a sestavit model na trénovací sadě a změřit jeho výkon na dosud nepoužitých testovacích datech.

Telekomová datová sada je načtena jako pandas DataFrame s názvem telcom. Sloupec s cílovou proměnnou se jmenuje Churn.

Toto cvičení je součástí kurzu

Machine Learning for Marketing in Python

Zobrazit kurz

Pokyny k cvičení

  • Vypiš unikátní hodnoty ve sloupci Churn.
  • Vypočítej relativní zastoupení každé skupiny odlivu zákazníků.
  • Importuj funkci pro rozdělení dat na trénovací a testovací sadu.
  • Rozdělíš data v poměru 75 % pro trénování a 25 % pro testování.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the unique Churn values
print(___(telcom['Churn']))

# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100

# Import the function for splitting data to train and test
from sklearn.model_selection import ___

# Split the data into train and test
train, test = ___(telcom, test_size = .25)
Upravit a spustit kód