Oddělení numerických a kategorických sloupců
V předchozím cvičení jsi prozkoumali charakteristiky datasetu a teď jsi připraven/a na předzpracování dat. Oddělíš kategorické a numerické proměnné z DataFrame telco_raw pomocí vlastního prahového počtu unikátních hodnot. Modul pandas je pro tebe načtený jako pd.
Syrový dataset telekomunikačního churn telco_raw je načtený jako DataFrame pandas. Dataset si můžeš prohlédnout v konzoli.
Toto cvičení je součástí kurzu
Machine Learning for Marketing in Python
Pokyny k cvičení
- Ulož názvy sloupců
customerIDaChurn. - Do proměnné
categoricalpřiřaď názvy sloupců, které mají méně než 5 unikátních hodnot. - Odeber
targetze seznamu. - Do proměnné
numericalpřiřaď všechny názvy sloupců, které nejsou vcustid,targetanicategorical.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Store customerID and Churn column names
custid = ['___']
target = ['___']
# Store categorical column names
categorical = telco_raw.___()[telco_raw.nunique() < ___].keys().tolist()
# Remove target from the list of categorical variables
categorical.remove(___[0])
# Store numerical column names
numerical = [x for x in telco_raw.___ if x not in custid + ___ + categorical]