Práce s méně častými kategoriemi
Některé příznaky mohou mít mnoho různých kategorií, ale jejich výskyt bývá velmi nerovnoměrný. Vezmi si třeba oblíbené programovací jazyky v oblasti datové vědy – mezi běžné volby patří Python, R nebo Julia, ale někteří lidé sáhnou po méně obvyklých jazycích, jako je FORTRAN, C a podobně. V takovýchto případech se nevyplatí vytvářet příznak pro každou hodnotu zvlášť – lepší je zaměřit se jen na ty nejčastější.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)