Začněte nyníZačněte zdarma

Práce s méně častými kategoriemi

Některé příznaky mohou mít mnoho různých kategorií, ale jejich výskyt bývá velmi nerovnoměrný. Vezmi si třeba oblíbené programovací jazyky v oblasti datové vědy – mezi běžné volby patří Python, R nebo Julia, ale někteří lidé sáhnou po méně obvyklých jazycích, jako je FORTRAN, C a podobně. V takovýchto případech se nevyplatí vytvářet příznak pro každou hodnotu zvlášť – lepší je zaměřit se jen na ty nejčastější.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
Upravit a spustit kód