Gérer les catégories peu fréquentes
Certaines caractéristiques peuvent comporter de très nombreuses catégories, avec une distribution très inégale de leurs occurrences. Prenez par exemple les langages préférés en Data Science : les choix courants sont Python, R et Julia, mais certaines personnes utilisent des langages plus particuliers comme FORTRAN, C, etc. Dans ces cas, vous ne voudrez peut‑être pas créer une caractéristique pour chaque valeur, mais seulement pour les occurrences les plus courantes.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)