CommencezCommencez gratuitement

Gérer les catégories peu fréquentes

Certaines caractéristiques peuvent comporter de très nombreuses catégories, avec une distribution très inégale de leurs occurrences. Prenez par exemple les langages préférés en Data Science : les choix courants sont Python, R et Julia, mais certaines personnes utilisent des langages plus particuliers comme FORTRAN, C, etc. Dans ces cas, vous ne voudrez peut‑être pas créer une caractéristique pour chaque valeur, mais seulement pour les occurrences les plus courantes.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
Modifier et exécuter le code