CommencezCommencez gratuitement

Le point de coupure

Dans cet exercice, et tout au long de ce chapitre, vous allez travailler avec le DataFrame restaurants, qui contient des données sur divers restaurants. Votre objectif final est de créer un moteur de recommandation de restaurants, mais vous devez d’abord nettoyer vos données.

Cette version de restaurants provient de plusieurs sources, et la colonne cuisine_type est truffée de fautes de frappe; elle ne devrait pourtant contenir que les types de cuisine italian, american et asian. Il y a tellement de catégories uniques que les remapper à la main n’est pas viable; mieux vaut utiliser la similarité de chaînes.

Avant de le faire, vous voulez déterminer le point de coupure du score de similarité en utilisant la fonction process.extract() de thefuzz, en trouvant le score de similarité de la faute de frappe la plus éloignée pour chaque catégorie.

Cette activité fait partie du cours

Nettoyage des données en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
Modifier et exécuter le code