CommencezCommencez gratuitement

Remappage des catégories II

Dans le dernier exercice, vous avez déterminé que le seuil de distance pour remapper les fautes de frappe des types de cuisine 'american', 'asian' et 'italian' enregistrés dans la colonne cuisine_type devait être de 80.

Dans cet exercice, vous allez tout rassembler en trouvant les correspondances dont le score de similarité est égal ou supérieur à 80 à l’aide de la fonction extract() de fuzywuzzy.process, pour chaque type de cuisine correct, puis en remplaçant ces correspondances par celui-ci. Rappelez-vous que, lorsque vous comparez une chaîne avec un tableau de chaînes à l’aide de process.extract(), la sortie est une liste de tuples, chacun étant au format :

(plus proche correspondance, score de similarité, indice de la correspondance)

Le DataFrame restaurants est déjà dans votre environnement, et vous avez accès à une liste categories contenant les types de cuisine corrects ('italian', 'asian' et 'american').

Cette activité fait partie du cours

Nettoyage des données en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Inspect the unique values of the cuisine_type column
print(____)
Modifier et exécuter le code