Tröskelvärdet
I den här övningen, och genom hela det här kapitlet, arbetar du med DataFrame:en restaurants som innehåller data om olika restauranger. Ditt slutliga mål är att bygga en restaurangrekommendationsmotor, men du behöver först rensa dina data.
Den här versionen av restaurants har samlats in från många källor, där kolumnen cuisine_type är full av stavfel och enbart ska innehålla kökstyper av typen italian, american och asian. Det finns så många unika kategorier att mappa om dem manuellt inte är skalbart – det är bättre att använda stränglikhet i stället.
Innan du gör det vill du fastställa tröskelvärdet för likhetspoängen. Det gör du med hjälp av funktionen process.extract() från thefuzz, genom att hitta likhetspoängen för den mest avlägsna stavfelsvarianten av varje kategori.
Den här övningen är en del av kursen
Datarensning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import process from thefuzz
____
# Store the unique values of cuisine_type in unique_types
unique_types = ____
# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))
# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))
# Calculate similarity of 'italian' to all values of unique_types
print(____)