Punkt odcięcia
W tym ćwiczeniu – i przez cały ten rozdział – będziesz pracować z DataFrame restaurants, który zawiera dane o różnych restauracjach. Twoim ostatecznym celem jest stworzenie silnika rekomendacji restauracji, ale najpierw musisz oczyścić dane.
Ta wersja zbioru restaurants została zebrana z wielu źródeł. Kolumna cuisine_type jest pełna literówek i powinna zawierać wyłącznie wartości italian, american oraz asian. Unikalnych kategorii jest jednak tak wiele, że ręczne ich poprawianie nie jest skalowalne – najlepiej skorzystać z podobieństwa ciągów znaków.
Zanim to zrobisz, chcesz wyznaczyć punkt odcięcia dla oceny podobieństwa. Użyj funkcji process.extract() z biblioteki thefuzz, aby znaleźć wynik podobieństwa dla najbardziej odległej literówki w każdej kategorii.
To ćwiczenie jest częścią kursu
Czyszczenie danych w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import process from thefuzz
____
# Store the unique values of cuisine_type in unique_types
unique_types = ____
# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))
# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))
# Calculate similarity of 'italian' to all values of unique_types
print(____)