Zacznij terazZacznij za darmo

Punkt odcięcia

W tym ćwiczeniu – i przez cały ten rozdział – będziesz pracować z DataFrame restaurants, który zawiera dane o różnych restauracjach. Twoim ostatecznym celem jest stworzenie silnika rekomendacji restauracji, ale najpierw musisz oczyścić dane.

Ta wersja zbioru restaurants została zebrana z wielu źródeł. Kolumna cuisine_type jest pełna literówek i powinna zawierać wyłącznie wartości italian, american oraz asian. Unikalnych kategorii jest jednak tak wiele, że ręczne ich poprawianie nie jest skalowalne – najlepiej skorzystać z podobieństwa ciągów znaków.

Zanim to zrobisz, chcesz wyznaczyć punkt odcięcia dla oceny podobieństwa. Użyj funkcji process.extract() z biblioteki thefuzz, aby znaleźć wynik podobieństwa dla najbardziej odległej literówki w każdej kategorii.

To ćwiczenie jest częścią kursu

Czyszczenie danych w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
Edytuj i uruchom kod