ÎncepețiÎncepe gratuit

Pragul de similitudine

În acest exercițiu, și pe parcursul întregului capitol, vei lucra cu DataFrame-ul restaurants, care conține date despre diverse restaurante. Scopul final este să creezi un motor de recomandare a restaurantelor, însă mai întâi trebuie să cureți datele.

Această versiune a setului restaurants a fost colectată din mai multe surse, iar coloana cuisine_type este plină de greșeli de scriere și ar trebui să conțină doar tipurile de bucătărie italian, american și asian. Există atât de multe categorii unice, încât remaparea lor manuală nu este scalabilă – cel mai bine este să folosești similitudinea dintre șiruri de caractere.

Înainte de a face asta, vrei să stabilești pragul pentru scorul de similitudine, folosind funcția process.extract() din thefuzz, identificând scorul de similitudine al celui mai îndepărtat tip de greșeală din fiecare categorie.

Acest exercițiu face parte din cursul

Curățarea datelor în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
Editează și rulează codul