Pary restauracji
W poprzedniej lekcji wyczyściłeś zbiór danych restaurants, przygotowując go do budowy systemu rekomendacji restauracji. Masz teraz nową ramkę danych restaurants_new z nowymi restauracjami, na których wytrenujesz model – dane zostały pobrane z nowego źródła.
Kolumny cuisine_type i city wyczyściłeś już przy użyciu technik poznanych w tym kursie. Jednak w nazwach restauracji zauważono duplikaty z literówkami, które wymagają łączenia rekordów zamiast złączeń z restaurants.
W tym ćwiczeniu wykonasz pierwszy krok łączenia rekordów i wygenerujesz możliwe pary wierszy między restaurants a restaurants_new. W środowisku dostępne są obie ramki danych, pandas oraz recordlinkage.
To ćwiczenie jest częścią kursu
Czyszczenie danych w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create an indexer and object and find possible pairs
indexer = ____
# Block pairing on cuisine_type
indexer.____(____)
# Generate pairs
pairs = indexer.____(____, ____)