Länka ihop dem!
I den senaste lektionen slutförde du det tyngsta arbetet med att länka samman restaurants och restaurants_new. Du genererade olika par av potentiellt matchande rader, sökte efter exakta träffar i kolumnerna cuisine_type och city, och jämförde liknande strängar i kolumnen rest_name. DataFrame:en med poängen sparades i potential_matches.
Nu är det äntligen dags att länka samman de två DataFrame:arna. Du gör det genom att först extrahera alla radindex i restaurants_new som matchar över de nämnda kolumnerna från potential_matches. Sedan filtrerar du restaurants_new på dessa index och konkatenerar de icke-dubblerade värdena med restaurants. Alla DataFrame:ar finns tillgängliga i din miljö, tillsammans med pandas importerat som pd.
Den här övningen är en del av kursen
Datarensning i Python
Övningsinstruktioner
- Filtrera
potential_matchespå rader där radsumman är större än eller lika med 3 genom att använda metoden.sum(). - Extrahera det andra kolumnindexet från
matches, som representerar radindex för matchande poster irestaurants_new, med hjälp av metoden.get_level_values(). - Filtrera
restaurants_newpå rader som inte finns imatching_indices. - Konkatenera
restaurantsochnon_dup.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Isolate potential matches with row sum >=3
matches = ____[____.___(____) >= ____]
# Get values of second column index of matches
matching_indices = matches.____.____(____)
# Subset restaurants_new based on non-duplicate values
non_dup = ____[~restaurants_new.index.____(____)]
# Concatenate restaurants and non_dup
full_restaurants = pd.____([____, ____])
print(full_restaurants)