Kom igångKom igång gratis

Länka ihop dem!

I den senaste lektionen slutförde du det tyngsta arbetet med att länka samman restaurants och restaurants_new. Du genererade olika par av potentiellt matchande rader, sökte efter exakta träffar i kolumnerna cuisine_type och city, och jämförde liknande strängar i kolumnen rest_name. DataFrame:en med poängen sparades i potential_matches.

Nu är det äntligen dags att länka samman de två DataFrame:arna. Du gör det genom att först extrahera alla radindex i restaurants_new som matchar över de nämnda kolumnerna från potential_matches. Sedan filtrerar du restaurants_new på dessa index och konkatenerar de icke-dubblerade värdena med restaurants. Alla DataFrame:ar finns tillgängliga i din miljö, tillsammans med pandas importerat som pd.

Den här övningen är en del av kursen

Datarensning i Python

Visa kurs

Övningsinstruktioner

  • Filtrera potential_matches på rader där radsumman är större än eller lika med 3 genom att använda metoden .sum().
  • Extrahera det andra kolumnindexet från matches, som representerar radindex för matchande poster i restaurants_new, med hjälp av metoden .get_level_values().
  • Filtrera restaurants_new på rader som inte finns i matching_indices.
  • Konkatenera restaurants och non_dup.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Isolate potential matches with row sum >=3
matches = ____[____.___(____) >= ____]

# Get values of second column index of matches
matching_indices = matches.____.____(____)

# Subset restaurants_new based on non-duplicate values
non_dup = ____[~restaurants_new.index.____(____)]

# Concatenate restaurants and non_dup
full_restaurants = pd.____([____, ____])
print(full_restaurants)
Redigera och kör kod