Sammanslagning med betyg
I videoövningen såg du hur man använder transformationer i PySpark genom att slå ihop tabellerna film och ratings för att skapa en ny kolumn med det genomsnittliga betyget per kund.
I den här övningen ska du skapa fler synergier mellan tabellerna film och ratings – med samma tekniker som du lärde dig i videon – för att beräkna genomsnittsbetyget för varje film.
PySpark DataFrame:en med filmer, film_df, och PySpark DataFrame:en med betyg, rating_df, finns tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Introduktion till datatekniker
Övningsinstruktioner
- Beräkna medelbetyget per
film_idoch tilldela resultatet tillratings_per_film_df. - Fyll i
.join()-uttrycket för att slå ihop tabellerna på kolumnenfilm_id. - Visa de första
5resultaten i den resulterande DataFrame:en.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)