Spojení s hodnoceními
Ve videoukázce jsi viděl/a, jak v PySparku používat transformace – konkrétně spojení tabulek film a ratings pro vytvoření nového sloupce s průměrným hodnocením na zákazníka.
V tomto cvičení využiješ stejné techniky z videoukázky k tomu, aby ses dostal/a ještě dál: vypočítáš průměrné hodnocení pro každý film z tabulek film a ratings.
V pracovním prostoru máš k dispozici PySpark DataFrame s filmy film_df a PySpark DataFrame s hodnoceními rating_df.
Toto cvičení je součástí kurzu
Introduction to Data Engineering
Pokyny k cvičení
- Vypočítej průměrné hodnocení pro každé
film_ida výsledek ulož doratings_per_film_df. - Doplň příkaz
.join()tak, aby spojení probíhalo přes sloupecfilm_id. - Zobraz prvních
5výsledků vzniklého DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)