Začněte nyníZačněte zdarma

Spojení s hodnoceními

Ve videoukázce jsi viděl/a, jak v PySparku používat transformace – konkrétně spojení tabulek film a ratings pro vytvoření nového sloupce s průměrným hodnocením na zákazníka. V tomto cvičení využiješ stejné techniky z videoukázky k tomu, aby ses dostal/a ještě dál: vypočítáš průměrné hodnocení pro každý film z tabulek film a ratings.

V pracovním prostoru máš k dispozici PySpark DataFrame s filmy film_df a PySpark DataFrame s hodnoceními rating_df.

Toto cvičení je součástí kurzu

Introduction to Data Engineering

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej průměrné hodnocení pro každé film_id a výsledek ulož do ratings_per_film_df.
  • Doplň příkaz .join() tak, aby spojení probíhalo přes sloupec film_id.
  • Zobraz prvních 5 výsledků vzniklého DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')

# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
    ratings_per_film_df,
    film_df.film_id==____
)

# Show the 5 first results
print(film_df_with_ratings.____)
Upravit a spustit kód