Объединение с рейтингами
В видеоуроке вы увидели, как применять преобразования в PySpark: таблицы film и ratings объединялись для создания нового столбца со средним рейтингом по каждому клиенту.
В этом упражнении вы продолжите работу с таблицами film и ratings, используя те же приёмы, чтобы вычислить средний рейтинг для каждого фильма.
DataFrame PySpark с фильмами film_df и DataFrame PySpark с рейтингами rating_df уже доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Введение в дата-инжиниринг
Инструкции к упражнению
- Вычислите средний рейтинг для каждого
film_idи сохраните результат вratings_per_film_df. - Заполните метод
.join(), чтобы выполнить объединение по столбцуfilm_id. - Выведите первые
5строк полученного DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)