НачатьНачать бесплатно

Объединение с рейтингами

В видеоуроке вы увидели, как применять преобразования в PySpark: таблицы film и ratings объединялись для создания нового столбца со средним рейтингом по каждому клиенту. В этом упражнении вы продолжите работу с таблицами film и ratings, используя те же приёмы, чтобы вычислить средний рейтинг для каждого фильма.

DataFrame PySpark с фильмами film_df и DataFrame PySpark с рейтингами rating_df уже доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Введение в дата-инжиниринг

Посмотреть курс

Инструкции к упражнению

  • Вычислите средний рейтинг для каждого film_id и сохраните результат в ratings_per_film_df.
  • Заполните метод .join(), чтобы выполнить объединение по столбцу film_id.
  • Выведите первые 5 строк полученного DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')

# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
    ratings_per_film_df,
    film_df.film_id==____
)

# Show the 5 first results
print(film_df_with_ratings.____)
Редактировать и запускать код