НачатьНачать бесплатно

Присвоение целочисленных идентификаторов фильмам

Теперь проделаем то же самое для фильмов, а затем объединим новые идентификаторы пользователей и фильмов в один датафрейм.

Это упражнение является частью курса

Построение рекомендательных систем с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Используйте методы .select() и .distinct(), чтобы извлечь все уникальные значения Movie из датафрейма ratings.
  • Перераспределите датафрейм movies на один раздел с помощью coalesce().
  • Дополните предоставленный код, чтобы присвоить каждому фильму уникальный целочисленный идентификатор. Назовите новый столбец movieId и вызовите метод .persist() на полученном датафрейме.
  • Объедините датафрейм ratings с датафреймом users, а затем с датафреймом movies. Назовите результат movie_ratings.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Extract the distinct movie id's
movies = ratings.select("____").distinct() 

# Repartition the data to have only one partition.
movies = movies.coalesce(____) 

# Create a new column of movieId integers. 
movies = movies.withColumn("____", monotonically_increasing_id()).____() 

# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()
Редактировать и запускать код