Zacznij terazZacznij za darmo

Przypisywanie identyfikatorów całkowitoliczbowych do filmów

Zróbmy to samo dla filmów. Następnie połączymy nowe identyfikatory użytkowników i filmów w jeden DataFrame.

To ćwiczenie jest częścią kursu

Budowanie silników rekomendacji w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj metod .select() i .distinct(), aby wyodrębnić wszystkie unikalne wartości Movie z DataFrame ratings.
  • Podziel DataFrame movies na jedną partycję za pomocą coalesce().
  • Uzupełnij podany częściowy kod, aby przypisać unikalne identyfikatory całkowitoliczbowe do każdego filmu. Nadaj nowej kolumnie nazwę movieId i wywołaj metodę .persist() na wynikowym DataFrame.
  • Połącz DataFrame ratings z DataFrame users, a następnie z DataFrame movies. Wynik nazwij movie_ratings.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract the distinct movie id's
movies = ratings.select("____").distinct() 

# Repartition the data to have only one partition.
movies = movies.coalesce(____) 

# Create a new column of movieId integers. 
movies = movies.withColumn("____", monotonically_increasing_id()).____() 

# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()
Edytuj i uruchom kod