LoslegenKostenlos starten

Ganzzahl-IDs für Filme vergeben

Machen wir dasselbe für die Filme. Anschließend verbinden wir die neuen User-IDs und Film-IDs in einem DataFrame.

Diese Übung ist Teil des Kurses

<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>
Kurs ansehen

Übungsanweisungen

  • Verwende die Methoden .select() und .distinct(), um alle eindeutigen Movies aus dem DataFrame ratings zu extrahieren.
  • Repartioniere das DataFrame movies mit coalesce() auf eine Partition.
  • Vervollständige den bereitgestellten Code, um jedem Film eine eindeutige ganze ID zuzuweisen. Nenne die neue Spalte movieId und rufe die Methode .persist() auf dem resultierenden DataFrame auf.
  • Führe einen Join des DataFrames ratings mit users und anschließend mit movies durch. Nenne das Ergebnis movie_ratings.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Extract the distinct movie id's
movies = ratings.select("____").distinct() 

# Repartition the data to have only one partition.
movies = movies.coalesce(____) 

# Create a new column of movieId integers. 
movies = movies.withColumn("____", monotonically_increasing_id()).____() 

# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()
Code bearbeiten und ausführen