Ganzzahl-IDs für Filme vergeben
Machen wir dasselbe für die Filme. Anschließend verbinden wir die neuen User-IDs und Film-IDs in einem DataFrame.
Diese Übung ist Teil des Kurses
<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>Übungsanweisungen
- Verwende die Methoden
.select()und.distinct(), um alle eindeutigenMovies aus dem DataFrameratingszu extrahieren. - Repartioniere das DataFrame
moviesmitcoalesce()auf eine Partition. - Vervollständige den bereitgestellten Code, um jedem Film eine eindeutige ganze ID zuzuweisen. Nenne die neue Spalte
movieIdund rufe die Methode.persist()auf dem resultierenden DataFrame auf. - Führe einen Join des DataFrames
ratingsmitusersund anschließend mitmoviesdurch. Nenne das Ergebnismovie_ratings.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Extract the distinct movie id's
movies = ratings.select("____").distinct()
# Repartition the data to have only one partition.
movies = movies.coalesce(____)
# Create a new column of movieId integers.
movies = movies.withColumn("____", monotonically_increasing_id()).____()
# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()