Přiřazení celočíselných ID filmům
Udělejme totéž pro filmy. Pak spojíme nová uživatelská ID a ID filmů do jednoho dataframu.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů s PySparkem
Pokyny k cvičení
- Pomocí metod
.select()a.distinct()vyextrahuj všechny unikátní hodnotyMoviez dataframuratings. - Přerozděl dataframe
moviesna jeden oddíl pomocícoalesce(). - Doplň připravený kód tak, aby každému filmu přiřadil unikátní celočíselné ID. Nový sloupec pojmenuj
movieIda na výsledný dataframe zavolej metodu.persist(). - Spoj dataframe
ratingss dataframemusersa následně s dataframemmovies. Výsledek pojmenujmovie_ratings.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract the distinct movie id's
movies = ratings.select("____").distinct()
# Repartition the data to have only one partition.
movies = movies.coalesce(____)
# Create a new column of movieId integers.
movies = movies.withColumn("____", monotonically_increasing_id()).____()
# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()