Movies को integer id असाइन करना
आइए यही काम movies पर भी करें. फिर नए user IDs और movie IDs को जोड़कर एक ही dataframe में लाएँ.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Recommendation Engines बनाना
अभ्यास निर्देश
ratingsdataframe से सभी यूनिकMovies निकालने के लिए.select()और.distinct()मेथड्स का उपयोग करें.coalesce()का उपयोग करकेmoviesdataframe को एक ही partition में repartition करें.- दिए गए partial कोड को पूरा करें ताकि हर movie को यूनिक integer ID असाइन हो. नए कॉलम का नाम
movieIdरखें और resulting dataframe पर.persist()मेथड कॉल करें. ratingsdataframe कोusersdataframe से और उसके बादmoviesdataframe से join करें. परिणाम कोmovie_ratingsनाम दें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Extract the distinct movie id's
movies = ratings.select("____").distinct()
# Repartition the data to have only one partition.
movies = movies.coalesce(____)
# Create a new column of movieId integers.
movies = movies.withColumn("____", monotonically_increasing_id()).____()
# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()