ratings के साथ joining
वीडियो अभ्यास में, आपने देखा कि PySpark में transformations का उपयोग करके film और ratings टेबल्स को join कर एक नया कॉलम बनाया गया जो प्रति customer औसत rating स्टोर करता है.
इस अभ्यास में, आप film और ratings टेबल्स के बीच और अधिक synergy बनाएँगे। आप उसी तकनीक का उपयोग करेंगे जो आपने वीडियो में सीखी थी, ताकि हर film की औसत rating निकाली जा सके.
फिल्मों वाला PySpark DataFrame film_df और ratings वाला PySpark DataFrame rating_df आपके workspace में उपलब्ध हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Introduction to Data Engineering
अभ्यास निर्देश
- प्रत्येक
film_idके लिए mean rating लें, और परिणामratings_per_film_dfको assign करें. film_idकॉलम पर join करने के लिए.join()स्टेटमेंट को पूरा करें.- प्राप्त DataFrame के पहले
5परिणाम दिखाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)