Datatyper för betyg
Markus ser många filmer – dokumentärer, superhjältefilmer, klassiker och dramafilmer. Använd din tidigare erfarenhet av Spark och dataframen markus_ratings, som innehåller data om hur många gånger Markus har sett filmer i olika genrer, och fundera på om det rör sig om implicita eller explicita betyg. Använd metoden groupBy() för att ta reda på vilken genre som har högst betyg – det kan ha stor påverkan på vilka rekommendationer ALS genererar för Markus.
Den här övningen är en del av kursen
Bygg rekommendationsmotorer med PySpark
Övningsinstruktioner
- Använd metoden
groupBy()för att gruppera dataframenmarkus_ratingsefter"Genre". - Använd metoden
.sum()för att beräkna det totala antalet sedda filmer per genre. - Lägg till metoden
.show()i slutet för att visa resultaten.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Group the data by "Genre"
markus_ratings.____("____").____().____()