Gegevenstypen van beoordelingen
Markus kijkt veel films, zoals documentaires, superheldenfilms, klassiekers en drama’s. Gebruik je eerdere ervaring met Spark en de dataframe markus_ratings, die data bevat over hoe vaak Markus films in verschillende genres heeft gezien, en denk na over of dit impliciete of expliciete beoordelingen zijn. Gebruik de methode groupBy() om te bepalen welk genre de hoogste beoordeling heeft, wat waarschijnlijk invloed heeft op welke aanbevelingen ALS voor Markus zou genereren.
Deze oefening maakt deel uit van de cursus
Aanbevelingssystemen bouwen met PySpark
Oefeninstructies
- Gebruik de methode
groupBy()om de dataframemarkus_ratingste groeperen op"Genre". - Pas de methode
.sum()toe om het totale aantal bekeken films per genre te krijgen. - Voeg tot slot de methode
.show()toe om de aantallen te bekijken.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Group the data by "Genre"
markus_ratings.____("____").____().____()