Datentypen von Bewertungen
Markus schaut viele Filme, darunter Dokus, Superheldenfilme, Klassiker und Dramen. Greife auf deine bisherigen Spark-Erfahrungen zurück und nutze das DataFrame markus_ratings, das enthält, wie oft Markus Filme in verschiedenen Genres gesehen hat, und überlege, ob es sich dabei um implizite oder explizite Bewertungen handelt. Verwende die Methode groupBy(), um festzustellen, welches Genre die höchste Bewertung hat – das könnte beeinflussen, welche Empfehlungen ALS für Markus generieren würde.
Diese Übung ist Teil des Kurses
<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>Übungsanweisungen
- Verwende die Methode
groupBy(), um das DataFramemarkus_ratingsnach"Genre"zu gruppieren. - Wende die Methode
.sum()an, um die Gesamtanzahl der gesehenen Filme je Genre zu erhalten. - Füge am Ende unbedingt
.show()hinzu, um dir die Zählwerte anzeigen zu lassen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Group the data by "Genre"
markus_ratings.____("____").____().____()