Typy dat hodnocení
Markus sleduje spoustu filmů – dokumenty, filmy o superhrdinech, klasiky i dramata. Využij své dosavadní zkušenosti se Sparkem a pracuj s dataframem markus_ratings, který obsahuje údaje o tom, kolikrát Markus viděl filmy v různých žánrech. Zamysli se nad tím, zda jde o implicitní, nebo explicitní hodnocení. Pomocí metody groupBy() zjisti, který žánr má nejvyšší hodnocení – to může zásadně ovlivnit, jaká doporučení ALS pro Markuse vygeneruje.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů s PySparkem
Pokyny k cvičení
- Pomocí metody
groupBy()seskup dataframemarkus_ratingspodle sloupce"Genre". - Použij metodu
.sum()pro získání celkového počtu zhlédnutých filmů v každém žánru. - Nezapomeň na konec přidat metodu
.show(), aby se výsledky zobrazily.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Group the data by "Genre"
markus_ratings.____("____").____().____()