Tipurile de date pentru evaluări
Markus urmărește multe filme, printre care documentare, filme cu supereroi, clasice și drame. Bazându-te pe experiența anterioară cu Spark, folosește dataframe-ul markus_ratings, care conține date despre numărul de ori în care Markus a vizionat filme din diverse genuri, și gândește-te dacă acestea sunt evaluări implicite sau explicite. Folosește metoda groupBy() pentru a determina care gen are cel mai mare scor – lucru care ar putea influența recomandările pe care ALS le-ar genera pentru Markus.
Acest exercițiu face parte din cursul
Construiește motoare de recomandare cu PySpark
Instrucțiuni pentru exercițiu
- Folosește metoda
groupBy()pentru a grupa dataframe-ulmarkus_ratingsdupă"Genre". - Aplică metoda
.sum()pentru a obține numărul total de filme vizionate pentru fiecare gen. - Asigură-te că adaugi metoda
.show()la final pentru a vizualiza rezultatele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Group the data by "Genre"
markus_ratings.____("____").____().____()