Tipe data rating
Markus menonton banyak film, termasuk dokumenter, film pahlawan super, klasik, dan drama. Berdasarkan pengalaman Anda sebelumnya dengan Spark, gunakan dataframe markus_ratings, yang memuat data jumlah kali Markus menonton film di berbagai genre, dan pertimbangkan apakah ini termasuk rating implisit atau eksplisit. Gunakan metode groupBy() untuk menentukan genre mana yang memiliki rating tertinggi, yang kemungkinan akan memengaruhi rekomendasi yang dihasilkan ALS untuk Markus.
Latihan ini merupakan bagian dari kursus
Membangun Recommendation Engine dengan PySpark
Instruksi latihan
- Gunakan metode
groupBy()untuk mengelompokkan dataframemarkus_ratingsberdasarkan"Genre". - Terapkan metode
.sum()untuk mendapatkan total jumlah film yang ditonton per genre. - Pastikan menambahkan metode
.show()di akhir untuk menampilkan hitungannya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Group the data by "Genre"
markus_ratings.____("____").____().____()