Metode GroupBy dan Filter
Sekarang setelah kita mengetahui sedikit lebih banyak tentang himpunan data ini, mari kita lihat beberapa metrik ringkasan umum dari himpunan data ratings dan lihat berapa banyak rating yang dimiliki film serta berapa banyak rating yang diberikan setiap pengguna.
Dua metode umum yang akan membantu Anda saat mengagregasikan statistik ringkasan di Spark adalah metode .filter() dan .groupBy(). Metode .filter() memungkinkan Anda menyaring data yang tidak memenuhi kriteria yang Anda tentukan.
Latihan ini merupakan bagian dari kursus
Membangun Recommendation Engine dengan PySpark
Instruksi latihan
- Impor
coldaripyspark.sql.functions, dan tampilkan himpunan dataratingsmenggunakan.show(). - Terapkan metode
.filter()pada himpunan dataratingsdengan filter berikut di dalam tanda kurung agar hanya menyertakanuserIdyang kurang dari 100:col("userId") < 100. - Panggil metode
.groupBy()pada himpunan dataratingsuntuk mengelompokkan data berdasarkanuserId. Panggil metode.count()untuk melihat berapa banyak film yang telah diberi rating oleh setiapuserId.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()