Mulai sekarangMulai gratis

Metode GroupBy dan Filter

Sekarang setelah kita mengetahui sedikit lebih banyak tentang himpunan data ini, mari kita lihat beberapa metrik ringkasan umum dari himpunan data ratings dan lihat berapa banyak rating yang dimiliki film serta berapa banyak rating yang diberikan setiap pengguna.

Dua metode umum yang akan membantu Anda saat mengagregasikan statistik ringkasan di Spark adalah metode .filter() dan .groupBy(). Metode .filter() memungkinkan Anda menyaring data yang tidak memenuhi kriteria yang Anda tentukan.

Latihan ini merupakan bagian dari kursus

Membangun Recommendation Engine dengan PySpark

Lihat Kursus

Instruksi latihan

  • Impor col dari pyspark.sql.functions, dan tampilkan himpunan data ratings menggunakan .show().
  • Terapkan metode .filter() pada himpunan data ratings dengan filter berikut di dalam tanda kurung agar hanya menyertakan userId yang kurang dari 100: col("userId") < 100.
  • Panggil metode .groupBy() pada himpunan data ratings untuk mengelompokkan data berdasarkan userId. Panggil metode .count() untuk melihat berapa banyak film yang telah diberi rating oleh setiap userId.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Edit dan Jalankan Kode