Mulai sekarangMulai gratis

Statistik Ringkas MovieLens

Mari kita gunakan metode groupBy() sedikit lebih jauh.

Setelah Anda menerapkan metode .groupBy() pada sebuah dataframe, Anda dapat menjalankan fungsi agregasi seperti .sum(), .avg(), .min() dan hasilnya akan dikelompokkan. Latihan ini akan memandu Anda melalui cara melakukannya. Fungsi min dan avg telah diimpor dari pyspark.sql.functions untuk Anda.

Latihan ini merupakan bagian dari kursus

Membangun Recommendation Engine dengan PySpark

Lihat Kursus

Instruksi latihan

  • Kelompokkan data berdasarkan movieId dan gunakan metode .count() untuk menghitung berapa banyak rating yang diterima setiap film. Setelah itu, panggil metode .select() untuk memilih metrik berikut:
    • min("count") untuk mendapatkan jumlah rating paling sedikit yang dimiliki film mana pun dalam himpunan data. Yang pertama ini diberikan sebagai contoh untuk Anda.
    • avg("count") untuk mendapatkan jumlah rata-rata rating per film
  • Lakukan hal yang sama, tetapi kali ini kelompokkan berdasarkan userId untuk mendapatkan jumlah rating min dan avg.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Min num ratings for movies
print("Movie with the fewest ratings: ")
ratings.groupBy("movieId").count().select(min("count")).show()

# Avg num ratings per movie
print("Avg num ratings per movie: ")
____.groupBy("____").count().____(avg("____")).____()

# Min num ratings for user
print("User with the fewest ratings: ")
ratings.____("userId").____().select(____("____")).____()

# Avg num ratings per users
print("Avg num ratings per user: ")
____.____("____").____().____(____("____")).____()
Edit dan Jalankan Kode