Mulai sekarangMulai gratis

Hitung sparsity

Seperti yang Anda ketahui, ALS bekerja baik dengan himpunan data yang jarang (sparse). Mari kita lihat seberapa banyak matriks ratings yang sebenarnya kosong.

Ingat bahwa sparsity dihitung dengan jumlah sel dalam sebuah matriks yang berisi rating dibagi total jumlah nilai yang dapat ditampung matriks tersebut berdasarkan jumlah pengguna dan item (film). Dengan kata lain, membagi jumlah rating yang ada dalam matriks dengan hasil kali jumlah pengguna dan jumlah film dalam matriks, lalu mengurangkannya dari 1 akan memberikan kita nilai sparsity atau persentase bagian matriks ratings yang kosong.

Latihan ini merupakan bagian dari kursus

Membangun Recommendation Engine dengan PySpark

Lihat Kursus

Instruksi latihan

  • Hitung numerator untuk metrik sparsity dengan menghitung total jumlah rating yang terdapat dalam matriks ratings.
  • Hitung jumlah distinct() userIds dan distinct() movieIds dalam matriks ratings.
  • Hitung denominator untuk metrik sparsity dengan mengalikan jumlah pengguna dengan jumlah film dalam matriks ratings.
  • Hitung dan cetak nilai sparsity dengan membagi numerator oleh denominator, mengurangkannya dari 1, dan mengalikannya dengan 100. Angka 1.0 ditambahkan untuk memastikan sparsity dikembalikan sebagai bilangan desimal, bukan bilangan bulat.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Count the total number of ratings in the dataset
numerator = ____.select("____").count()

# Count the number of distinct userIds and distinct movieIds
num_users = ____.select("____").____().count()
num_movies = ____.select("____").____().count()

# Set the denominator equal to the number of users multiplied by the number of movies
denominator = ____ * ____

# Divide the numerator by the denominator
sparsity = (1.0 - (____ *1.0)/____)*100
print("The ratings dataframe is ", "%.2f" % sparsity + "% empty.")
Edit dan Jalankan Kode