Inizia subitoInizia gratis

Statistiche sintetiche su MSD

Familiarizziamo con il sottoinsieme Taste Profile di Million Songs Echo Nest. Per questo corso lo chiameremo semplicemente Million Songs dataset o msd. Ricaviamo il numero di utenti e il numero di brani. Vediamo anche quali brani hanno il maggior numero di riproduzioni in questo sottoinsieme.

Questo esercizio fa parte del corso

Costruire motori di raccomandazione con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Usa il metodo .show() per dare un'occhiata ai dati.
  • Completa il codice per contare il numero di userId distinti. Seleziona la colonna userId, poi chiama .distinct() e .count().
  • Ora fai lo stesso per gli songId, quindi conta il numero di songId distinti. Seleziona la colonna songId e chiama .distinct() e .count() su di essa.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Modifica ed esegui il codice