EmpezarEmpieza gratis

Estadísticas resumen de MSD

Vamos a familiarizarnos con el subconjunto de datos Million Songs Echo Nest Taste Profile. Para este curso, lo llamaremos simplemente el conjunto de datos Million Songs o msd. Obtén el número de usuarios y el número de canciones. Veamos también qué canciones tienen más reproducciones en este subconjunto.

Este ejercicio forma parte del curso

Creación de motores de recomendación con PySpark

Ver curso

Instrucciones del ejercicio

  • Usa el método .show() para ver cómo es el conjunto de datos.
  • Completa el código para contar el número de userId distintos. Selecciona la columna userId y luego llama a .distinct() y .count().
  • Ahora haz lo mismo con los songId, es decir, cuenta el número de songId distintos. Selecciona la columna songId y llama a .distinct() y .count() sobre ella.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Editar y ejecutar código