CommencezCommencez gratuitement

Lire des Dask DataFrames à partir de Parquet

Au chapitre 1, vous avez analysé des données Spotify, réparties dans plusieurs fichiers, pour trouver les plus grands succès de 2005 à 2020. Vous l'avez fait avec la fonction dask.delayed() et une boucle. Voyons à quel point cette analyse devient plus simple avec les Dask DataFrames.

dask.dataframe a été importé pour vous sous le nom dd.

Cette activité fait partie du cours

Programmation parallèle avec Dask en Python

Voir le cours

Instructions de l’exercice

  • Chargez le dossier de données Parquet situé à "data/spotify_parquet".
  • Utilisez la méthode .nlargest() du DataFrame pour trouver les 10 meilleures chansons selon 'popularity'.
  • Convertissez l'objet différé en DataFrame pandas en le calculant.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Modifier et exécuter le code