Lire des Dask DataFrames à partir de Parquet
Au chapitre 1, vous avez analysé des données Spotify, réparties dans plusieurs fichiers, pour trouver les plus grands succès de 2005 à 2020. Vous l'avez fait avec la fonction dask.delayed() et une boucle. Voyons à quel point cette analyse devient plus simple avec les Dask DataFrames.
dask.dataframe a été importé pour vous sous le nom dd.
Cette activité fait partie du cours
Programmation parallèle avec Dask en Python
Instructions de l’exercice
- Chargez le dossier de données Parquet situé à
"data/spotify_parquet". - Utilisez la méthode
.nlargest()du DataFrame pour trouver les 10 meilleures chansons selon'popularity'. - Convertissez l'objet différé en DataFrame pandas en le calculant.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)