Tableaux Dask à partir d'ensembles de données HDF5
On vous a confié l'analyse des précipitations en Europe au cours des 40 dernières années. La moyenne mensuelle des précipitations sur une grille de points en Europe vous est fournie au format HDF5. Comme ce fichier est assez volumineux, vous décidez de le charger et de le traiter avec Dask.
h5py a été importé pour vous, et dask.array a été importé sous le nom da.
Cette activité fait partie du cours
Programmation parallèle avec Dask en Python
Instructions de l’exercice
- Ouvrez le fichier
'data/era_eu.hdf5'avech5py. - Chargez la variable
'/precip'dans un tableau Dask à l'aide de la fonctionfrom_array(), et définissez des blocs (12 mois, 15 latitudes et 15 longitudes). - Utilisez le découpage de tableau pour sélectionner chaque 12e indice le long du premier axe — cela sélectionne les données de janvier pour toutes les années.
- Calculez la moyenne de
january_rainfallsle long de l'axe du temps (axe0) pour obtenir la moyenne des précipitations en janvier à l'échelle de l'Europe.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)
# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)
# Select only the months of January
january_rainfalls = ____[____]
# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)
plt.imshow(january_mean_rainfall.compute())
plt.show()