Tablice Dask z zestawów danych HDF5
Masz za zadanie przeanalizować opady deszczu w Europie z ostatnich 40 lat. Miesięczne średnie opady dla siatki lokalizacji na terenie Europy zostały udostępnione w formacie HDF5. Ponieważ plik jest dość duży, zdecydujesz się wczytać i przetworzyć go za pomocą Dask.
Biblioteka h5py została już zaimportowana, a dask.array – jako da.
To ćwiczenie jest częścią kursu
Programowanie równoległe z Dask w Pythonie
Instrukcje do ćwiczenia
- Otwórz plik
'data/era_eu.hdf5'przy użyciuh5py. - Wczytaj zmienną
'/precip'do tablicy Dask za pomocą funkcjifrom_array()i ustaw fragmenty (chunks) o rozmiarze (12 miesięcy, 15 szerokości geograficznych i 15 długości geograficznych). - Użyj wycinania tablicy, aby wybrać co 12. indeks wzdłuż pierwszej osi – w ten sposób wybierzesz dane ze stycznia dla wszystkich lat.
- Oblicz średnią tablicy
january_rainfallswzdłuż osi czasu (oś0), aby wyznaczyć średnie opady w styczniu na terenie całej Europy.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)
# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)
# Select only the months of January
january_rainfalls = ____[____]
# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)
plt.imshow(january_mean_rainfall.compute())
plt.show()