Dask arrays z HDF5 datasetů
Dostals/a za úkol analyzovat srážky v Evropě za posledních 40 let. K dispozici máš měsíční průměrné srážky v síti lokalit po celé Evropě ve formátu HDF5. Protože je tento soubor poměrně velký, rozhodneš se ho načíst a zpracovat pomocí Dasku.
h5py je již naimportováno a dask.array je naimportováno jako da.
Toto cvičení je součástí kurzu
Parallel Programming with Dask in Python
Pokyny k cvičení
- Otevři soubor
'data/era_eu.hdf5'pomocíh5py. - Načti proměnnou
'/precip'do Dask array pomocí funkcefrom_array()a nastav chunky (12 měsíců, 15 zeměpisných šířek a 15 zeměpisných délek). - Pomocí slicování pole vyber každý 12. index podél první osy – tím získáš lednová data za všechny roky.
- Vypočítej průměr
january_rainfallspodél časové osy (osa0), abys zjistil/a průměrné lednové srážky v celé Evropě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)
# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)
# Select only the months of January
january_rainfalls = ____[____]
# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)
plt.imshow(january_mean_rainfall.compute())
plt.show()