Zacznij terazZacznij za darmo

Tablice Dask z zestawów danych HDF5

Masz za zadanie przeanalizować opady deszczu w Europie z ostatnich 40 lat. Miesięczne średnie opady dla siatki lokalizacji na terenie Europy zostały udostępnione w formacie HDF5. Ponieważ plik jest dość duży, zdecydujesz się wczytać i przetworzyć go za pomocą Dask.

Biblioteka h5py została już zaimportowana, a dask.array – jako da.

To ćwiczenie jest częścią kursu

Programowanie równoległe z Dask w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Otwórz plik 'data/era_eu.hdf5' przy użyciu h5py.
  • Wczytaj zmienną '/precip' do tablicy Dask za pomocą funkcji from_array() i ustaw fragmenty (chunks) o rozmiarze (12 miesięcy, 15 szerokości geograficznych i 15 długości geograficznych).
  • Użyj wycinania tablicy, aby wybrać co 12. indeks wzdłuż pierwszej osi – w ten sposób wybierzesz dane ze stycznia dla wszystkich lat.
  • Oblicz średnią tablicy january_rainfalls wzdłuż osi czasu (oś 0), aby wyznaczyć średnie opady w styczniu na terenie całej Europy.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)

# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)

# Select only the months of January
january_rainfalls = ____[____]

# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)

plt.imshow(january_mean_rainfall.compute())
plt.show()
Edytuj i uruchom kod