Масиви Dask з наборів даних HDF5
Вам доручили проаналізувати опади в Європі за останні 40 років. Для вас підготували середні місячні опади на сітці локацій по всій Європі у форматі HDF5. Оскільки файл доволі великий, ви вирішуєте завантажити й обробити його за допомогою Dask.
h5py уже імпортовано для вас, а dask.array імпортовано як da.
Ця вправа є частиною курсу
Паралельне програмування з Dask у Python
Інструкції до вправи
- Відкрийте файл
'data/era_eu.hdf5'за допомогоюh5py. - Завантажте змінну
'/precip'у масив Dask за допомогою функціїfrom_array(), установивши чанки розміром (12 місяців, 15 широт і 15 довгот). - Використайте зріз масиву, щоб вибрати кожен 12-й індекс уздовж першої осі — це вибирає дані за січень для всіх років.
- Обчисліть середнє значення
january_rainfallsуздовж часової осі (вісь0), щоб отримати середні опади в січні по Європі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)
# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)
# Select only the months of January
january_rainfalls = ____[____]
# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)
plt.imshow(january_mean_rainfall.compute())
plt.show()