ПочатиПочніть безкоштовно

Масиви Dask з наборів даних HDF5

Вам доручили проаналізувати опади в Європі за останні 40 років. Для вас підготували середні місячні опади на сітці локацій по всій Європі у форматі HDF5. Оскільки файл доволі великий, ви вирішуєте завантажити й обробити його за допомогою Dask.

h5py уже імпортовано для вас, а dask.array імпортовано як da.

Ця вправа є частиною курсу

Паралельне програмування з Dask у Python

Переглянути курс

Інструкції до вправи

  • Відкрийте файл 'data/era_eu.hdf5' за допомогою h5py.
  • Завантажте змінну '/precip' у масив Dask за допомогою функції from_array(), установивши чанки розміром (12 місяців, 15 широт і 15 довгот).
  • Використайте зріз масиву, щоб вибрати кожен 12-й індекс уздовж першої осі — це вибирає дані за січень для всіх років.
  • Обчисліть середнє значення january_rainfalls уздовж часової осі (вісь 0), щоб отримати середні опади в січні по Європі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Open the HDF5 dataset using h5py
hdf5_file = ____.____(____)

# Load the file into a Dask array with a reasonable chunk size
precip = da.____(____, chunks=____)

# Select only the months of January
january_rainfalls = ____[____]

# Calculate the mean rainfall in January for each location
january_mean_rainfall = ____.____(axis=____)

plt.imshow(january_mean_rainfall.compute())
plt.show()
Редагувати та запускати код