Zacznij terazZacznij za darmo

Używanie DataFrame

W poprzednim ćwiczeniu zobaczyłeś, jak podzielić zadanie i skorzystać z niskopoziomowego API multiprocessing.Pool w Pythonie, aby wykonywać obliczenia na wielu jednostkach przetwarzających.

Warto rozumieć to na niższym poziomie, ale w praktyce rzadko kiedy sięga się po tego typu API. Wygodniejszym sposobem na zrównoleglenie operacji apply w obrębie wielu grup jest skorzystanie z frameworka dask i jego abstrakcji DataFrame wzorowanej na pandas.

DataFrame athlete_events z biblioteki pandas jest dostępny w twoim środowisku pracy.

To ćwiczenie jest częścią kursu

Wprowadzenie do inżynierii danych

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

import dask.dataframe as dd

# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)
Edytuj i uruchom kod