Używanie DataFrame
W poprzednim ćwiczeniu zobaczyłeś, jak podzielić zadanie i skorzystać z niskopoziomowego API multiprocessing.Pool w Pythonie, aby wykonywać obliczenia na wielu jednostkach przetwarzających.
Warto rozumieć to na niższym poziomie, ale w praktyce rzadko kiedy sięga się po tego typu API. Wygodniejszym sposobem na zrównoleglenie operacji apply w obrębie wielu grup jest skorzystanie z frameworka dask i jego abstrakcji DataFrame wzorowanej na pandas.
DataFrame athlete_events z biblioteki pandas jest dostępny w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Wprowadzenie do inżynierii danych
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import dask.dataframe as dd
# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)