Práce s DataFrame
V předchozím cvičení sis ukázal/a, jak rozdělit úlohu a využít nízkoúrovňové API multiprocessing.Pool pro výpočty na více procesorových jednotkách.
Je důležité tomuto přístupu rozumět na nízké úrovni, ale v praxi tato API přímo používat nebudeš. Pohodlnější způsob, jak paralelizovat operaci apply přes několik skupin, je použít framework dask a jeho abstrakci pandas DataFrame.
DataFrame athlete_events z knihovny pandas je dostupný v tvém pracovním prostoru.
Toto cvičení je součástí kurzu
Introduction to Data Engineering
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
import dask.dataframe as dd
# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)