Začněte nyníZačněte zdarma

Práce s DataFrame

V předchozím cvičení sis ukázal/a, jak rozdělit úlohu a využít nízkoúrovňové API multiprocessing.Pool pro výpočty na více procesorových jednotkách.

Je důležité tomuto přístupu rozumět na nízké úrovni, ale v praxi tato API přímo používat nebudeš. Pohodlnější způsob, jak paralelizovat operaci apply přes několik skupin, je použít framework dask a jeho abstrakci pandas DataFrame.

DataFrame athlete_events z knihovny pandas je dostupný v tvém pracovním prostoru.

Toto cvičení je součástí kurzu

Introduction to Data Engineering

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

import dask.dataframe as dd

# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)
Upravit a spustit kód