Utiliser un DataFrame
Dans l'exercice précédent, vous avez vu comment découper une tâche et utiliser l'API bas niveau multiprocessing.Pool de Python pour effectuer des calculs sur plusieurs unités de traitement.
Il est essentiel de comprendre ce niveau de détail, mais en pratique, vous n'utiliserez presque jamais ce type d'API. Une façon plus pratique de paralléliser un apply sur plusieurs groupes consiste, par exemple, à utiliser le cadre de travail dask et son abstraction du DataFrame pandas.
Le DataFrame pandas, athlete_events, est disponible dans votre espace de travail.
Cette activité fait partie du cours
Introduction à l'ingénierie des données
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
import dask.dataframe as dd
# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)