CommencezCommencez gratuitement

Utiliser un DataFrame

Dans l'exercice précédent, vous avez vu comment découper une tâche et utiliser l'API bas niveau multiprocessing.Pool de Python pour effectuer des calculs sur plusieurs unités de traitement.

Il est essentiel de comprendre ce niveau de détail, mais en pratique, vous n'utiliserez presque jamais ce type d'API. Une façon plus pratique de paralléliser un apply sur plusieurs groupes consiste, par exemple, à utiliser le cadre de travail dask et son abstraction du DataFrame pandas.

Le DataFrame pandas, athlete_events, est disponible dans votre espace de travail.

Cette activité fait partie du cours

Introduction à l'ingénierie des données

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

import dask.dataframe as dd

# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)
Modifier et exécuter le code