ÎncepețiÎncepe gratuit

Folosirea unui DataFrame

În exercițiul anterior, ai văzut cum să împarți o sarcină și să folosești API-ul de nivel scăzut multiprocessing.Pool din Python pentru a efectua calcule pe mai multe unități de procesare.

Este important să înțelegi acest lucru la un nivel mai de bază, dar în practică nu vei folosi niciodată astfel de API-uri direct. O modalitate mai convenabilă de a paraleliza o operație apply pe mai multe grupuri este să folosești framework-ul dask și abstractizarea sa asupra DataFrame-ului pandas, de exemplu.

DataFrame-ul pandas, athlete_events, este disponibil în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Introducere în Data Engineering

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

import dask.dataframe as dd

# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)
Editează și rulează codul