Använda en DataFrame
I föregående övning såg du hur man delar upp en uppgift och använder det lågnivå-API:et multiprocessing.Pool i Python för att utföra beräkningar på flera processorenheter.
Det är viktigt att förstå detta på en lägre nivå, men i praktiken kommer du aldrig att använda den här typen av API:er. Ett smidigare sätt att parallellisera en apply-operation över flera grupper är att använda ramverket dask och dess abstraktion av pandas DataFrame.
DataFramen athlete_events från pandas finns tillgänglig i din arbetsmiljö.
Den här övningen är en del av kursen
Introduktion till datatekniker
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
import dask.dataframe as dd
# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)