Використання DataFrame
У попередній вправі ви побачили, як розбити завдання на частини та використати низькорівневий API Python multiprocessing.Pool, щоб виконувати обчислення на кількох обчислювальних ядрах.
Розуміти це на низькому рівні важливо, але на практиці ви майже ніколи не користуватиметеся подібними API. Зручніший спосіб паралелізувати застосування функції до кількох груп — скористатися фреймворком dask і його абстракцією для pandas DataFrame, наприклад.
DataFrame pandas, athlete_events, доступний у вашому робочому середовищі.
Ця вправа є частиною курсу
Вступ до Data Engineering
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import dask.dataframe as dd
# Set the number of partitions
athlete_events_dask = dd.from_pandas(athlete_events, ____=____)