Zacznij terazZacznij za darmo

Trenowanie modelu liniowego za pomocą Dask

Dask umożliwia trenowanie modeli uczenia maszynowego na zbiorach danych zbyt dużych, by zmieścić się w pamięci. Pozwala też rozłożyć ładowanie danych, przetwarzanie wstępne i trenowanie na wiele wątków, procesów, a nawet wielu komputerów.

Twoim zadaniem jest wytrenowanie modelu uczenia maszynowego, który będzie przewidywał popularność utworów w zbiorze danych Spotify używanym w poprzednich rozdziałach. Dane zostały już wczytane jako leniwe ramki danych Dask. Zmienne wejściowe są dostępne jako dask_X i zawierają kilka kolumn liczbowych, takich jak tempo i taneczność utworu. Wartości docelowe są dostępne jako dask_y i odpowiadają ocenie popularności każdego utworu.

To ćwiczenie jest częścią kursu

Programowanie równoległe z Dask w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę SGDRegressor z sklearn.linear_model oraz klasę Incremental z dask_ml.wrappers.
  • Utwórz model regresji liniowej SGDRegressor.
  • Użyj klasy Incremental, aby opakować model tak, by można go było trenować na zbiorze danych Dask, i ustaw parametr scoring na 'neg_mean_squared_error'.
  • Dopasuj opakowany model, wykonując tylko jedną pętlę przez dane.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the SGDRegressor and the Incremental wrapper
from ____ import ____
from ____ import ____

# Create a SGDRegressor model
model = ____

# Wrap the model so that it works with Dask
dask_model = ____

# Fit the wrapped model
dask_model.____
Edytuj i uruchom kod