Líné transformování trénovacích dat
Předzpracování vstupních proměnných je zásadním krokem v strojovém učení a často výrazně zlepší přesnost výsledného modelu. V posledních cvičeních bylo Spotify data předzpracováno za tebe – teď je ale důležité, abys to uměl/a udělat sám/sama.
V tomto cvičení použiješ objekt StandardScaler(), který transformuje sloupce pole tak, aby měly střední hodnotu nula a směrodatnou odchylku jedna.
Dask DataFrame se skladbami ze Spotify je v tvém prostředí dostupný jako dask_df. Obsahuje jak cílové skóre popularity, tak vstupní proměnné, které slouží k jeho předpovídání.
Toto cvičení je součástí kurzu
Parallel Programming with Dask in Python
Pokyny k cvičení
- Importuj třídu
StandardScaler()zdask_ml.preprocessing. - Vyber sloupec
'popularity'z DataFrame a přiřaď ho do proměnnéy. - Vytvoř objekt
StandardScalera natrénuj ho na datechX. - Použij škálovač k transformaci
X.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)