Potoki uczenia maszynowego
W kolejnych dwóch rozdziałach przejdziesz przez każdy etap potoku uczenia maszynowego – od wczytania danych aż po ocenę modelu. Do dzieła!
Podstawę modułu pyspark.ml stanowią klasy Transformer i Estimator. Niemal każda inna klasa w tym module działa podobnie do tych dwóch.
Klasy Transformer mają metodę .transform(), która przyjmuje DataFrame i zwraca nowy DataFrame – zazwyczaj jest to oryginalny DataFrame z dołączoną nową kolumną. Na przykład możesz użyć klasy Bucketizer, aby podzielić ciągłą cechę na dyskretne przedziały, albo klasy PCA, aby zredukować wymiarowość zbioru danych metodą analizy głównych składowych.
Klasy Estimator implementują metodę .fit(). Te metody również przyjmują DataFrame, ale zamiast zwracać kolejny DataFrame, zwracają obiekt modelu. Może to być na przykład StringIndexerModel – służący do uwzględnienia w modelach danych kategorycznych zapisanych jako ciągi znaków – lub RandomForestModel, który używa algorytmu lasów losowych do klasyfikacji albo regresji.
Które z poniższych stwierdzeń na temat uczenia maszynowego w Sparku nie jest prawdziwe?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie