or
To ćwiczenie jest częścią kursu
Spark to framework do pracy z Big Data. W tym rozdziale poznasz podstawy Sparka i uczenia maszynowego. Dowiesz się też, jak połączyć się ze Sparkiem za pomocą Pythona i wczytać dane w formacie CSV.
Znając już sposoby wczytywania danych do Sparka, przejdziesz do budowania dwóch typów modeli klasyfikacyjnych: drzew decyzyjnych i regresji logistycznej. Poznasz również kilka podejść do przygotowania danych.
Następnie nauczysz się tworzyć modele regresji liniowej. Dowiesz się, jak wzbogacić swoje dane przez inżynierię nowych predyktorów oraz jak w sposób niezawodny wybrać tylko te najbardziej istotne.
Bieżące ćwiczenie
Na koniec nauczysz się, jak zwiększyć efektywność swoich modeli. Dowiesz się, jak używać potoków, by kod był czytelniejszy i łatwiejszy w utrzymaniu. Następnie zastosujesz kroswalidację do dokładniejszego testowania modeli i doboru ich parametrów. Na zakończenie zapoznasz się z dwoma typami modeli zespołowych.