or
To ćwiczenie jest częścią kursu
Ten rozdział wprowadza w świat Big Data oraz omawia różne koncepcje i frameworki służące do jego przetwarzania. Dowiesz się, dlaczego Apache Spark jest uważany za najlepszy framework do pracy z Big Data.
Główną abstrakcją oferowaną przez Spark jest odporny rozproszony zbiór danych (RDD) – podstawowy typ danych tego silnika. Ten rozdział przedstawia RDD oraz pokazuje, jak tworzyć je i wykonywać za pomocą transformacji i akcji RDD.
W tym rozdziale poznasz Spark SQL – moduł Spark przeznaczony do przetwarzania danych strukturalnych. Oferuje on abstrakcję programistyczną zwaną DataFrames i może działać jako rozproszony silnik zapytań SQL. Rozdział pokazuje, jak Spark SQL umożliwia korzystanie z DataFrames w Pythonie.
PySpark MLlib to skalowalna biblioteka uczenia maszynowego Apache Spark dla Pythona, zawierająca popularne algorytmy i narzędzia. W tym ostatnim rozdziale poznasz ważne algorytmy uczenia maszynowego. Zbudujesz silnik rekomendacji filmów i filtr antyspamowy, a także zastosujesz grupowanie metodą k-średnich.
Bieżące ćwiczenie