or
Den här övningen är en del av kursen
Det här kapitlet introducerar Big Data och ger en översikt över de koncept och ramverk som används för att bearbeta Big Data. Du får förstå varför Apache Spark anses vara det bästa ramverket för Big Data.
Den centrala abstraktionen i Spark är en resilient distributed dataset (RDD), som är den grundläggande datatypen i motorn. Det här kapitlet introducerar RDD:er och visar hur de skapas och körs med hjälp av RDD-transformationer och -åtgärder.
I det här kapitlet lär du dig om Spark SQL – en Spark-modul för strukturerad databearbetning. Den erbjuder en programmeringsabstraktion som kallas DataFrames och kan även fungera som en distribuerad SQL-frågemotor. Kapitlet visar hur Spark SQL låter dig använda DataFrames i Python.
PySpark MLlib är Apache Sparks skalbara maskininlärningsbibliotek i Python och innehåller vanliga inlärningsalgoritmer och hjälpverktyg. Under det här sista kapitlet lär du dig viktiga maskininlärningsalgoritmer. Du bygger en filmrekommendationsmotor och ett skräppostfilter, och arbetar med k-means-klustring.
Aktuell övning