or
Toto cvičení je součástí kurzu
Tato kapitola tě uvede do fascinujícího světa velkých dat a představí různé koncepty a frameworky pro jejich zpracování. Pochopíš, proč je Apache Spark považován za nejlepší framework pro Big Data.
Základní abstrakcí, kterou Spark nabízí, je resilient distributed dataset (RDD) – klíčový datový typ tohoto enginu. Tato kapitola představuje RDD a ukazuje, jak je vytvářet a používat prostřednictvím transformací a akcí nad RDD.
V této kapitole se naučíš pracovat se Spark SQL – modulem Sparku pro zpracování strukturovaných dat. Poskytuje programovací abstrakci zvanou DataFrames a dokáže fungovat také jako distribuovaný SQL dotazovací engine. Kapitola ukazuje, jak Spark SQL umožňuje pracovat s DataFrames v Pythonu.
PySpark MLlib je škálovatelná knihovna strojového učení pro Apache Spark v Pythonu, která obsahuje běžné algoritmy a nástroje pro učení. V průběhu této poslední kapitoly se naučíš důležité algoritmy strojového učení. Sestavíš engine pro doporučování filmů a filtr spamu a vyzkoušíš shlukování metodou k-means.
Aktuální cvičení