Práce s DataFrames
Základní datovou strukturou Sparku je Resilient Distributed Dataset (RDD). Jde o nízkoúrovňový objekt, který Sparku umožňuje rozdělit data mezi více uzlů v clusteru. Přímá práce s RDD je ale poměrně náročná, a proto v tomto kurzu budeme používat abstrakci Spark DataFrame, která je na RDD postavena.
Spark DataFrame byl navržen tak, aby se choval hodně jako SQL tabulka (tabulka s proměnnými ve sloupcích a pozorováními v řádcích). DataFrames jsou nejen srozumitelnější, ale také lépe optimalizované pro složité operace než RDD.
Při úpravách a kombinování sloupců a řádků dat existuje mnoho způsobů, jak dojít ke stejnému výsledku – některé ale trvají výrazně déle než jiné. Při práci s RDD musí datový vědec sám přijít na to, jak dotaz správně optimalizovat. DataFrame implementace má naopak velkou část této optimalizace zabudovanou přímo v sobě!
Pro začátek práce se Spark DataFrames je potřeba nejprve vytvořit objekt SparkSession ze svého SparkContext. SparkContext si můžeš představit jako připojení ke clusteru a SparkSession jako rozhraní pro práci s tímto připojením.
Pamatuj, že po zbytek kurzu budeš mít v pracovním prostředí k dispozici SparkSession s názvem spark!
Která z následujících možností je výhodou Spark DataFrames oproti RDD?
Toto cvičení je součástí kurzu
Foundations of PySpark
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení