Začněte nyníZačněte zdarma

Práce s DataFrames

Základní datovou strukturou Sparku je Resilient Distributed Dataset (RDD). Jde o nízkoúrovňový objekt, který Sparku umožňuje rozdělit data mezi více uzlů v clusteru. Přímá práce s RDD je ale poměrně náročná, a proto v tomto kurzu budeme používat abstrakci Spark DataFrame, která je na RDD postavena.

Spark DataFrame byl navržen tak, aby se choval hodně jako SQL tabulka (tabulka s proměnnými ve sloupcích a pozorováními v řádcích). DataFrames jsou nejen srozumitelnější, ale také lépe optimalizované pro složité operace než RDD.

Při úpravách a kombinování sloupců a řádků dat existuje mnoho způsobů, jak dojít ke stejnému výsledku – některé ale trvají výrazně déle než jiné. Při práci s RDD musí datový vědec sám přijít na to, jak dotaz správně optimalizovat. DataFrame implementace má naopak velkou část této optimalizace zabudovanou přímo v sobě!

Pro začátek práce se Spark DataFrames je potřeba nejprve vytvořit objekt SparkSession ze svého SparkContext. SparkContext si můžeš představit jako připojení ke clusteru a SparkSession jako rozhraní pro práci s tímto připojením.

Pamatuj, že po zbytek kurzu budeš mít v pracovním prostředí k dispozici SparkSession s názvem spark!

Která z následujících možností je výhodou Spark DataFrames oproti RDD?

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení