ÎncepețiÎncepe gratuit

Utilizarea DataFrame-urilor

Structura de date de bază din Spark este Resilient Distributed Dataset (RDD). Acesta este un obiect de nivel scăzut care permite Spark să împartă datele între mai multe noduri din cluster. Cu toate acestea, RDD-urile sunt dificil de utilizat direct, așa că în acest curs vei folosi abstracția Spark DataFrame, construită peste RDD-uri.

Spark DataFrame a fost proiectat să se comporte similar cu un tabel SQL (un tabel cu variabile pe coloane și observații pe rânduri). Pe lângă faptul că sunt mai ușor de înțeles, DataFrame-urile sunt și mai optimizate pentru operații complexe decât RDD-urile.

Atunci când începi să modifici și să combini coloane și rânduri de date, există multe moduri de a ajunge la același rezultat, dar unele pot dura mult mai mult decât altele. Când folosești RDD-uri, îi revine omului de știință al datelor să găsească modul corect de a optimiza interogarea. În schimb, implementarea DataFrame are mare parte din această optimizare deja încorporată!

Pentru a începe să lucrezi cu Spark DataFrame-uri, trebuie mai întâi să creezi un obiect SparkSession pornind de la SparkContext. Poți să te gândești la SparkContext ca la conexiunea ta la cluster și la SparkSession ca la interfața prin care interacționezi cu acea conexiune.

Reține că, pe parcursul acestui curs, vei avea un SparkSession numit spark disponibil în spațiul tău de lucru!

Care dintre următoarele reprezintă un avantaj al Spark DataFrame-urilor față de RDD-uri?

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul