Crearea unui SparkSession
În acest exercițiu, vei porni un cluster Spark local care folosește toate nucleele disponibile. Clusterul va fi accesibil printr-un obiect SparkSession.
Clasa SparkSession are un atribut builder, care este o instanță a clasei Builder. Clasa Builder expune trei metode importante ce îți permit să:
- specifici locația nodului master;
- denumești aplicația (opțional); și
- obții un
SparkSessionexistent sau, dacă nu există niciunul, să creezi unul nou.
Clasa SparkSession are un atribut version care returnează versiunea Spark. Notă: Versiunea poate fi accesată și prin atributul __version__ al modulului pyspark.
Află mai multe despre SparkSession aici.
După ce ai terminat lucrul cu clusterul, este recomandat să îl oprești — astfel eliberezi resursele ocupate, făcându-le disponibile pentru alte procese.
Note:
- Poate fi util să revezi slide-urile din lecții, disponibile în panoul Slide-uri de lângă IPython Shell.
- Versiunea de Spark din exercițiu nu este aceeași ca în lecții. Platforma exercițiilor a fost actualizată la o versiune mai recentă de Spark.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Importă clasa
SparkSessiondinpyspark.sql. - Creează un obiect
SparkSessionconectat la un cluster local. Folosește toate nucleele disponibile. Denumește aplicația'test'. - Folosește atributul
versional obiectuluiSparkSessionpentru a obține versiunea Spark care rulează pe cluster. Notă: Versiunea poate fi diferită față de cea din prezentare (aceasta se actualizează periodic). - Oprește clusterul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the SparkSession class
from ____ import ____
# Create SparkSession object
spark = SparkSession.builder \
.master(____) \
.____(____) \
.____()
# What version of Spark?
print(spark.____)
# Terminate the cluster
spark.____()