Vytvoření SparkSession
V tomto cvičení spustíš lokální Spark cluster využívající všechna dostupná jádra. K clusteru budeš přistupovat přes objekt SparkSession.
Třída SparkSession má atribut builder, což je instance třídy Builder. Ta nabízí tři důležité metody:
- určení umístění master node;
- pojmenování aplikace (volitelné); a
- získání existující
SparkSession, nebo vytvoření nové, pokud žádná neexistuje.
Třída SparkSession má atribut version, který vrací verzi Sparku. Poznámka: Verzi lze získat také přes atribut __version__ modulu pyspark.
Víc o SparkSession najdeš zde.
Až s clusterem skončíš, je dobré ho vypnout – uvolníš tím jeho prostředky pro ostatní procesy.
Poznámky:
- Může se ti hodit podívat se na snímky z lekcí v panelu Slides vedle IPython Shell.
- Verze Sparku v cvičení není stejná jako ve výukových materiálech. Platforma cvičení byla aktualizována na novější verzi Sparku.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Importuj třídu
SparkSessionz modulupyspark.sql. - Vytvoř objekt
SparkSessionpřipojený k lokálnímu clusteru. Využij všechna dostupná jádra a aplikaci pojmenuj'test'. - Pomocí atributu
versionobjektuSparkSessionzjisti verzi Sparku běžícího na clusteru. Poznámka: Verze se může lišit od té použité v prezentaci (čas od času se aktualizuje). - Vypni cluster.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the SparkSession class
from ____ import ____
# Create SparkSession object
spark = SparkSession.builder \
.master(____) \
.____(____) \
.____()
# What version of Spark?
print(spark.____)
# Terminate the cluster
spark.____()