Kom igångKom igång gratis

Skapa en SparkSession

I den här övningen startar du ett lokalt Spark-kluster som använder alla tillgängliga kärnor. Klustret blir tillgängligt via ett SparkSession-objekt.

Klassen SparkSession har attributet builder, som är en instans av klassen Builder. Builder-klassen exponerar tre viktiga metoder som låter dig:

  • ange platsen för masternoden;
  • namnge applikationen (valfritt); och
  • hämta en befintlig SparkSession eller, om ingen finns, skapa en ny.

Klassen SparkSession har attributet version, som returnerar Spark-versionen. Obs! Versionen kan också hämtas via attributet __version__ i modulen pyspark.

Läs mer om SparkSession här.

När du är klar med klustret är det bra att stänga ned det, vilket frigör dess resurser och gör dem tillgängliga för andra processer.

Obs!

  1. Det kan vara bra att gå igenom slides från lektionerna i panelen Slides bredvid IPython Shell.
  2. Spark-versionen i övningen är inte densamma som i lektionerna. Övningsplattformen har uppdaterats till en nyare version av Spark.

Den här övningen är en del av kursen

Maskininlärning med PySpark

Visa kurs

Övningsinstruktioner

  • Importera klassen SparkSession från pyspark.sql.
  • Skapa ett SparkSession-objekt kopplat till ett lokalt kluster. Använd alla tillgängliga kärnor. Namnge applikationen 'test'.
  • Använd attributet versionSparkSession-objektet för att hämta versionen av Spark som körs på klustret. Obs! Versionen kan skilja sig från den som används i presentationen – den uppdateras emellanåt.
  • Stäng ned klustret.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the SparkSession class
from ____ import ____

# Create SparkSession object
spark = SparkSession.builder \
                    .master(____) \
                    .____(____) \
                    .____()

# What version of Spark?
print(spark.____)

# Terminate the cluster
spark.____()
Redigera och kör kod