Kom igångKom igång gratis

Allt på en gång I

Du har byggt upp en stabil grund i PySpark, utforskat dess kärnkomponenter och arbetat med praktiska scenarier som rör Spark SQL, DataFrames och avancerade operationer. Nu är det dags att sätta ihop allt. Under de nästa två övningarna skapar du en SparkSession och en DataFrame, cachar den DataFrame, utför analyser och förklarar resultatet!

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Importera SparkSession från pyspark.sql.
  • Skapa en ny SparkSession med namnet final_spark med hjälp av SparkSession.builder.getOrCreate().
  • Skriv ut my_spark i konsolen för att verifiera att det är en SparkSession.
  • Skapa en ny DataFrame från ett förinstallerat schema och en kolumndefinition.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
Redigera och kör kod