Allt på en gång I
Du har byggt upp en stabil grund i PySpark, utforskat dess kärnkomponenter och arbetat med praktiska scenarier som rör Spark SQL, DataFrames och avancerade operationer. Nu är det dags att sätta ihop allt. Under de nästa två övningarna skapar du en SparkSession och en DataFrame, cachar den DataFrame, utför analyser och förklarar resultatet!
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Importera
SparkSessionfrånpyspark.sql. - Skapa en ny
SparkSessionmed namnetfinal_sparkmed hjälp avSparkSession.builder.getOrCreate(). - Skriv ut
my_sparki konsolen för att verifiera att det är enSparkSession. - Skapa en ny DataFrame från ett förinstallerat schema och en kolumndefinition.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import SparkSession from pyspark.sql
from ____ import ____
# Create my_spark
my_spark = SparkSession.builder.appName(____).____
# Print my_spark
____
# Load dataset into a DataFrame
df = ____(data, schema=columns)
df.show()