Să reunim totul I
Ai construit o bază solidă în PySpark, ai explorat componentele sale principale și ai lucrat cu scenarii practice ce implică Spark SQL, DataFrame-uri și operații avansate. Acum e momentul să reunești totul. În următoarele două exerciții, vei crea o sesiune SparkSession și un DataFrame, vei face cache acestui DataFrame, vei realiza analize și vei explica rezultatele!
Acest exercițiu face parte din cursul
Introducere în PySpark
Instrucțiuni pentru exercițiu
- Importă
SparkSessiondinpyspark.sql. - Creează o nouă
SparkSessionnumităfinal_sparkfolosindSparkSession.builder.getOrCreate(). - Afișează
my_sparkîn consolă pentru a verifica că este oSparkSession. - Creează un nou DataFrame pornind de la o schemă și o definiție de coloane preîncărcate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import SparkSession from pyspark.sql
from ____ import ____
# Create my_spark
my_spark = SparkSession.builder.appName(____).____
# Print my_spark
____
# Load dataset into a DataFrame
df = ____(data, schema=columns)
df.show()