ÎncepețiÎncepe gratuit

Să reunim totul I

Ai construit o bază solidă în PySpark, ai explorat componentele sale principale și ai lucrat cu scenarii practice ce implică Spark SQL, DataFrame-uri și operații avansate. Acum e momentul să reunești totul. În următoarele două exerciții, vei crea o sesiune SparkSession și un DataFrame, vei face cache acestui DataFrame, vei realiza analize și vei explica rezultatele!

Acest exercițiu face parte din cursul

Introducere în PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă SparkSession din pyspark.sql.
  • Creează o nouă SparkSession numită final_spark folosind SparkSession.builder.getOrCreate().
  • Afișează my_spark în consolă pentru a verifica că este o SparkSession.
  • Creează un nou DataFrame pornind de la o schemă și o definiție de coloane preîncărcate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
Editează și rulează codul