Zacznij terazZacznij za darmo

Łączymy wszystko w całość – część I

Masz już solidne podstawy w PySparku – poznałeś/-aś jego kluczowe komponenty i przećwiczyłeś/-aś praktyczne scenariusze z użyciem Spark SQL, DataFrames oraz zaawansowanych operacji. Czas połączyć tę wiedzę w całość. W kolejnych dwóch ćwiczeniach utworzysz SparkSession i DataFrame, zapiszesz ten DataFrame w pamięci podręcznej (cache), przeprowadzisz analizę danych i wyjaśnisz jej wyniki!

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj SparkSession z pyspark.sql.
  • Utwórz nową SparkSession o nazwie final_spark, używając SparkSession.builder.getOrCreate().
  • Wyświetl my_spark w konsoli, aby potwierdzić, że to SparkSession.
  • Utwórz nowy DataFrame na podstawie wczytanego wcześniej schematu i definicji kolumn.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
Edytuj i uruchom kod