ПочатиПочніть безкоштовно

Підсумуємо все разом I

Ви вже заклали міцний фундамент у PySpark, розібрали його основні компоненти та попрацювали з практичними сценаріями зі Spark SQL, датафреймами й розширеними операціями. Тепер час об'єднати все це. У двох наступних вправах ви створите SparkSession і датафрейм, закешуєте цей датафрейм, виконаєте аналітику та поясните результат!

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте SparkSession з pyspark.sql.
  • Створіть новий SparkSession з назвою final_spark, використавши SparkSession.builder.getOrCreate().
  • Надрукуйте my_spark у консолі, щоб переконатися, що це SparkSession.
  • Створіть новий датафрейм із попередньо завантаженої схеми та визначення стовпців.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
Редагувати та запускати код