НачатьНачать бесплатно

Собираем всё воедино. Часть I

Вы заложили прочный фундамент в PySpark, изучили его основные компоненты и поработали с реальными сценариями, включающими Spark SQL, DataFrames и продвинутые операции. Теперь пора объединить всё это. В двух следующих упражнениях вы создадите SparkSession и DataFrame, закешируете DataFrame, проведёте аналитику и интерпретируете результаты!

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Импортируйте SparkSession из pyspark.sql.
  • Создайте новый SparkSession с именем final_spark, используя SparkSession.builder.getOrCreate().
  • Выведите my_spark в консоль, чтобы убедиться, что это экземпляр SparkSession.
  • Создайте новый DataFrame на основе заранее загруженной схемы и определения столбцов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
Редактировать и запускать код