Собираем всё воедино. Часть I
Вы заложили прочный фундамент в PySpark, изучили его основные компоненты и поработали с реальными сценариями, включающими Spark SQL, DataFrames и продвинутые операции. Теперь пора объединить всё это. В двух следующих упражнениях вы создадите SparkSession и DataFrame, закешируете DataFrame, проведёте аналитику и интерпретируете результаты!
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Импортируйте
SparkSessionизpyspark.sql. - Создайте новый
SparkSessionс именемfinal_spark, используяSparkSession.builder.getOrCreate(). - Выведите
my_sparkв консоль, чтобы убедиться, что это экземплярSparkSession. - Создайте новый DataFrame на основе заранее загруженной схемы и определения столбцов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import SparkSession from pyspark.sql
from ____ import ____
# Create my_spark
my_spark = SparkSession.builder.appName(____).____
# Print my_spark
____
# Load dataset into a DataFrame
df = ____(data, schema=columns)
df.show()