НачатьНачать бесплатно

Преобразование RDD в DataFrame

Как и RDD, DataFrame в Spark — это неизменяемые распределённые структуры данных. Хотя RDD являются основной структурой данных в Spark, работать с данными через DataFrame значительно удобнее. Поэтому важно понимать, как преобразовать RDD в DataFrame.

В этом упражнении вы сначала создадите RDD из уже подготовленного списка sample_list. Этот RDD содержит список кортежей ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26), где каждый кортеж включает имя человека и его возраст. Затем вы создадите DataFrame на основе полученного RDD и схемы (списка полей 'Name' и 'Age'), после чего убедитесь, что результат является объектом PySpark DataFrame.

Обратите внимание: в вашей рабочей среде уже доступны SparkContext sc и SparkSession spark.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте RDD из списка sample_list.
  • Создайте PySpark DataFrame, используя полученный RDD и схему.
  • Убедитесь, что результат является объектом PySpark DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
Редактировать и запускать код