Преобразование RDD в DataFrame
Как и RDD, DataFrame в Spark — это неизменяемые распределённые структуры данных. Хотя RDD являются основной структурой данных в Spark, работать с данными через DataFrame значительно удобнее. Поэтому важно понимать, как преобразовать RDD в DataFrame.
В этом упражнении вы сначала создадите RDD из уже подготовленного списка sample_list. Этот RDD содержит список кортежей ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26), где каждый кортеж включает имя человека и его возраст. Затем вы создадите DataFrame на основе полученного RDD и схемы (списка полей 'Name' и 'Age'), после чего убедитесь, что результат является объектом PySpark DataFrame.
Обратите внимание: в вашей рабочей среде уже доступны SparkContext sc и SparkSession spark.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте RDD из списка
sample_list. - Создайте PySpark DataFrame, используя полученный RDD и схему.
- Убедитесь, что результат является объектом PySpark DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an RDD from the list
rdd = sc.____(sample_list)
# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])
# Check the type of names_df
print("The type of names_df is", ____(names_df))