RDD do DataFrame
Podobnie jak RDD, DataFrame-y są niezmiennymi i rozproszonymi strukturami danych w Sparku. Choć RDD to podstawowa struktura danych w Sparku, praca z danymi w DataFrame-ach jest wygodniejsza. Warto więc wiedzieć, jak przekształcić RDD w DataFrame.
W tym ćwiczeniu najpierw utworzysz RDD z gotowej listy sample_list. To RDD zawiera listę krotek ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) – każda krotka przechowuje imię osoby i jej wiek. Następnie na podstawie tego RDD i schematu (listy kolumn 'Name' i 'Age') utworzysz DataFrame, a na koniec potwierdzisz, że wynik jest rzeczywiście obiektem PySpark DataFrame.
Pamiętaj – w swoim środowisku masz już dostępne SparkContext sc oraz SparkSession spark.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz RDD z listy
sample_list. - Utwórz PySpark DataFrame na podstawie powyższego RDD i schematu.
- Potwierdź, że wynik jest obiektem PySpark DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create an RDD from the list
rdd = sc.____(sample_list)
# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])
# Check the type of names_df
print("The type of names_df is", ____(names_df))