RDD na DataFrame
Stejně jako RDD jsou DataFrames v Sparku neměnné a distribuované datové struktury. I když jsou RDD základním stavebním kamenem Sparku, práce s daty v DataFrames je pohodlnější. Proto se hodí vědět, jak RDD převést na DataFrame.
V tomto cvičení nejprve vytvoříš RDD z připraveného seznamu sample_list. Tento RDD obsahuje seznam n-tic ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26), kde každá n-tice obsahuje jméno osoby a její věk. Pak vytvoříš DataFrame pomocí tohoto RDD a schématu (seznam hodnot 'Name' a 'Age') a nakonec ověříš, že výstupem je skutečně PySpark DataFrame.
Máš k dispozici SparkContext sc i SparkSession spark připravené v pracovním prostředí.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř RDD ze seznamu
sample_list. - Vytvoř PySpark DataFrame pomocí výše vytvořeného RDD a schématu.
- Ověř, že výstup je PySpark DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create an RDD from the list
rdd = sc.____(sample_list)
# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])
# Check the type of names_df
print("The type of names_df is", ____(names_df))