Kom igångKom igång gratis

Från RDD till DataFrame

Precis som RDD:er är DataFrames oföränderliga och distribuerade datastrukturer i Spark. Även om RDD:er utgör en grundläggande datastruktur i Spark är det enklare att arbeta med data i DataFrames. Därför är det viktigt att förstå hur man konverterar en RDD till en DataFrame.

I den här övningen skapar du först en RDD från sample_list, som redan finns tillgänglig. RDD:n innehåller en lista med tupler – ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) – där varje tupel innehåller en persons namn och ålder. Sedan skapar du en DataFrame utifrån RDD:n och ett schema (som är listan med 'Name' och 'Age'), och slutligen bekräftar du att resultatet är en PySpark DataFrame.

Kom ihåg att du redan har en SparkContext sc och en SparkSession spark tillgängliga i din arbetsmiljö.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en RDD från sample_list.
  • Skapa en PySpark DataFrame med hjälp av RDD:n och schemat ovan.
  • Bekräfta att resultatet är en PySpark DataFrame.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
Redigera och kör kod