Skapa RDD:er
I PySpark kan du skapa ett RDD (Resilient Distributed Dataset) på några olika sätt. Eftersom du redan är bekant med DataFrames utgår vi från en DataFrame. Kom ihåg att det redan finns en SparkSession som heter spark i din arbetsmiljö!
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Skapa en DataFrame från den angivna listan och kalla den
df. - Konvertera DataFrame till ett RDD.
- Samla in och skriv ut det resulterande RDD:t.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)