Tworzenie RDD
W PySpark możesz utworzyć RDD (Resilient Distributed Dataset) na kilka sposobów. Ponieważ znasz już DataFrames, skonfigurujemy to na ich podstawie. Pamiętaj, że w twoim środowisku pracy jest już dostępna sesja SparkSession o nazwie spark!
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Utwórz DataFrame z dostarczonej listy i nazwij go
df. - Przekonwertuj DataFrame na RDD.
- Pobierz zawartość RDD za pomocą collect i wyświetl wynik.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)