Zacznij terazZacznij za darmo

Tworzenie RDD

W PySpark możesz utworzyć RDD (Resilient Distributed Dataset) na kilka sposobów. Ponieważ znasz już DataFrames, skonfigurujemy to na ich podstawie. Pamiętaj, że w twoim środowisku pracy jest już dostępna sesja SparkSession o nazwie spark!

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz DataFrame z dostarczonej listy i nazwij go df.
  • Przekonwertuj DataFrame na RDD.
  • Pobierz zawartość RDD za pomocą collect i wyświetl wynik.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)

# Convert DataFrame to RDD
rdd = df.____

# Show the RDD's contents
rdd.____
print(rdd)
Edytuj i uruchom kod