Tạo RDD
Trong PySpark, bạn có thể tạo một RDD (Resilient Distributed Dataset) theo vài cách khác nhau. Vì bạn đã quen với DataFrame, ở đây bạn sẽ thiết lập thông qua một DataFrame. Lưu ý: đã có sẵn một SparkSession tên là spark trong môi trường làm việc của bạn!
Bài tập này là một phần của khóa học
Nhập môn PySpark
Hướng dẫn bài tập
- Tạo một DataFrame từ danh sách đã cung cấp, đặt tên là
df. - Chuyển DataFrame thành một RDD.
- Thu thập và in RDD thu được.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)