Suy luận và lọc
Hãy tưởng tượng bạn có một bộ dữ liệu điều tra dân số mà bạn biết là có header và schema. Cùng tải bộ dữ liệu đó và để PySpark suy luận (infer) schema. Bạn sẽ thấy gì nếu lọc người lớn trên 40 tuổi?
Nhớ rằng trong không gian làm việc của bạn đã có một SparkSession tên là spark!
Bài tập này là một phần của khóa học
Nhập môn PySpark
Hướng dẫn bài tập
- Tải tệp JSON
adults.json. - Lọc dữ liệu để chỉ giữ những người có
agelớn hơn40. - Hiển thị kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____