Bắt đầu ngayBắt đầu miễn phí

Lọc và Đếm

Biến đổi RDD filter() trả về một RDD mới chỉ chứa các phần tử thỏa mãn một hàm nhất định. Điều này hữu ích khi lọc các tập dữ liệu lớn dựa trên một từ khóa. Trong bài này, bạn sẽ lọc các dòng chứa từ khóa Spark từ RDD fileRDD, vốn gồm các dòng văn bản từ tệp README.md. Tiếp theo, bạn sẽ đếm tổng số dòng chứa từ khóa Spark và cuối cùng in ra 4 dòng đầu tiên của RDD đã lọc.

Lưu ý, bạn đã có sẵn SparkContext sc, file_path, và fileRDD trong không gian làm việc.

Bài tập này là một phần của khóa học

Nền tảng Big Data với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo phép biến đổi filter() để chọn các dòng chứa từ khóa Spark.
  • Có bao nhiêu dòng trong fileRDD_filter chứa từ khóa Spark?
  • In ra bốn dòng đầu tiên của RDD kết quả.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Chỉnh sửa và Chạy Mã