Lọc và Đếm
Biến đổi RDD filter() trả về một RDD mới chỉ chứa các phần tử thỏa mãn một hàm nhất định. Điều này hữu ích khi lọc các tập dữ liệu lớn dựa trên một từ khóa. Trong bài này, bạn sẽ lọc các dòng chứa từ khóa Spark từ RDD fileRDD, vốn gồm các dòng văn bản từ tệp README.md. Tiếp theo, bạn sẽ đếm tổng số dòng chứa từ khóa Spark và cuối cùng in ra 4 dòng đầu tiên của RDD đã lọc.
Lưu ý, bạn đã có sẵn SparkContext sc, file_path, và fileRDD trong không gian làm việc.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Tạo phép biến đổi
filter()để chọn các dòng chứa từ khóaSpark. - Có bao nhiêu dòng trong
fileRDD_filterchứa từ khóaSpark? - In ra bốn dòng đầu tiên của RDD kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)