Bắt đầu ngayBắt đầu miễn phí

Loại bỏ stop words và rút gọn tập dữ liệu

Trong bài tập này, bạn sẽ loại bỏ các stop words khỏi dữ liệu. Stop words là những từ phổ biến, thường không mang nhiều ý nghĩa, ví dụ như "I", "the", "a",… Bạn có thể tự tạo một danh sách để loại bỏ nhiều stop words hiển nhiên. Nhưng với bài này, bạn chỉ cần loại bỏ các stop words từ danh sách đã được biên soạn stop_words có sẵn trong môi trường của bạn.

Sau khi loại bỏ stop words, bạn sẽ tạo một pair RDD trong đó mỗi phần tử là một tuple (k, v) với k là khóa và v là giá trị. Trong ví dụ này, pair RDD có dạng (w, 1) trong đó w là từng từ trong RDD và 1 là một con số. Cuối cùng, bạn sẽ gộp các giá trị có cùng khóa từ pair RDD để đếm số lần xuất hiện của mỗi từ.

Hãy nhớ bạn đã có sẵn SparkContext scsplitRDD trong không gian làm việc, cùng với biến danh sách stop_words.

Bài tập này là một phần của khóa học

Nền tảng Big Data với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Lọc splitRDD, loại bỏ các stop words có trong biến stop_words.
  • Tạo một pair RDD dạng tuple chứa từ (sử dụng bộ lặp w) và số 1 từ mỗi phần tử là từ trong splitRDD.
  • Lấy số lần xuất hiện của mỗi từ (tần suất từ) trong pair RDD. Hãy dùng một phép biến đổi hoạt động trên các cặp khóa, giá trị (k,v). Cân nhắc kỹ hàm cần dùng ở đây.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Filter splitRDD to remove stop words from the stop_words curated list
splitRDD_no_stop = splitRDD.____(lambda x: x.lower() not in ____)

# Create a tuple of the word (w) and 1 
splitRDD_no_stop_words = splitRDD_no_stop.map(lambda w: (____, ____))

# Count of the number of occurences of each word
resultRDD = splitRDD_no_stop_words.____(lambda x, y: x + y)
Chỉnh sửa và Chạy Mã