Bắt đầu ngayBắt đầu miễn phí

Stemming

Giờ đây bạn đã làm sạch văn bản review và loại bỏ stop words cũng như dấu câu, bạn sẵn sàng chuẩn hóa các từ còn lại bằng stemming để đưa từ về dạng gốc. Cách này giúp nhóm các từ tương tự lại với nhau, khiến quá trình phân tích nhất quán và hiệu quả hơn.

Lớp PorterStemmer đã được cung cấp, cùng với danh sách clean_tokens.

Bài tập này là một phần của khóa học

Natural Language Processing (NLP) bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo PorterStemmer().
  • Dùng list comprehension để thực hiện stemming cho từng token trong danh sách clean_tokens.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
Chỉnh sửa và Chạy Mã