Bắt đầu ngayBắt đầu miễn phí

Lemmatization

Khi tiếp tục phân tích các đánh giá của người dùng, bạn nhận thấy stemming đôi khi tạo ra các từ không chuẩn như "fli" từ "flying", khiến kết quả khó hiểu hơn. Để khắc phục, bạn sẽ dùng lemmatization, vốn trả về các từ hoàn chỉnh và giúp cải thiện tính rõ ràng cũng như độ chính xác của phân tích.

WordNetLemmatizer đã được nhập, stop_words đã được định nghĩa, và các tài nguyên cần thiết của NLTK đã được tải xuống.

Bài tập này là một phần của khóa học

Natural Language Processing (NLP) bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo một thể hiện lemmatizer từ lớp WordNetLemmatizer().
  • Dùng lemmatizer để lemmatize lower_tokens.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create lemmatizer
lemmatizer = ____()

# Lemmatize each token
lemmatized_tokens = [____.____(____) for ____ in clean_tokens]

print(lemmatized_tokens)
Chỉnh sửa và Chạy Mã