Lemmatization với spaCy
Trong bài tập này, bạn sẽ thực hành lemmatization. Lemmatization hữu ích để tạo ra dạng gốc của các từ phái sinh. Điều này có nghĩa là với bất kỳ câu nào, số lượng lemma kỳ vọng sẽ nhỏ hơn hoặc bằng số lượng token.
Bài đánh giá đồ ăn trên Amazon đầu tiên được cung cấp cho bạn trong một chuỗi gọi là text. en_core_web_sm đã được nạp dưới tên nlp, và đã chạy trên text để tạo document, một chứa Doc cho chuỗi văn bản.
tokens, một danh sách chứa các token của text, cũng đã được nạp sẵn để bạn sử dụng.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Thêm lemma cho tất cả token trong
document, rồi in danh sáchlemmas. - In danh sách
tokensvà quan sát sự khác biệt giữatokensvàlemmas.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)