Bắt đầu ngayBắt đầu miễn phí

Lemmatization với spaCy

Trong bài tập này, bạn sẽ thực hành lemmatization. Lemmatization hữu ích để tạo ra dạng gốc của các từ phái sinh. Điều này có nghĩa là với bất kỳ câu nào, số lượng lemma kỳ vọng sẽ nhỏ hơn hoặc bằng số lượng token.

Bài đánh giá đồ ăn trên Amazon đầu tiên được cung cấp cho bạn trong một chuỗi gọi là text. en_core_web_sm đã được nạp dưới tên nlp, và đã chạy trên text để tạo document, một chứa Doc cho chuỗi văn bản.

tokens, một danh sách chứa các token của text, cũng đã được nạp sẵn để bạn sử dụng.

Bài tập này là một phần của khóa học

Xử lý ngôn ngữ tự nhiên với spaCy

Xem khóa học

Hướng dẫn bài tập

  • Thêm lemma cho tất cả token trong document, rồi in danh sách lemmas.
  • In danh sách tokens và quan sát sự khác biệt giữa tokenslemmas.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Chỉnh sửa và Chạy Mã