Bắt đầu ngayBắt đầu miễn phí

NER với spaCy

Nhận dạng thực thể có tên (Named Entity Recognition - NER) giúp bạn nhanh chóng xác định các thành phần quan trọng trong một tài liệu, như tên người và địa điểm. Nó giúp sắp xếp dữ liệu phi cấu trúc và phát hiện thông tin quan trọng — điều cốt yếu khi bạn xử lý các bộ dữ liệu lớn. Trong bài tập này, bạn sẽ thực hành Named Entity Recognition.

en_core_web_sm đã được nạp sẵn dưới tên nlp. Ba bình luận từ bộ dữ liệu Airline Travel Information System (ATIS) đã được cung cấp trong một danh sách gọi là texts.

Bài tập này là một phần của khóa học

Xử lý ngôn ngữ tự nhiên với spaCy

Xem khóa học

Hướng dẫn bài tập

  • Tạo documents, một danh sách gồm tất cả các Doc cho từng văn bản trong texts bằng list comprehension.
  • Với mỗi doc, in ra văn bản của từng thực thể và nhãn tương ứng bằng cách lặp qua doc.ents.
  • In văn bản của token thứ sáu và kiểu thực thể của Doc thứ hai.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Compile a list of all Doc containers of texts
documents = [____ for text in texts]

# Print the entity text and label for the entities in each document
for doc in documents:
    print([(____, ____) for ent in ____])
    
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)
Chỉnh sửa và Chạy Mã