NER với spaCy
Nhận dạng thực thể có tên (Named Entity Recognition - NER) giúp bạn nhanh chóng xác định các thành phần quan trọng trong một tài liệu, như tên người và địa điểm. Nó giúp sắp xếp dữ liệu phi cấu trúc và phát hiện thông tin quan trọng — điều cốt yếu khi bạn xử lý các bộ dữ liệu lớn. Trong bài tập này, bạn sẽ thực hành Named Entity Recognition.
en_core_web_sm đã được nạp sẵn dưới tên nlp. Ba bình luận từ bộ dữ liệu Airline Travel Information System (ATIS) đã được cung cấp trong một danh sách gọi là texts.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Tạo
documents, một danh sách gồm tất cả cácDoccho từng văn bản trongtextsbằng list comprehension. - Với mỗi
doc, in ra văn bản của từng thực thể và nhãn tương ứng bằng cách lặp quadoc.ents. - In văn bản của token thứ sáu và kiểu thực thể của
Docthứ hai.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)