Độ tương đồng của Span với spaCy
Xác định độ tương đồng ngữ nghĩa giúp bạn phân loại văn bản vào các nhóm định sẵn, phát hiện văn bản liên quan, hoặc gắn cờ nội dung trùng lặp. Trong bài tập này, bạn sẽ luyện tính độ tương đồng ngữ nghĩa giữa các span của một tài liệu với một tài liệu cho trước. Mục tiêu là tìm Span gồm ba token liên quan nhất đến canned dog food (thức ăn chó đóng hộp).
Nhóm chủ đề canned dog food đã được lưu trong category. Chuỗi văn bản đã có sẵn trong đối tượng text và mô hình en_core_web_md đã được nạp dưới tên nlp. Doc của text cũng đã được tạo và lưu trong document.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Tạo một
Docchocategoryvà lưu vàocategory_document. - In điểm tương đồng giữa một
Spanđã cho vàcategory_document, làm tròn đến ba chữ số thập phân.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))