Gán nhãn và chuẩn bị dữ liệu huấn luyện
Sau khi thu thập dữ liệu, bạn có thể gán nhãn dữ liệu theo định dạng yêu cầu cho mô hình spaCy. Trong bài tập này, bạn sẽ luyện tập tạo bản ghi dữ liệu đã gán nhãn đúng định dạng cho một tác vụ NER trong lĩnh vực y khoa.
Một sentence và hai thực thể gồm entity_1 với văn bản chest pain và kiểu SYMPTOM, cùng entity_2 với văn bản hyperthyroidism và kiểu DISEASE đã được cung cấp để bạn sử dụng.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Hoàn thiện bản ghi
annotated_datatheo đúng định dạng. - Trích xuất vị trí ký tự bắt đầu và kết thúc của mỗi thực thể và lưu vào các biến tương ứng.
- Lưu cùng câu đầu vào và các thực thể của nó theo định dạng huấn luyện phù hợp dưới tên
training_data.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)