Аннотирование данных и подготовка обучающей выборки
После сбора данных необходимо аннотировать их в формате, который требует модель spaCy. В этом упражнении вы потренируетесь формировать корректную запись аннотированных данных для задачи NER в медицинской области.
Для работы вам доступны: переменная sentence с предложением, а также две сущности — entity_1 с текстом chest pain и типом SYMPTOM, и entity_2 с текстом hyperthyroidism и типом DISEASE.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Заполните запись
annotated_dataв правильном формате. - Извлеките начальный и конечный символы каждой сущности и сохраните их в соответствующие переменные.
- Сохраните исходное предложение вместе с его сущностями в корректном формате обучающей выборки в переменной
training_data.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)