НачатьНачать бесплатно

Аннотирование данных и подготовка обучающей выборки

После сбора данных необходимо аннотировать их в формате, который требует модель spaCy. В этом упражнении вы потренируетесь формировать корректную запись аннотированных данных для задачи NER в медицинской области.

Для работы вам доступны: переменная sentence с предложением, а также две сущности — entity_1 с текстом chest pain и типом SYMPTOM, и entity_2 с текстом hyperthyroidism и типом DISEASE.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Заполните запись annotated_data в правильном формате.
  • Извлеките начальный и конечный символы каждой сущности и сохраните их в соответствующие переменные.
  • Сохраните исходное предложение вместе с его сущностями в корректном формате обучающей выборки в переменной training_data.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Редактировать и запускать код