ПочатиПочніть безкоштовно

Анотування та підготовка тренувальних даних

Після збирання даних ви можете анотувати їх у форматі, потрібному для моделі spaCy. У цій вправі ви потренуєтеся формувати коректний запис анотованих даних для задачі NER у медичній сфері.

Надано sentence і дві сутності: entity_1 з текстом chest pain типу SYMPTOM та entity_2 з текстом hyperthyroidism типу DISEASE — скористайтеся ними у розв'язанні.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інструкції до вправи

  • Заповніть запис annotated_data у правильному форматі.
  • Витягніть початкові та кінцеві індекси кожної сутності та збережіть їх у відповідних змінних.
  • Збережіть це саме речення та його сутності у відповідному тренувальному форматі як training_data.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Редагувати та запускати код