Kom igångKom igång gratis

Annotering och förberedelse av träningsdata

När du har samlat in data kan du annotera den i det format som krävs för en spaCy-modell. I den här övningen får du träna på att skapa ett korrekt annoterat datapost för en NER-uppgift inom medicinsk domän.

En sentence och två entiteter finns tillgängliga: entity_1 med texten chest pain och typen SYMPTOM, samt entity_2 med texten hyperthyroidism och typen DISEASE.

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Fyll i annotated_data-posten i korrekt format.
  • Extrahera start- och slutpositionerna för varje entitet och lagra dem i motsvarande variabler.
  • Lagra samma inmatningssats och dess entiteter i rätt träningsformat som training_data.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Redigera och kör kod