Annotering och förberedelse av träningsdata
När du har samlat in data kan du annotera den i det format som krävs för en spaCy-modell. I den här övningen får du träna på att skapa ett korrekt annoterat datapost för en NER-uppgift inom medicinsk domän.
En sentence och två entiteter finns tillgängliga: entity_1 med texten chest pain och typen SYMPTOM, samt entity_2 med texten hyperthyroidism och typen DISEASE.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Fyll i
annotated_data-posten i korrekt format. - Extrahera start- och slutpositionerna för varje entitet och lagra dem i motsvarande variabler.
- Lagra samma inmatningssats och dess entiteter i rätt träningsformat som
training_data.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)