Začněte nyníZačněte zdarma

Anotace a příprava trénovacích dat

Po nasbírání dat je potřeba je anotovat ve formátu, který spaCy model vyžaduje. V tomto cvičení si procvičíš, jak správně sestavit anotovaný datový záznam pro úlohu NER v lékařské oblasti.

K dispozici máš proměnnou sentence a dvě entity: entity_1 s textem chest pain a typem SYMPTOM a entity_2 s textem hyperthyroidism a typem DISEASE.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Doplň záznam annotated_data ve správném formátu.
  • Extrahuj počáteční a koncový znak každé entity a ulož je do příslušných proměnných.
  • Ulož stejnou vstupní větu a její entity ve správném formátu pro trénování jako training_data.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Upravit a spustit kód