Adnotarea și pregătirea datelor de antrenament
După colectarea datelor, le poți adnota în formatul necesar pentru un model spaCy. În acest exercițiu, vei exersa crearea unui record de date adnotate corect, pentru o sarcină NER în domeniul medical.
O variabilă sentence și două entități sunt disponibile pentru utilizare: entity_1 cu textul chest pain și tipul SYMPTOM, și entity_2 cu textul hyperthyroidism și tipul DISEASE.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Completează recordul
annotated_dataîn formatul corect. - Extrage caracterele de start și de final ale fiecărei entități și stochează-le în variabilele corespunzătoare.
- Stochează aceeași propoziție de intrare și entitățile sale în formatul corect de antrenament, ca
training_data.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)