ÎncepețiÎncepe gratuit

Adnotarea și pregătirea datelor de antrenament

După colectarea datelor, le poți adnota în formatul necesar pentru un model spaCy. În acest exercițiu, vei exersa crearea unui record de date adnotate corect, pentru o sarcină NER în domeniul medical.

O variabilă sentence și două entități sunt disponibile pentru utilizare: entity_1 cu textul chest pain și tipul SYMPTOM, și entity_2 cu textul hyperthyroidism și tipul DISEASE.

Acest exercițiu face parte din cursul

Procesarea limbajului natural cu spaCy

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează recordul annotated_data în formatul corect.
  • Extrage caracterele de start și de final ale fiecărei entități și stochează-le în variabilele corespunzătoare.
  • Stochează aceeași propoziție de intrare și entitățile sale în formatul corect de antrenament, ca training_data.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Editează și rulează codul