Zacznij terazZacznij za darmo

Adnotacje i przygotowanie danych treningowych

Po zebraniu danych możesz je opatrzyć adnotacjami w formacie wymaganym przez model spaCy. W tym ćwiczeniu przećwiczysz tworzenie poprawnego rekordu z adnotacjami dla zadania NER w dziedzinie medycznej.

Do dyspozycji masz zmienną sentence oraz dwie encje: entity_1 z tekstem chest pain i typem SYMPTOM, a także entity_2 z tekstem hyperthyroidism i typem DISEASE.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Uzupełnij rekord annotated_data w poprawnym formacie.
  • Wyodrębnij indeksy pierwszego i ostatniego znaku każdej encji i zapisz je w odpowiednich zmiennych.
  • Zapisz to samo zdanie wejściowe wraz z jego encjami w odpowiednim formacie treningowym jako training_data.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Edytuj i uruchom kod