Adnotacje i przygotowanie danych treningowych
Po zebraniu danych możesz je opatrzyć adnotacjami w formacie wymaganym przez model spaCy. W tym ćwiczeniu przećwiczysz tworzenie poprawnego rekordu z adnotacjami dla zadania NER w dziedzinie medycznej.
Do dyspozycji masz zmienną sentence oraz dwie encje: entity_1 z tekstem chest pain i typem SYMPTOM, a także entity_2 z tekstem hyperthyroidism i typem DISEASE.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Uzupełnij rekord
annotated_dataw poprawnym formacie. - Wyodrębnij indeksy pierwszego i ostatniego znaku każdej encji i zapisz je w odpowiednich zmiennych.
- Zapisz to samo zdanie wejściowe wraz z jego encjami w odpowiednim formacie treningowym jako
training_data.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)