Annotation et préparation des données d'entraînement
Après avoir rassemblé des données, vous pouvez les annoter dans le format requis pour un modèle spaCy. Dans cet exercice, vous allez vous exercer à créer un enregistrement de données annotées correct pour une tâche de NER dans le domaine médical.
Un sentence et deux entités, entity_1 avec le texte chest pain et de type SYMPTOM, ainsi que entity_2 avec le texte hyperthyroidism et de type DISEASE, sont mis à votre disposition.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Instructions de l’exercice
- Complétez l'enregistrement
annotated_datadans le format approprié. - Extrayez les caractères de début et de fin de chaque entité et stockez-les dans les variables correspondantes.
- Enregistrez la même phrase d'entrée et ses entités dans le format d'entraînement approprié sous
training_data.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)