CommencezCommencez gratuitement

Annotation et préparation des données d'entraînement

Après avoir rassemblé des données, vous pouvez les annoter dans le format requis pour un modèle spaCy. Dans cet exercice, vous allez vous exercer à créer un enregistrement de données annotées correct pour une tâche de NER dans le domaine médical.

Un sentence et deux entités, entity_1 avec le texte chest pain et de type SYMPTOM, ainsi que entity_2 avec le texte hyperthyroidism et de type DISEASE, sont mis à votre disposition.

Cette activité fait partie du cours

Traitement du langage naturel avec spaCy

Voir le cours

Instructions de l’exercice

  • Complétez l'enregistrement annotated_data dans le format approprié.
  • Extrayez les caractères de début et de fin de chaque entité et stockez-les dans les variables correspondantes.
  • Enregistrez la même phrase d'entrée et ses entités dans le format d'entraînement approprié sous training_data.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"

# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}

# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)

# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"), 
                                      (____,____,"DISEASE")]})]
print(training_data)
Modifier et exécuter le code