एनोटेशन और प्रशिक्षण डेटा की तैयारी
डेटा इकट्ठा करने के बाद, आप spaCy मॉडल के लिए आवश्यक फॉर्मेट में डेटा को annotate कर सकते हैं। इस अभ्यास में, आप मेडिकल डोमेन में एक NER टास्क के लिए सही annotated डेटा रिकॉर्ड बनाना सीखेंगे।
एक sentence और दो entities उपलब्ध हैं: entity_1 जिसका टेक्स्ट chest pain है और टाइप SYMPTOM है, तथा entity_2 जिसका टेक्स्ट hyperthyroidism है और टाइप DISEASE है, जिन्हें आप उपयोग करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
annotated_dataरिकॉर्ड को सही फॉर्मेट में पूरा करें.- प्रत्येक entity के start और end characters निकालकर संबंधित वैरिएबल्स में स्टोर करें.
- उसी इनपुट sentence और उसकी entities को उचित प्रशिक्षण फॉर्मेट में
training_dataके रूप में स्टोर करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
text = "A patient with chest pain had hyperthyroidism."
entity_1 = "chest pain"
entity_2 = "hyperthyroidism"
# Store annotated data information in the correct format
annotated_data = {"sentence": ____, "entities": [{"label": "SYMPTOM", "value": ____}, {"label": "DISEASE", "value": ____}]}
# Extract start and end characters of each entity
entity_1_start_char = text.____(____)
entity_1_end_char = entity_1_start_char + len(____)
entity_2_start_char = text.____(____)
entity_2_end_char = entity_2_start_char + len(____)
# Store the same input information in the proper format for training
training_data = [(____, {"entities": [(____,____,"SYMPTOM"),
(____,____,"DISEASE")]})]
print(training_data)