Якість моделі на ваших даних
У цій вправі ви потренуєтеся оцінювати наявну модель на ваших даних. Мета — перевірити якість моделі для конкретної мітки сутності PRODUCT. Якщо модель правильно класифікує велику частку сутностей PRODUCT (наприклад, понад 75%), вам не потрібно додатково навчати модель на прикладах із сутністю PRODUCT. Інакше варто розглянути донавчання моделі, щоб покращити її точність для прогнозування сутності PRODUCT.
Для цієї вправи ви використаєте два відгуки з набору даних Amazon Fine Food Reviews. Ви можете отримати до них доступ через список texts.
Модель en_core_web_sm уже завантажено для вас. Звертайтеся до неї, викликаючи nlp(). Модель уже запущено на списку texts, і для вашого використання доступний documents — список контейнерів Doc.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Скомпілюйте список
target_entitiesз усіх сутностей для кожного зdocumentsі додайте кортеж (текст сутності, мітка сутності) лише якщо в тексті сутності єJumbo. - Для кожного кортежу в
target_entitiesдодайтеTrueдо спискуcorrect_labels, якщо мітка сутності (другий елемент у кортежі) дорівнюєPRODUCT, інакше додайтеFalse.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Append a tuple of (entities text, entities label) if Jumbo is in the entity
target_entities = []
for doc in ____:
target_entities.extend([(ent.____, ent.____) for ent in doc.____ if "Jumbo" in ent.text])
print(target_entities)
# Append True to the correct_labels list if the entity label is `PRODUCT`
correct_labels = []
for ent in target_entities:
if ____[1] == "PRODUCT":
correct_labels.append(____)
else:
correct_labels.append(____)
print(correct_labels)