Качество работы модели на ваших данных
В этом упражнении вы попрактикуетесь в оценке существующей модели на своих данных. Цель — проанализировать качество модели для конкретной метки сущности, PRODUCT. Если модель правильно распознаёт большой процент сущностей PRODUCT (например, более 75%), дополнительное обучение на примерах PRODUCT не требуется. В противном случае стоит рассмотреть возможность дообучения модели для улучшения предсказаний сущности PRODUCT.
Для этого упражнения используются два отзыва из набора данных Amazon Fine Food Reviews. Получить к ним доступ можно с помощью списка texts.
Модель en_core_web_sm уже загружена. Обращаться к ней можно через вызов nlp(). Модель уже применена к списку texts, а documents — список контейнеров Doc — доступен для использования.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Сформируйте список
target_entitiesиз всех сущностей каждого документа изdocuments, добавляя кортеж (текст сущности, метка сущности) только в том случае, если в тексте сущности содержитсяJumbo. - Для каждого кортежа из
target_entitiesдобавьтеTrueв списокcorrect_labels, если метка сущности (второй элемент кортежа) равнаPRODUCT, в противном случае добавьтеFalse.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Append a tuple of (entities text, entities label) if Jumbo is in the entity
target_entities = []
for doc in ____:
target_entities.extend([(ent.____, ent.____) for ent in doc.____ if "Jumbo" in ent.text])
print(target_entities)
# Append True to the correct_labels list if the entity label is `PRODUCT`
correct_labels = []
for ent in target_entities:
if ____[1] == "PRODUCT":
correct_labels.append(____)
else:
correct_labels.append(____)
print(correct_labels)