НачатьНачать бесплатно

Качество работы модели на ваших данных

В этом упражнении вы попрактикуетесь в оценке существующей модели на своих данных. Цель — проанализировать качество модели для конкретной метки сущности, PRODUCT. Если модель правильно распознаёт большой процент сущностей PRODUCT (например, более 75%), дополнительное обучение на примерах PRODUCT не требуется. В противном случае стоит рассмотреть возможность дообучения модели для улучшения предсказаний сущности PRODUCT.

Для этого упражнения используются два отзыва из набора данных Amazon Fine Food Reviews. Получить к ним доступ можно с помощью списка texts.

Модель en_core_web_sm уже загружена. Обращаться к ней можно через вызов nlp(). Модель уже применена к списку texts, а documents — список контейнеров Doc — доступен для использования.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Сформируйте список target_entities из всех сущностей каждого документа из documents, добавляя кортеж (текст сущности, метка сущности) только в том случае, если в тексте сущности содержится Jumbo.
  • Для каждого кортежа из target_entities добавьте True в список correct_labels, если метка сущности (второй элемент кортежа) равна PRODUCT, в противном случае добавьте False.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Append a tuple of (entities text, entities label) if Jumbo is in the entity
target_entities = []
for doc in ____:
  target_entities.extend([(ent.____, ent.____) for ent in doc.____ if "Jumbo" in ent.text])
print(target_entities)

# Append True to the correct_labels list if the entity label is `PRODUCT`
correct_labels = []
for ent in target_entities:
  if ____[1] == "PRODUCT":
    correct_labels.append(____)
  else:
    correct_labels.append(____)
print(correct_labels)
Редактировать и запускать код