НачатьНачать бесплатно

Сегментация текста на предложения с помощью spaCy

В этом упражнении вы попрактикуетесь в сегментации текста на предложения. В обработке естественного языка разбиение документа на предложения — полезная базовая операция, с которой начинаются многие более сложные задачи, например распознавание именованных сущностей. Кроме того, подсчёт количества предложений помогает оценить объём информации, содержащейся в тексте.

Десять отзывов о продуктах питания доступны в списке texts.

Модель en_core_web_sm уже загружена для вас как nlp.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Примените модель spaCy к каждому элементу списка texts, чтобы сформировать documents — список всех контейнеров Doc.
  • Извлеките предложения из каждого контейнера doc, перебрав список documents, и добавьте их в список sentences.
  • Подсчитайте количество предложений в каждом контейнере doc, используя список sentences.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
Редактировать и запускать код