Сегментация текста на предложения с помощью spaCy
В этом упражнении вы попрактикуетесь в сегментации текста на предложения. В обработке естественного языка разбиение документа на предложения — полезная базовая операция, с которой начинаются многие более сложные задачи, например распознавание именованных сущностей. Кроме того, подсчёт количества предложений помогает оценить объём информации, содержащейся в тексте.
Десять отзывов о продуктах питания доступны в списке texts.
Модель en_core_web_sm уже загружена для вас как nlp.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Примените модель
spaCyк каждому элементу спискаtexts, чтобы сформироватьdocuments— список всех контейнеровDoc. - Извлеките предложения из каждого контейнера
doc, перебрав списокdocuments, и добавьте их в списокsentences. - Подсчитайте количество предложений в каждом контейнере
doc, используя списокsentences.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])