Обработка текста с помощью spaCy
Любое NLP-приложение включает несколько шагов обработки текста. Вы уже познакомились с некоторыми из них: токенизацией, лемматизацией, сегментацией на предложения и распознаванием именованных сущностей.
В этом упражнении вы продолжите работу с шагами обработки текста в spaCy: разобьёте текст на предложения и извлечёте именованные сущности. Для работы вы будете использовать первые пять отзывов из набора данных Amazon Fine Food Reviews. Доступ к ним осуществляется через объект texts.
Модель en_core_web_sm уже загружена и доступна через переменную nlp. Список контейнеров Doc для каждого элемента texts также предварительно загружен и доступен через переменную documents.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)