НачатьНачать бесплатно

Обработка текста с помощью spaCy

Любое NLP-приложение включает несколько шагов обработки текста. Вы уже познакомились с некоторыми из них: токенизацией, лемматизацией, сегментацией на предложения и распознаванием именованных сущностей.

spaCy NLP Pipeline

В этом упражнении вы продолжите работу с шагами обработки текста в spaCy: разобьёте текст на предложения и извлечёте именованные сущности. Для работы вы будете использовать первые пять отзывов из набора данных Amazon Fine Food Reviews. Доступ к ним осуществляется через объект texts.

Модель en_core_web_sm уже загружена и доступна через переменную nlp. Список контейнеров Doc для каждого элемента texts также предварительно загружен и доступен через переменную documents.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
Редактировать и запускать код