ПочатиПочніть безкоштовно

Обробка тексту зі spaCy

Кожен застосунок для NLP складається з кількох кроків обробки тексту. Ви вже вивчили деякі з них: токенізацію, лематизацію, сегментацію речень і розпізнавання іменованих сутностей.

spaCy NLP Pipeline

У цій вправі ви продовжите практикувати кроки обробки тексту в spaCy, зокрема поділ тексту на речення та виділення іменованих сутностей. Для вправи ви використаєте перші п'ять відгуків із набору даних Amazon Fine Food Reviews. Дістатися до цих відгуків можна через об'єкт texts.

Модель en_core_web_sm уже завантажено для вас, доступ до неї — через nlp. Список контейнерів Doc для кожного елемента в texts також попередньо створено й доступний у documents.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
Редагувати та запускати код