Сегментація речень у spaCy
У цій вправі ви попрактикуєтеся в сегментації речень. В обробці природної мови поділ документа на речення — корисна базова операція. Це один із перших кроків у багатьох складніших завданнях НЛП, наприклад виявленні іменованих сутностей. Крім того, кількість речень може підказати, скільки інформації містить текст.
У вас є доступ до десяти відгуків про їжу в списку texts.
Модель en_core_web_sm уже завантажено як nlp і .
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Запустіть модель
spaCyдля кожного елемента у спискуtexts, щоб зібратиdocuments— список усіх контейнерівDoc. - Видобудьте речення з кожного контейнера
doc, ітеруючись спискомdocuments, і додайте їх до спискуsentences. - Порахуйте кількість речень у кожному контейнері
doc, використовуючи списокsentences.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])