НачатьНачать бесплатно

Добавление компонентов в конвейер spaCy

В работе с различными задачами NLP часто используются готовые модели spaCy. Однако в некоторых случаях стандартный компонент конвейера, например сегментация на предложения, может работать слишком долго. В этом упражнении вы потренируетесь добавлять компонент в модель spaCy (конвейер обработки текста).

Вы будете работать с первыми пятью отзывами из набора данных Amazon Fine Food Reviews. Доступ к этим отзывам можно получить через строку texts.

Пакет spaCy уже импортирован и готов к использованию.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Загрузите пустую англоязычную модель spaCy и добавьте в неё компонент sentencizer.
  • Создайте контейнер Doc для texts, сформируйте список sentences для хранения предложений документа и выведите их количество.
  • Выведите список токенов второго предложения из списка sentences.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Редактировать и запускать код