Добавление компонентов в конвейер spaCy
В работе с различными задачами NLP часто используются готовые модели spaCy. Однако в некоторых случаях стандартный компонент конвейера, например сегментация на предложения, может работать слишком долго. В этом упражнении вы потренируетесь добавлять компонент в модель spaCy (конвейер обработки текста).
Вы будете работать с первыми пятью отзывами из набора данных Amazon Fine Food Reviews. Доступ к этим отзывам можно получить через строку texts.
Пакет spaCy уже импортирован и готов к использованию.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Загрузите пустую англоязычную модель
spaCyи добавьте в неё компонентsentencizer. - Создайте контейнер
Docдляtexts, сформируйте списокsentencesдля хранения предложений документа и выведите их количество. - Выведите список токенов второго предложения из списка
sentences.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])