Додавання компонентів (pipes) у spaCy
Ви часто використовуєте наявну модель spaCy для різних NLP-завдань. Однак інколи стандартний компонент конвеєра, як-от сегментація речень, може довго працювати, перш ніж дасть очікуваний результат. У цій вправі ви потренуєтеся додавати компонент конвеєра до моделі spaCy (конвеєра обробки тексту).
Для вправи ви використаєте перші п'ять відгуків із набору Amazon Fine Food Reviews. Ви можете отримати доступ до цих відгуків за допомогою рядка texts.
Пакет spaCy уже імпортовано — ви можете ним користуватися.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Завантажте порожню англомовну модель
spaCyта додайте до неї компонентsentencizer. - Створіть контейнер
Docдляtexts, створіть список для збереженняsentencesзаданого документа та виведіть кількість речень. - Виведіть список токенів у другому реченні зі списку
sentences.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])