Лемматизация с помощью spaCy
В этом упражнении вы попрактикуетесь в лемматизации. Лемматизация помогает получить исходную форму производных слов. Это означает, что для любого предложения количество лемм будет меньше или равно количеству токенов.
Первый отзыв о продукте Amazon уже загружен в строку text. Модель en_core_web_sm загружена как nlp и применена к text для создания объекта document — контейнера Doc для текстовой строки.
Список tokens, содержащий токены для text, также уже доступен для работы.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Добавьте лемму для каждого токена из
documentв список, затем выведите списокlemmas. - Выведите список
tokensи сравните различия междуtokensиlemmas.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)