НачатьНачать бесплатно

Лемматизация с помощью spaCy

В этом упражнении вы попрактикуетесь в лемматизации. Лемматизация помогает получить исходную форму производных слов. Это означает, что для любого предложения количество лемм будет меньше или равно количеству токенов.

Первый отзыв о продукте Amazon уже загружен в строку text. Модель en_core_web_sm загружена как nlp и применена к text для создания объекта document — контейнера Doc для текстовой строки.

Список tokens, содержащий токены для text, также уже доступен для работы.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Добавьте лемму для каждого токена из document в список, затем выведите список lemmas.
  • Выведите список tokens и сравните различия между tokens и lemmas.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Редактировать и запускать код