ПочатиПочніть безкоштовно

Лематизація у spaCy

У цій вправі ви попрактикуєте лематизацію. Лематизація допомагає отримувати початкову форму похідних слів. Це означає, що для будь-якого речення кількість лем має бути меншою або дорівнювати кількості токенів.

Перший відгук про їжу з Amazon наведено для вас у рядку text. en_core_web_sm завантажено як nlp і запущено на text, щоб отримати document — контейнер Doc для цього рядка тексту.

Список tokens, що містить токени для text, також уже підготовлено для вашого використання.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інструкції до вправи

  • Додайте лему для всіх токенів у document, потім виведіть список lemmas.
  • Виведіть список tokens і порівняйте різницю між tokens та lemmas.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Редагувати та запускати код