Лематизація у spaCy
У цій вправі ви попрактикуєте лематизацію. Лематизація допомагає отримувати початкову форму похідних слів. Це означає, що для будь-якого речення кількість лем має бути меншою або дорівнювати кількості токенів.
Перший відгук про їжу з Amazon наведено для вас у рядку text. en_core_web_sm завантажено як nlp і запущено на text, щоб отримати document — контейнер Doc для цього рядка тексту.
Список tokens, що містить токени для text, також уже підготовлено для вашого використання.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Додайте лему для всіх токенів у
document, потім виведіть списокlemmas. - Виведіть список
tokensі порівняйте різницю міжtokensтаlemmas.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)