POS-розмічування у spaCy
У цій вправі ви потренуєтеся в POS-розмічуванні. POS-розмічування корисне в NLP, адже воно допомагає алгоритмам розуміти граматичну структуру речення та визначати слова з кількома значеннями, наприклад watch і play.
Для цієї вправи en_core_web_sm уже завантажено як nlp. Три коментарі з набору даних ATIS (Airline Travel Information System) надано у списку texts.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Створіть
documents— список усіх контейнерівdocдля кожного тексту у спискуtexts, використавши list comprehension. - Для кожного контейнера
docвиведіть текст кожного токена та відповідну POS-мітку, ітеруючись поdocumentsі токенах кожногоdocза допомогою вкладеного циклу for.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]
# Print token texts and POS tags for each Doc container
for doc in documents:
for ____ in doc:
print("Text: ", ____, "| POS tag: ", ____)
print("\n")