НачатьНачать бесплатно

Разметка частей речи с помощью spaCy

В этом упражнении вы попрактикуетесь в разметке частей речи. Это полезный инструмент в NLP: он помогает алгоритмам понимать грамматическую структуру предложения и распознавать слова с несколькими значениями, например watch и play.

Для этого упражнения модель en_core_web_sm уже загружена как nlp. Три комментария из набора данных Airline Travel Information System (ATIS) предоставлены в списке texts.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • С помощью списочного включения создайте список documents, содержащий контейнеры doc для каждого текста из списка texts.
  • Для каждого контейнера doc выведите текст каждого токена и соответствующий тег части речи, перебирая элементы documents и токены каждого контейнера doc с помощью вложенного цикла for.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]

# Print token texts and POS tags for each Doc container
for doc in documents:
    for ____ in doc:
        print("Text: ", ____, "| POS tag: ", ____)
    print("\n")
Редактировать и запускать код