НачатьНачать бесплатно

Токенизация с помощью spaCy

В этом упражнении вы попрактикуетесь в токенизации текста. Для работы используется первый отзыв из набора данных Amazon Fine Food Reviews — он доступен через объект text.

Модель en_core_web_sm уже загружена. Обратиться к ней можно с помощью функции nlp(). Для формирования списков результатов можно использовать list comprehension.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Сохраните контейнер Doc для предварительно загруженного отзыва в объект document.
  • Сохраните тексты всех токенов из document в переменную first_text_tokens и проверьте их.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Редактировать и запускать код