Токенизация с помощью spaCy
В этом упражнении вы попрактикуетесь в токенизации текста. Для работы используется первый отзыв из набора данных Amazon Fine Food Reviews — он доступен через объект text.
Модель en_core_web_sm уже загружена. Обратиться к ней можно с помощью функции nlp(). Для формирования списков результатов можно использовать list comprehension.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Сохраните контейнер Doc для предварительно загруженного отзыва в объект
document. - Сохраните тексты всех токенов из
documentв переменнуюfirst_text_tokensи проверьте их.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")