ПочатиПочніть безкоштовно

Токенізація у spaCy

У цій вправі ви потренуєтеся токенізувати текст. Ви використаєте першу рецензію з набору даних Amazon Fine Food Reviews. Доступ до цієї рецензії можна отримати через об'єкт text, який надано.

Модель en_core_web_sm уже завантажено для вас. Доступ до неї можна отримати, викликавши nlp(). Ви можете використати спискове включення, щоб зібрати вихідні списки.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інструкції до вправи

  • Збережіть контейнер Doc для попередньо завантаженої рецензії в об'єкті document.
  • Збережіть і перегляньте тексти всіх токенів document у змінній first_text_tokens.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Редагувати та запускати код