Токенізація у spaCy
У цій вправі ви потренуєтеся токенізувати текст. Ви використаєте першу рецензію з набору даних Amazon Fine Food Reviews. Доступ до цієї рецензії можна отримати через об'єкт text, який надано.
Модель en_core_web_sm уже завантажено для вас. Доступ до неї можна отримати, викликавши nlp(). Ви можете використати спискове включення, щоб зібрати вихідні списки.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Збережіть контейнер Doc для попередньо завантаженої рецензії в об'єкті
document. - Збережіть і перегляньте тексти всіх токенів
documentу зміннійfirst_text_tokens.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")