НачатьНачать бесплатно

Токенизация Геттисбергской речи

В этом упражнении вы выполните токенизацию одной из самых знаменитых речей в истории — Геттисбергской речи президента США Авраама Линкольна, произнесённой в годы Гражданской войны.

Полный текст речи доступен в виде строки gettysburg.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Загрузите модель en_core_web_sm с помощью spacy.load().
  • Создайте объект Doc с именем doc для строки gettysburg.
  • Используя генератор списков, выполните итерацию по doc и получите тексты токенов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

import spacy

# Load the en_core_web_sm model
nlp = ____.____(____)

# Create a Doc object
doc = ____(____)

# Generate the tokens
tokens = [token.____ for token in ____]
print(tokens)
Редактировать и запускать код