Zacznij terazZacznij za darmo

Tokenizacja przemówienia gettysburskiego

W tym ćwiczeniu przeprowadzisz tokenizację jednego z najsłynniejszych przemówień w historii: mowy gettysburskiej wygłoszonej przez prezydenta USA Abrahama Lincolna podczas amerykańskiej wojny secesyjnej.

Całe przemówienie jest dostępne jako ciąg znaków o nazwie gettysburg.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj model en_core_web_sm za pomocą spacy.load().
  • Utwórz obiekt Doc o nazwie doc dla ciągu znaków gettysburg.
  • Używając wyrażenia listowego, przejdź pętlą po doc, aby wygenerować teksty tokenów.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

import spacy

# Load the en_core_web_sm model
nlp = ____.____(____)

# Create a Doc object
doc = ____(____)

# Generate the tokens
tokens = [token.____ for token in ____]
print(tokens)
Edytuj i uruchom kod