Tokenizacja przemówienia gettysburskiego
W tym ćwiczeniu przeprowadzisz tokenizację jednego z najsłynniejszych przemówień w historii: mowy gettysburskiej wygłoszonej przez prezydenta USA Abrahama Lincolna podczas amerykańskiej wojny secesyjnej.
Całe przemówienie jest dostępne jako ciąg znaków o nazwie gettysburg.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Wczytaj model
en_core_web_smza pomocąspacy.load(). - Utwórz obiekt Doc o nazwie
docdla ciągu znakówgettysburg. - Używając wyrażenia listowego, przejdź pętlą po
doc, aby wygenerować teksty tokenów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import spacy
# Load the en_core_web_sm model
nlp = ____.____(____)
# Create a Doc object
doc = ____(____)
# Generate the tokens
tokens = [token.____ for token in ____]
print(tokens)