Tokenizacja ciągu znaków z GoT
Pierwszym standardowym krokiem w pracy z tekstem jest jego tokenizacja – innymi słowy, podział większego ciągu znaków na pojedyncze elementy, którymi zazwyczaj są pojedyncze wyrazy (tokeny).
Przygotowano dla ciebie ciąg znaków GoT, który zawiera cytat z Gry o tron George'a R.R. Martina. Twoim zadaniem jest podzielenie go na pojedyncze tokeny.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcję tokenizującą wyrazy z
nltk. - Przekształć ciąg znaków
GoTna tokeny wyrazowe.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the required function
from nltk import ____
# Transform the GoT string to word tokens
print(____(____))