Zacznij terazZacznij za darmo

Tokenizacja ciągu znaków z GoT

Pierwszym standardowym krokiem w pracy z tekstem jest jego tokenizacja – innymi słowy, podział większego ciągu znaków na pojedyncze elementy, którymi zazwyczaj są pojedyncze wyrazy (tokeny).

Przygotowano dla ciebie ciąg znaków GoT, który zawiera cytat z Gry o tron George'a R.R. Martina. Twoim zadaniem jest podzielenie go na pojedyncze tokeny.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcję tokenizującą wyrazy z nltk.
  • Przekształć ciąg znaków GoT na tokeny wyrazowe.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the required function
from nltk import ____

# Transform the GoT string to word tokens
print(____(____))
Edytuj i uruchom kod