Zacznij terazZacznij za darmo

Tokenizacja zdań i słów

Tokenizacja to ważny pierwszy krok w NLP. Polega na podziale tekstu na mniejsze jednostki zwane tokenami, co jest kluczowe przy pracy z danymi językowymi. Twoim zadaniem jest tokenizacja fragmentu artykułu prasowego – najpierw na zdania, a następnie na słowa.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import nltk
____
# Download the punkt_tab package 
____

text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""

# Tokenize the text into sentences
sentences = ____
print(sentences)
Edytuj i uruchom kod