Tokenizacja zdań i słów
Tokenizacja to ważny pierwszy krok w NLP. Polega na podziale tekstu na mniejsze jednostki zwane tokenami, co jest kluczowe przy pracy z danymi językowymi. Twoim zadaniem jest tokenizacja fragmentu artykułu prasowego – najpierw na zdania, a następnie na słowa.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego (NLP) w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)