Tokenizace vět a slov
Tokenizace je důležitý první krok v NLP. Spočívá v rozdělení textu na menší jednotky zvané tokeny, což je klíčové pro práci s jazykovými daty. Tvým úkolem je tokenizovat úryvek z novinového článku na věty a slova.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka (NLP) v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)