Začněte nyníZačněte zdarma

Tokenizace vět a slov

Tokenizace je důležitý první krok v NLP. Spočívá v rozdělení textu na menší jednotky zvané tokeny, což je klíčové pro práci s jazykovými daty. Tvým úkolem je tokenizovat úryvek z novinového článku na věty a slova.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import nltk
____
# Download the punkt_tab package 
____

text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""

# Tokenize the text into sentences
sentences = ____
print(sentences)
Upravit a spustit kód