Tokenisering av meningar och ord
Tokenisering är ett viktigt första steg inom NLP. Det innebär att man delar upp text i mindre enheter som kallas tokens, vilket är grundläggande för att arbeta med språkdata. Din uppgift är att tokenisera ett utdrag ur en nyhetsartikel på både menings- och ordnivå.
Den här övningen är en del av kursen
Natural Language Processing (NLP) i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)