Tokenisation des phrases et des mots
La tokenisation est une première étape essentielle en NLP. Elle consiste à découper le texte en unités plus petites appelées jetons (tokens), ce qui est crucial pour travailler avec des données linguistiques. Votre tâche consiste à tokeniser un extrait d'article de presse à la fois en phrases et en mots.
Cette activité fait partie du cours
Natural Language Processing (NLP) en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)