CommencezCommencez gratuitement

Tokenisation des phrases et des mots

La tokenisation est une première étape essentielle en NLP. Elle consiste à découper le texte en unités plus petites appelées jetons (tokens), ce qui est crucial pour travailler avec des données linguistiques. Votre tâche consiste à tokeniser un extrait d'article de presse à la fois en phrases et en mots.

Cette activité fait partie du cours

Natural Language Processing (NLP) en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import nltk
____
# Download the punkt_tab package 
____

text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""

# Tokenize the text into sentences
sentences = ____
print(sentences)
Modifier et exécuter le code