Tokenizarea propozițiilor și a cuvintelor
Tokenizarea este un prim pas esențial în NLP. Presupune împărțirea textului în unități mai mici numite tokenuri, ceea ce este fundamental pentru lucrul cu date lingvistice. Sarcina ta este să tokenizezi un fragment dintr-un articol de știri atât în propoziții, cât și în cuvinte.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)