Převod na malá písmena
Analyzuješ uživatelské recenze cestovního webu. Tyto recenze často obsahují nekonzistentní velikost písmen – například "TRAVEL" a "travel". Aby byl text připravený pro analýzu sentimentu a extrakci témat, nejprve převedeš všechna slova na malá písmena, pak je tokenizuješ a odstraníš stop slova a interpunkci.
Funkce word_tokenize() a seznam stop_words jsou již k dispozici. Zdroje NLTK jsou stažené.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka (NLP) v Pythonu
Pokyny k cvičení
- Převeď zadanou proměnnou
reviewna malá písmena. - Tokenizuj
lower_textna jednotlivá slova. - Pomocí list comprehension odstraň stop slova a interpunkci s využitím seznamů
stop_wordsastring.punctuation.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"
# Lowercase the review
lower_text = ____
# Tokenize the lower_text into words
tokens = ____
# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]
print(clean_tokens)