Začněte nyníZačněte zdarma

Převod na malá písmena

Analyzuješ uživatelské recenze cestovního webu. Tyto recenze často obsahují nekonzistentní velikost písmen – například "TRAVEL" a "travel". Aby byl text připravený pro analýzu sentimentu a extrakci témat, nejprve převedeš všechna slova na malá písmena, pak je tokenizuješ a odstraníš stop slova a interpunkci.

Funkce word_tokenize() a seznam stop_words jsou již k dispozici. Zdroje NLTK jsou stažené.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Převeď zadanou proměnnou review na malá písmena.
  • Tokenizuj lower_text na jednotlivá slova.
  • Pomocí list comprehension odstraň stop slova a interpunkci s využitím seznamů stop_words a string.punctuation.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
Upravit a spustit kód