Omvandling till gemener
Du analyserar användarrecensioner för en resewebbplats. Recensionerna innehåller ofta inkonsekvent versalisering, till exempel "TRAVEL" och "travel". För att förbereda texten inför sentimentanalys och ämnesextrahering konverterar du först alla ord till gemener, tokeniserar dem och rensar bort stoppord och skiljetecken.
Funktionen word_tokenize() och en lista stop_words har redan tillhandahållits. NLTK-resurser är redan nedladdade.
Den här övningen är en del av kursen
Natural Language Processing (NLP) i Python
Övningsinstruktioner
- Konvertera den angivna
reviewtill gemener. - Tokenisera
lower_texttill ord. - Använd listomfattning för att ta bort stoppord och skiljetecken med hjälp av listorna
stop_wordsochstring.punctuation.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"
# Lowercase the review
lower_text = ____
# Tokenize the lower_text into words
tokens = ____
# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]
print(clean_tokens)