Zacznij terazZacznij za darmo

Zamiana na małe litery

Analizujesz recenzje użytkowników serwisu turystycznego. Teksty często zawierają niespójną wielkość liter – na przykład "TRAVEL" i "travel". Aby przygotować dane do analizy sentymentu i ekstrakcji tematów, najpierw zamienisz wszystkie słowa na małe litery, a następnie poddasz tekst tokenizacji i usuniesz z niego stop słowa oraz znaki interpunkcyjne.

Funkcja word_tokenize() oraz lista stop_words są już dostępne. Zasoby NLTK zostały wcześniej pobrane.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zamień podaną zmienną review na małe litery.
  • Przeprowadź tokenizację zmiennej lower_text na pojedyncze słowa.
  • Użyj wyrażenia listowego, aby usunąć stop słowa i znaki interpunkcyjne, korzystając z list stop_words oraz string.punctuation.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
Edytuj i uruchom kod