Zacznij terazZacznij za darmo

Rdzenie słów z tweetów

W tym ćwiczeniu będziesz pracować z tablicą tweets, która zawiera teksty z twitterowych danych o nastrojach pasażerów linii lotniczych.

Twoim zadaniem jest przekształcenie tej tablicy w listę tokenów za pomocą składni listowej. Następnie przeiteruj po liście tokenów i utwórz rdzeń z każdego tokenu. Pamiętaj, że składnia listowa to jednowierszowa alternatywa dla pętli for.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcję używaną do przekształcania ciągów znaków w rdzenie słów.
  • Wywołaj właśnie zaimportowaną funkcję stematyzatora Portera.
  • Korzystając ze składni listowej, utwórz listę tokens zawierającą wszystkie tokeny słów z tablicy tweets.
  • Przeiteruj po liście tokens i zastosuj funkcję stematyzacji na każdym jej elemencie.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
Edytuj i uruchom kod