Rdzenie słów z tweetów
W tym ćwiczeniu będziesz pracować z tablicą tweets, która zawiera teksty z twitterowych danych o nastrojach pasażerów linii lotniczych.
Twoim zadaniem jest przekształcenie tej tablicy w listę tokenów za pomocą składni listowej. Następnie przeiteruj po liście tokenów i utwórz rdzeń z każdego tokenu. Pamiętaj, że składnia listowa to jednowierszowa alternatywa dla pętli for.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcję używaną do przekształcania ciągów znaków w rdzenie słów.
- Wywołaj właśnie zaimportowaną funkcję stematyzatora Portera.
- Korzystając ze składni listowej, utwórz listę
tokenszawierającą wszystkie tokeny słów z tablicytweets. - Przeiteruj po liście
tokensi zastosuj funkcję stematyzacji na każdym jej elemencie.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the function to perform stemming
____
from nltk import word_tokenize
# Call the stemmer
porter = ____()
# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens]
# Print the first element of the list
print(stemmed_tokens[0])