Стеми з твітів
У цій вправі ви працюватимете з масивом tweets. Він містить тексти даних про настрій пасажирів авіаліній, зібрані з Twitter.
Ваше завдання — опрацювати цей масив і перетворити його на список токенів за допомогою спискового включення (list comprehension). Після цього проітеруйтеся списком токенів і створіть стем для кожного токена. Пам'ятайте, що спискові включення — це однорядкова альтернатива циклам for.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте функцію, яку ми використовували, щоб перетворювати рядки на стеми.
- Викличте функцію стемера Портера, яку ви щойно імпортували.
- За допомогою спискового включення створіть список
tokens. Він має містити всі словесні токени з масивуtweets. - Проітеруйтеся списком
tokensі застосуйте функцію стемінгу до кожного елемента списку.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the function to perform stemming
____
from nltk import word_tokenize
# Call the stemmer
porter = ____()
# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens]
# Print the first element of the list
print(stemmed_tokens[0])