ПочатиПочніть безкоштовно

Стеми з твітів

У цій вправі ви працюватимете з масивом tweets. Він містить тексти даних про настрій пасажирів авіаліній, зібрані з Twitter.

Ваше завдання — опрацювати цей масив і перетворити його на список токенів за допомогою спискового включення (list comprehension). Після цього проітеруйтеся списком токенів і створіть стем для кожного токена. Пам'ятайте, що спискові включення — це однорядкова альтернатива циклам for.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію, яку ми використовували, щоб перетворювати рядки на стеми.
  • Викличте функцію стемера Портера, яку ви щойно імпортували.
  • За допомогою спискового включення створіть список tokens. Він має містити всі словесні токени з масиву tweets.
  • Проітеруйтеся списком tokens і застосуйте функцію стемінгу до кожного елемента списку.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
Редагувати та запускати код