Основы слов из твитов
В этом упражнении вы будете работать с массивом tweets, который содержит тексты данных о тональности авиакомпаний, собранных из Twitter.
Ваша задача — преобразовать этот массив в список токенов с помощью списочного включения. Затем пройдитесь по списку токенов и извлеките основу каждого токена. Напомним, что списочные включения — это однострочная альтернатива циклу for.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте функцию, которая преобразует строки в основы слов.
- Вызовите только что импортированный стеммер Портера.
- С помощью списочного включения создайте список
tokens, содержащий все токены слов из массиваtweets. - Пройдитесь по списку
tokensи примените функцию стемминга к каждому его элементу.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the function to perform stemming
____
from nltk import word_tokenize
# Call the stemmer
porter = ____()
# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens]
# Print the first element of the list
print(stemmed_tokens[0])