НачатьНачать бесплатно

Основы слов из твитов

В этом упражнении вы будете работать с массивом tweets, который содержит тексты данных о тональности авиакомпаний, собранных из Twitter.

Ваша задача — преобразовать этот массив в список токенов с помощью списочного включения. Затем пройдитесь по списку токенов и извлеките основу каждого токена. Напомним, что списочные включения — это однострочная альтернатива циклу for.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию, которая преобразует строки в основы слов.
  • Вызовите только что импортированный стеммер Портера.
  • С помощью списочного включения создайте список tokens, содержащий все токены слов из массива tweets.
  • Пройдитесь по списку tokens и примените функцию стемминга к каждому его элементу.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
Редактировать и запускать код