НачатьНачать бесплатно

Очистка TED-выступлений в датафрейме

В этом упражнении мы вернёмся к TED-выступлениям из первой главы. Вам предоставлен датафрейм ted, содержащий 5 TED-выступлений. Ваша задача — очистить эти тексты с помощью рассмотренных ранее техник: напишите функцию preprocess и примените её к признаку transcript датафрейма.

Список стоп-слов доступен в переменной stopwords.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте объект Doc для text. Пока не обращайте внимания на аргумент disable.
  • Сформируйте список лемм с помощью генератора списка, используя атрибут lemma_.
  • Удалите небуквенные символы, применив isalpha() в условии if.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Редактировать и запускать код