Очистка TED-выступлений в датафрейме
В этом упражнении мы вернёмся к TED-выступлениям из первой главы. Вам предоставлен датафрейм ted, содержащий 5 TED-выступлений. Ваша задача — очистить эти тексты с помощью рассмотренных ранее техник: напишите функцию preprocess и примените её к признаку transcript датафрейма.
Список стоп-слов доступен в переменной stopwords.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Создайте объект Doc для
text. Пока не обращайте внимания на аргументdisable. - Сформируйте список лемм с помощью генератора списка, используя атрибут
lemma_. - Удалите небуквенные символы, применив
isalpha()в условии if.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])