Очищення виступів TED у датафреймі
У цій вправі ми повертаємося до виступів TED з першого розділу. Вам надано датафрейм ted, що містить 5 виступів TED. Ваше завдання — очистити ці виступи, застосувавши техніки, розглянуті раніше: напишіть функцію preprocess і застосуйте її до ознаки transcript у датафреймі.
Список стопслів доступний як stopwords.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Створіть об'єкт Doc для
text. Аргументdisableпоки що проігноруйте. - Згенеруйте леми за допомогою list comprehension, використовуючи атрибут
lemma_. - Видаліть неалфавітні символи, використовуючи
isalpha()в умові if.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])