Čištění TED talks v dataframu
V tomto cvičení se vrátíme k TED Talks z první kapitoly. Máš k dispozici dataframe ted s 5 TED Talks. Tvým úkolem je tyto přednášky vyčistit pomocí technik, které jsme probírali dříve – napíšeš funkci preprocess a aplikuješ ji na sloupec transcript v dataframu.
Seznam stopwords je dostupný jako stopwords.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Vytvoř objekt Doc pro
text. Argumentdisableteď ignoruj. - Vytvoř lemmata pomocí list comprehension s využitím atributu
lemma_. - Odstraň nealfabetické znaky pomocí
isalpha()v podmínce if.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])