Rensa TED-föreläsningar i en dataram
I den här övningen återvänder vi till TED-föreläsningarna från det första kapitlet. Du har fått en dataram ted med 5 TED-föreläsningar. Din uppgift är att rensa dessa föreläsningar med hjälp av de tekniker vi gått igenom, genom att skriva en funktion preprocess och tillämpa den på kolumnen transcript i dataramen.
Stopporslistan finns tillgänglig som stopwords.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Generera Doc-objektet för
text. Ignorera argumentetdisableför nu. - Generera lemman med hjälp av listomfattning och attributet
lemma_. - Ta bort icke-alfabetiska tecken med hjälp av
isalpha()i if-villkoret.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])