Kom igångKom igång gratis

Rensa TED-föreläsningar i en dataram

I den här övningen återvänder vi till TED-föreläsningarna från det första kapitlet. Du har fått en dataram ted med 5 TED-föreläsningar. Din uppgift är att rensa dessa föreläsningar med hjälp av de tekniker vi gått igenom, genom att skriva en funktion preprocess och tillämpa den på kolumnen transcript i dataramen.

Stopporslistan finns tillgänglig som stopwords.

Den här övningen är en del av kursen

Funktionsutveckling för NLP i Python

Visa kurs

Övningsinstruktioner

  • Generera Doc-objektet för text. Ignorera argumentet disable för nu.
  • Generera lemman med hjälp av listomfattning och attributet lemma_.
  • Ta bort icke-alfabetiska tecken med hjälp av isalpha() i if-villkoret.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Redigera och kör kod