ÎncepețiÎncepe gratuit

Curățarea discursurilor TED într-un dataframe

În acest exercițiu, vom reveni la discursurile TED din primul capitol. Ai la dispoziție un dataframe ted format din 5 discursuri TED. Sarcina ta este să curăți aceste discursuri folosind tehnicile discutate anterior, scriind o funcție preprocess și aplicând-o caracteristicii transcript din dataframe.

Lista de cuvinte de oprire este disponibilă ca stopwords.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Generează obiectul Doc pentru text. Ignoră argumentul disable pentru moment.
  • Generează lemele folosind list comprehension cu atributul lemma_.
  • Elimină caracterele non-alfabetice folosind isalpha() în condiția if.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Editează și rulează codul