Curățarea discursurilor TED într-un dataframe
În acest exercițiu, vom reveni la discursurile TED din primul capitol. Ai la dispoziție un dataframe ted format din 5 discursuri TED. Sarcina ta este să curăți aceste discursuri folosind tehnicile discutate anterior, scriind o funcție preprocess și aplicând-o caracteristicii transcript din dataframe.
Lista de cuvinte de oprire este disponibilă ca stopwords.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Generează obiectul Doc pentru
text. Ignoră argumentuldisablepentru moment. - Generează lemele folosind list comprehension cu atributul
lemma_. - Elimină caracterele non-alfabetice folosind
isalpha()în condiția if.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])