Eliminarea cuvintelor de stop
Lucrezi la un proiect în care scopul este să clasifici feedback-ul utilizatorilor în categorii precum „probleme cu produsul", „probleme cu serviciul" și „sugestii". De obicei, cuvintele de stop nu contribuie prea mult la diferențierea dintre categorii. Sarcina ta este să elimini aceste cuvinte de stop pentru a te concentra pe cuvintele importante, care vor ajuta un model să încadreze mai târziu feedback-ul în categoriile corecte.
Funcțiile word_tokenize din nltk.tokenize și stopwords.words din nltk.corpus au fost deja importate. De asemenea, resursele NLTK punkt_tab și stopwords au fost deja descărcate.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Instrucțiuni pentru exercițiu
- Tokenizează feedback-ul furnizat în cuvinte.
- Obține lista de cuvinte de stop în limba engleză.
- Elimină cuvintele de stop din engleză și salvează rezultatul în
filtered_tokens.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)