ÎncepețiÎncepe gratuit

Eliminarea cuvintelor de stop

Lucrezi la un proiect în care scopul este să clasifici feedback-ul utilizatorilor în categorii precum „probleme cu produsul", „probleme cu serviciul" și „sugestii". De obicei, cuvintele de stop nu contribuie prea mult la diferențierea dintre categorii. Sarcina ta este să elimini aceste cuvinte de stop pentru a te concentra pe cuvintele importante, care vor ajuta un model să încadreze mai târziu feedback-ul în categoriile corecte.

Funcțiile word_tokenize din nltk.tokenize și stopwords.words din nltk.corpus au fost deja importate. De asemenea, resursele NLTK punkt_tab și stopwords au fost deja descărcate.

Acest exercițiu face parte din cursul

Procesarea Limbajului Natural (NLP) în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Tokenizează feedback-ul furnizat în cuvinte.
  • Obține lista de cuvinte de stop în limba engleză.
  • Elimină cuvintele de stop din engleză și salvează rezultatul în filtered_tokens.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Editează și rulează codul