Construirea vocabularului din recenziile clienților
Faci parte dintr-o echipă de analiză a produselor la TechZone, o companie de electronică de consum. Ai primit un set mic de recenzii ale clienților pentru un gadget nou. Pentru a analiza recenziile, vei preprocesa mai întâi textul și vei construi un vocabular – o listă de cuvinte unice care definește caracteristicile folosite pentru a reprezenta fiecare recenzie ca date numerice.
O funcție preprocess() este preîncărcată pentru tine. Aceasta convertește textul la litere mici, îl tokenizează și elimină punctuația.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Instrucțiuni pentru exercițiu
- Preprocesează fiecare recenzie din setul de date folosind funcția
preprocess(). - Antrenează
vectorizer-ul pe recenziile preprocesate. - Afișează vocabularul rezultat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)