Bygg ett ordförråd från kundrecensioner
Du ingår i ett produktanalysteam på TechZone, ett konsumentelektronikföretag. Du har fått ett litet urval kundrecensioner för en ny produkt. För att analysera recensionerna förbehandlar du först texten och bygger ett ordförråd – en lista med unika ord som definierar de särdrag som används för att representera varje recension som numerisk data.
En funktion preprocess() är förhandsladdad. Den konverterar texten till gemener, tokeniserar den och tar bort skiljetecken.
Den här övningen är en del av kursen
Natural Language Processing (NLP) i Python
Övningsinstruktioner
- Förbehandla varje recension i datamängden med funktionen
preprocess(). - Anpassa
vectorizerpå de förbehandlade recensionerna. - Skriv ut det resulterande ordförrådet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)