Začněte nyníZačněte zdarma

Sestavení slovníku z recenzí zákazníků

Jsi součástí týmu produktové analytiky ve společnosti TechZone, která se zabývá spotřební elektronikou. Dostals/a k dispozici malou sadu zákaznických recenzí nového gadgetu. Abys recenze mohl/a analyzovat, nejdřív text předzpracuješ a sestavíš slovník – seznam unikátních slov, který definuje příznaky sloužící k reprezentaci každé recenze jako numerických dat.

Funkce preprocess() je pro tebe předem načtená. Převede text na malá písmena, tokenizuje ho a odstraní interpunkci.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Předzpracuj každou recenzi v datasetu pomocí funkce preprocess().
  • Natrénuj vectorizer na předzpracovaných recenzích.
  • Vypiš výsledný slovník.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

reviews = [
    "The product is fantastic! It works like a charm.",
    "I hated the product. It broke after one use.",
    "Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]

vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary 
print(vectorizer.____)
Upravit a spustit kód