Sestavení slovníku z recenzí zákazníků
Jsi součástí týmu produktové analytiky ve společnosti TechZone, která se zabývá spotřební elektronikou. Dostals/a k dispozici malou sadu zákaznických recenzí nového gadgetu. Abys recenze mohl/a analyzovat, nejdřív text předzpracuješ a sestavíš slovník – seznam unikátních slov, který definuje příznaky sloužící k reprezentaci každé recenze jako numerických dat.
Funkce preprocess() je pro tebe předem načtená. Převede text na malá písmena, tokenizuje ho a odstraní interpunkci.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka (NLP) v Pythonu
Pokyny k cvičení
- Předzpracuj každou recenzi v datasetu pomocí funkce
preprocess(). - Natrénuj
vectorizerna předzpracovaných recenzích. - Vypiš výsledný slovník.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)