Kom igångKom igång gratis

TF-IDF-representation av produktrecensioner

Du arbetar med ett kundsupportteam på ett företag som tillverkar smarta hemenheter. De har samlat in användarrecensioner om ett antal enheter och vill identifiera vilka ord som sticker ut i varje recension. Du föreslår att använda TF-IDF för att lyfta fram de mest relevanta termerna i feedbacken. Nu kör vi!

En preprocess()-funktion som tar emot en text och returnerar en bearbetad version är förinstallerad. Funktionen tillämpar gemener, tokenisering och borttagning av skiljetecken. Pandas har importerats som pd och klassen TfidfVectorizer är redo att använda.

Den här övningen är en del av kursen

Natural Language Processing (NLP) i Python

Visa kurs

Övningsinstruktioner

  • Initiera en TF-IDF-vectorizer.
  • Transformera de rensade recensionerna till en tfidf_matrix.
  • Skapa en DataFrame df för tfidf_matrix med ordförrådets ord som kolumner.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Redigera och kör kod