Kom igångKom igång gratis

Textklassificering med tf/idf-vektorer

Nu när du har kodat title-kolumnen i datamängden volunteer till tf/idf-vektorer ska du använda dessa vektorer för att förutsäga kolumnen category_desc.

Den här övningen är en del av kursen

Förbehandling för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Dela upp text_tfidf-vektorn och målvariabeln y i tränings- och testmängder, och sätt parametern stratify till y eftersom klassfördelningen är ojämn. Observera att vi måste köra metoden .toarray() på tf/idf-vektorn för att få den i rätt format för scikit-learn.
  • Anpassa X_train- och y_train-data till Naive Bayes-modellen nb.
  • Skriv ut modellens träffsäkerhet på testmängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Redigera och kör kod