Kom igångKom igång gratis

Modellering av UFO-datamängden, del 2

Nu ska du bygga en modell med hjälp av textvektorn desc_tfidf och listan filtered_words för att skapa en filtrerad textvektor. Målet är att se om du kan förutsäga type av observationen utifrån texten. Du använder en Naive Bayes-modell för detta.

Den här övningen är en del av kursen

Förbehandling för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Filtrera vektorn desc_tfidf genom att skicka in en lista med filtered_words som index.
  • Dela upp särdragen filtered_text och y, och se till att klassfördelningen är jämn i tränings- och testmängderna. Använd random_state 42.
  • Använd modellens .fit() för att träna nbX_train och y_train.
  • Skriv ut .score() för modellen nbX_test och y_test.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]

# Split the X and y sets using train_test_split, setting stratify=y 
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)

# Fit nb to the training sets
____

# Print the score of nb on the test sets
____
Redigera och kör kod