Modellering av UFO-datamängden, del 2
Nu ska du bygga en modell med hjälp av textvektorn desc_tfidf och listan filtered_words för att skapa en filtrerad textvektor. Målet är att se om du kan förutsäga type av observationen utifrån texten. Du använder en Naive Bayes-modell för detta.
Den här övningen är en del av kursen
Förbehandling för maskininlärning i Python
Övningsinstruktioner
- Filtrera vektorn
desc_tfidfgenom att skicka in en lista medfiltered_wordssom index. - Dela upp särdragen
filtered_textochy, och se till att klassfördelningen är jämn i tränings- och testmängderna. Användrandom_state42. - Använd modellens
.fit()för att tränanbpåX_trainochy_train. - Skriv ut
.score()för modellennbpåX_testochy_test.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____