Modelarea setului de date UFO, partea 2
În final, vei construi un model folosind vectorul de text creat anterior, desc_tfidf, și lista filtered_words pentru a crea un vector de text filtrat. Vom vedea dacă poți prezice tipul (type) observației pe baza textului. Vei folosi un model Naive Bayes pentru aceasta.
Acest exercițiu face parte din cursul
Preprocesare pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Filtrează vectorul
desc_tfidfpasând o listă defiltered_wordsca index. - Împarte caracteristicile
filtered_textșiy, asigurând o distribuție egală a claselor în seturile de antrenament și testare; foloseșterandom_statecu valoarea42. - Folosește metoda
.fit()a modeluluinbpentru a antrena modelul peX_trainșiy_train. - Afișează scorul
.score()al modeluluinbpe seturileX_testșiy_test.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____