이상적인 데이터셋 선택하기
이제 ufo 데이터셋에서 불필요한 특성을 제거해 보겠습니다. country 열은 이미 country_enc로 인코딩했으므로, 이 열만 남기고 위치와 관련된 다른 열인 city, country, lat, long, state는 삭제해 주세요.
month와 year 열을 이미 생성했기 때문에 더 이상 date나 recorded 열은 필요하지 않습니다. 또한 seconds 열을 seconds_log로 표준화했으므로 seconds와 minutes도 삭제해도 됩니다.
desc는 벡터화했으니 제거할 수 있어요. 당분간은 type은 유지합니다.
또한 length_of_time 열은 minutes를 추출한 후에는 불필요하므로 제거해도 됩니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Machine Learning 전처리
연습 안내
- 삭제할 모든 열 이름을 리스트
to_drop에 만드세요. ufo에서 해당 열들을 삭제하세요.- 앞에서 만든
words_to_filter()함수를 사용하세요.vocab,vec.vocabulary_,desc_tfidf를 전달하고, 마지막 매개변수로 상위4개 단어를 유지하도록 지정하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)