시작하기무료로 시작하기

이상적인 데이터셋 선택하기

이제 ufo 데이터셋에서 불필요한 특성을 제거해 보겠습니다. country 열은 이미 country_enc로 인코딩했으므로, 이 열만 남기고 위치와 관련된 다른 열인 city, country, lat, long, state는 삭제해 주세요.

monthyear 열을 이미 생성했기 때문에 더 이상 daterecorded 열은 필요하지 않습니다. 또한 seconds 열을 seconds_log로 표준화했으므로 secondsminutes도 삭제해도 됩니다.

desc는 벡터화했으니 제거할 수 있어요. 당분간은 type은 유지합니다.

또한 length_of_time 열은 minutes를 추출한 후에는 불필요하므로 제거해도 됩니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Machine Learning 전처리

강의 보기

연습 안내

  • 삭제할 모든 열 이름을 리스트 to_drop에 만드세요.
  • ufo에서 해당 열들을 삭제하세요.
  • 앞에서 만든 words_to_filter() 함수를 사용하세요. vocab, vec.vocabulary_, desc_tfidf를 전달하고, 마지막 매개변수로 상위 4개 단어를 유지하도록 지정하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
코드 편집 및 실행