Membatasi fitur Anda

Seperti yang Anda lihat, menggunakan CountVectorizer dengan pengaturan default akan membuat sebuah fitur untuk setiap kata dalam korpus Anda. Ini dapat menghasilkan terlalu banyak fitur, sering kali termasuk yang memberikan nilai analitis sangat kecil.

Untuk tujuan ini, CountVectorizer memiliki parameter yang dapat Anda atur untuk mengurangi jumlah fitur:

min_df: Hanya gunakan kata yang muncul di lebih dari persentase dokumen ini. Ini dapat digunakan untuk menghapus kata-kata pencilan yang tidak akan terumumkan di berbagai teks.
max_df: Hanya gunakan kata yang muncul di kurang dari persentase dokumen ini. Ini berguna untuk menghilangkan kata-kata yang sangat umum yang muncul di setiap korpus tanpa menambah nilai seperti "and" atau "the".

Latihan ini merupakan bagian dari kursus

Rekayasa Fitur untuk Machine Learning di Python

Instruksi latihan

Batasi jumlah fitur di CountVectorizer dengan menetapkan jumlah minimum dokumen tempat suatu kata dapat muncul menjadi 20% dan maksimum menjadi 80%.
Sesuaikan dan terapkan vektorisasi pada kolom text_clean dalam satu langkah.
Konversikan array (jarang) yang telah ditransformasikan ini menjadi array numpy berisi hitungan.
Cetak dimensi dari array baru yang telah direduksi.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import CountVectorizer
from sklearn.feature_extraction.text import CountVectorizer

# Specify arguements to limit the number of features generated
cv = ____

# Fit, transform, and convert into array
cv_transformed = ____(speech_df['text_clean'])
cv_array = ____

# Print the array shape
print(____)

Edit dan Jalankan Kode

Latihan ini merupakan bagian dari kursus

Rekayasa Fitur untuk Machine Learning di Python

SkillTag.level.intermediateSkillTag.label

4.8+

Mulai Kursus Gratis

Pada bab ini, Anda akan mengeksplorasi apa itu rekayasa fitur dan cara memulainya pada data dunia nyata. Anda akan memuat, mengeksplorasi, dan memvisualisasikan himpunan data respons survei, dan melalui itu Anda akan mempelajari tipe data dasarnya serta mengapa hal tersebut memengaruhi cara Anda merekayasa fitur. Dengan paket pandas, Anda akan membuat fitur baru dari kolom kategorikal dan kontinu.

Exercise 1: Mengapa membuat fitur?Exercise 2: Mengenal data Anda Exercise 3: Memilih tipe data tertentu Exercise 4: Menangani fitur kategorikal Exercise 5: One-hot encoding dan variabel dummy Exercise 6: Menangani kategori yang jarang muncul Exercise 7: Variabel numerik Exercise 8: Membinarisasi kolom Exercise 9: Membagi nilai ke dalam bin

Bab ini memperkenalkan Anda pada realitas data yang berantakan dan tidak lengkap. Anda akan mempelajari cara menemukan nilai hilang dalam data Anda dan mengeksplorasi berbagai pendekatan untuk menanganinya. Anda juga akan menggunakan teknik manipulasi string untuk menangani karakter yang tidak diinginkan dalam himpunan data Anda.

Exercise 1: Mengapa nilai yang hilang ada?Exercise 2: Seberapa jarang data saya?Exercise 3: Menemukan nilai yang hilang Exercise 4: Menangani nilai yang hilang (I)Exercise 5: Penghapusan secara keseluruhan (listwise deletion)Exercise 6: Mengganti nilai hilang dengan konstanta Exercise 7: Menangani nilai hilang (II)Exercise 8: Mengisi nilai hilang kontinu Exercise 9: Mengimputasi nilai dalam model prediktif Exercise 10: Menangani masalah data lainnya Exercise 11: Menangani karakter tak diinginkan (I)Exercise 12: Menangani karakter liar (II)Exercise 13: Method chaining

Pada bab ini, Anda akan berfokus pada analisis distribusi dasar data Anda dan apakah hal tersebut akan memengaruhi pipeline Machine Learning Anda. Anda akan mempelajari cara menangani data miring dan situasi ketika pencilan dapat berdampak negatif pada analisis Anda.

Exercise 1: Distribusi data Exercise 2: Seperti apa data Anda? (I)Exercise 3: Seperti apa data Anda? (II)Exercise 4: Kapan Anda tidak perlu mentransformasikan data Anda?Exercise 5: Penskalaan dan transformasi Exercise 6: Normalisasi Exercise 7: Standardization Exercise 8: Transformasi log Exercise 9: Kapan Anda dapat menggunakan normalisasi?Exercise 10: Menghapus pencilan Exercise 11: Penghapusan pencilan berbasis persentase Exercise 12: Penghapusan pencilan secara statistik Exercise 13: Menskalakan dan mentransformasikan data baru Exercise 14: Transformasi data train dan test (I)Exercise 15: Transformasi pelatihan dan pengujian (II)

Terakhir, pada bab ini, Anda akan bekerja dengan data teks tidak terstruktur, memahami cara merekayasa fitur kolumnar dari suatu korpus teks. Anda akan membandingkan bagaimana pendekatan berbeda dapat memengaruhi seberapa banyak konteks yang diekstraksi dari teks, serta bagaimana menyeimbangkan kebutuhan konteks tanpa menghasilkan terlalu banyak fitur.

Exercise 1: Pengodean teks Exercise 2: Membersihkan teks Anda Exercise 3: Fitur teks tingkat tinggi Exercise 4: Jumlah kata Exercise 5: Menghitung kata (I)Exercise 6: Menghitung kata (II)Exercise 7: Membatasi fitur Anda

Latihan Saat Ini

Exercise 8: Teks menjadi DataFrame Exercise 9: Frekuensi istilah–invers frekuensi dokumen Exercise 10: Tf-idf Exercise 11: Memeriksa nilai Tf-idf Exercise 12: Mentransformasi data yang belum pernah dilihat Exercise 13: N-gram Exercise 14: Menggunakan n-gram yang lebih panjang Exercise 15: Menemukan kata yang paling umum Exercise 16: Ringkasan