Bir sütun listesini düşürme
Veri kümemiz pek çok özellikle zengin, ama hepsi değerli değil. Kullanışlı bir şeye dönüştürmesi zor olan pek çok özellik var. Şimdilik, doğrudan işimize yaramayan sütunları düşürerek kaldıralım.
'STREETNUMBERNUMERIC': Evin posta adresindeki kapı numarası'FIREPLACES': Evdeki şömine sayısı'LOTSIZEDIMENSIONS': Parsel şeklini serbest metinle tanımlayan alan'LISTTYPE': Satış türünün ön tanımlı değerleri'ACRES': Parsel boyutunun sayısal alanı
Bu egzersiz, kursun bir parçasıdır
PySpark ile Özellik Mühendisliği
Egzersiz talimatları
- Yukarıdaki sütun açıklamalarını oku ve
show()ile ilk 30 değeri incele; veri çerçevesi (df) zaten bu sütunlarla filtrelenmiş durumda. - Konut fiyatlarını tahmin etmeye katkısı düşük olan iki sütunu
cols_to_dropadlı bir listede topla. Unutma: bilgisayarlar yalnızca açıkça sayılara dönüştürülebilen şeyleri yorumlayabilir, bağlamı anlamaz. drop()fonksiyonunu kullanarakdfveri çerçevesindencols_to_droplistesindeki sütunları kaldır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)