SMS spam verisini yükleme
Veri türlerinin doğrudan veriden çıkarılabildiğini gördün. Ancak bazen sütun türleri üzerinde doğrudan denetime sahip olmak daha kullanışlıdır. Bunu, açık bir şema tanımlayarak yaparsın.
sms.csv dosyası, 'spam' veya 'ham' olarak sınıflandırılmış bir SMS mesajı seçkisi içeriyor. Bu veriler UCI Machine Learning Repository kaynağından uyarlanmıştır. Toplam 5574 SMS vardır; bunların 747'si spam olarak etiketlenmiştir.
CSV biçimi notları:
- başlık satırı yok ve
- alanlar noktalı virgülle ayrılmıştır (bu, varsayılan ayırıcı değildir).
Veri sözlüğü:
id— kayıt tanımlayıcısıtext— SMS mesajının içeriğilabel— spam veya ham (tamsayı; 0 = ham ve 1 = spam)
Bu egzersiz, kursun bir parçasıdır
PySpark ile Machine Learning
Egzersiz talimatları
- Sütun adları (
"id","text"ve"label") ve sütun türlerini vererek veri şemasını belirt. "sms.csv"adlı sınırlı (delimited) dosyadan veriyi oku.- Ortaya çıkan DataFrame için şemayı yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Specify column names and types
schema = StructType([
StructField("____", IntegerType()),
____("____", ____()),
____("____", ____())
])
# Load data from a delimited file
sms = spark.read.csv(____, sep=____, header=____, ____=____)
# Print schema of DataFrame
sms.____()