EmpezarEmpieza gratis

Cargar datos de spam de SMS

Ya has visto que es posible inferir los tipos de datos directamente a partir de los datos. A veces es más cómodo tener control directo sobre los tipos de columna. Para eso defines un esquema explícito.

El archivo sms.csv contiene una selección de mensajes SMS que se han clasificado como "spam" o "ham". Estos datos se han adaptado del UCI Machine Learning Repository. Hay un total de 5574 SMS, de los cuales 747 se han etiquetado como spam.

Notas sobre el formato CSV:

  • no hay fila de cabecera y
  • los campos están separados por un punto y coma (esto no es el separador predeterminado).

Diccionario de datos:

  • id — identificador del registro
  • text — contenido del mensaje SMS
  • label — spam o ham (entero; 0 = ham y 1 = spam)

Este ejercicio forma parte del curso

Machine learning con PySpark

Ver curso

Instrucciones del ejercicio

  • Especifica el esquema de datos, indicando nombres de columnas ("id", "text" y "label") y sus tipos.
  • Lee los datos desde un archivo delimitado llamado "sms.csv".
  • Imprime el esquema del DataFrame resultante.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Specify column names and types
schema = StructType([
    StructField("____", IntegerType()),
    ____("____", ____()),
    ____("____", ____())
])

# Load data from a delimited file
sms = spark.read.csv(____, sep=____, header=____, ____=____)

# Print schema of DataFrame
sms.____()
Editar y ejecutar código