Kom igångKom igång gratis

Märk upp data

En dataram df finns tillgänglig med kolumnerna endword (sträng), features (vektor) och outvec (vektor). Din uppgift är att välja de rader där endword är lika med "him" och lägga till en kolumn label med heltalsvärdet 1. Använd sedan union för att lägga till lika många rader där endword inte är lika med "him", så att dessa rader får label = 0.

Påminnelse: i SQL används <> för att jämföra om två värden inte är lika.

Den här övningen är en del av kursen

Introduktion till Spark SQL i Python

Visa kurs

Övningsinstruktioner

  • Importera funktionen lit.
  • Välj de rader där endword är 'him' och lägg till en heltalskolumn label med värdet 1.
  • Välj de rader där endword inte är 'him' och lägg till en heltalskolumn label med värdet 0.
  • Slå samman de två mängderna med union, och använd lika många negativa exempel som positiva.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the lit function
from pyspark.____ import lit

# Select the rows where endword is 'him' and label 1
df_pos = df.where("____ = 'him'")\
           .withColumn('label', lit(____))

# Select the rows where endword is not 'him' and label 0
df_neg = df.where("endword <> '____'")\
           .withColumn('label', ____(0))

# Union pos and neg in equal number
df_examples = df_pos.____(df_neg.limit(df_pos.count()))
print("Number of examples: ", df_examples.count())
df_examples.where("endword <> 'him'").sample(False, .1, 42).show(5)
Redigera och kör kod