Märk upp data
En dataram df finns tillgänglig med kolumnerna endword (sträng), features (vektor) och outvec (vektor). Din uppgift är att välja de rader där endword är lika med "him" och lägga till en kolumn label med heltalsvärdet 1. Använd sedan union för att lägga till lika många rader där endword inte är lika med "him", så att dessa rader får label = 0.
Påminnelse: i SQL används <> för att jämföra om två värden inte är lika.
Den här övningen är en del av kursen
Introduktion till Spark SQL i Python
Övningsinstruktioner
- Importera funktionen
lit. - Välj de rader där endword är 'him' och lägg till en heltalskolumn
labelmed värdet 1. - Välj de rader där endword inte är 'him' och lägg till en heltalskolumn
labelmed värdet 0. - Slå samman de två mängderna med
union, och använd lika många negativa exempel som positiva.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the lit function
from pyspark.____ import lit
# Select the rows where endword is 'him' and label 1
df_pos = df.where("____ = 'him'")\
.withColumn('label', lit(____))
# Select the rows where endword is not 'him' and label 0
df_neg = df.where("endword <> '____'")\
.withColumn('label', ____(0))
# Union pos and neg in equal number
df_examples = df_pos.____(df_neg.limit(df_pos.count()))
print("Number of examples: ", df_examples.count())
df_examples.where("endword <> 'him'").sample(False, .1, 42).show(5)