ÎncepețiÎncepe gratuit

Împărțirea în coloane

Ai curățat considerabil datele, eliminând rândurile invalide din DataFrame. Acum vrei să aplici câteva transformări suplimentare, generând coloane specifice și semnificative pe baza conținutului DataFrame-ului.

Ai disponibil contextul spark și cea mai recentă versiune a DataFrame-ului annotations_df. pyspark.sql.functions este disponibil sub aliasul F.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte conținutul coloanei '_c0' după caracterul tab și stochează rezultatul într-o variabilă numită split_cols.
  • Adaugă următoarele coloane pe baza primelor patru elemente din variabila de mai sus: folder, filename, width, height, într-un DataFrame numit split_df.
  • Adaugă variabila split_cols ca o coloană.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Editează și rulează codul