Rimozione delle righe non valide
Ora che hai rimosso con successo le righe commentate, hai ricevuto alcune informazioni sul formato generale dei dati. Nel DataFrame dovrebbero esserci almeno 5 colonne separate da tabulazioni. Ricorda che il tuo DataFrame originale ha una sola colonna, quindi dovrai suddividere i dati sui caratteri di tabulazione (\t).
Il DataFrame annotations_df è già disponibile, con le righe commentate rimosse. La libreria spark.sql.functions è disponibile con l'alias F. Il numero iniziale di righe presenti nel DataFrame è memorizzato nella variabile initial_count.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Crea una nuova variabile
tmp_fieldsusando la colonna'_c0'del DataFrameannotations_df, suddividendola sul carattere di tabulazione. - Crea una nuova colonna in
annotations_dfchiamata'colcount'che rappresenti il numero di campi definito nel passaggio precedente. - Filtra da
annotations_dftutte le righe che contengono meno di 5 campi. - Conta il numero di righe nel DataFrame e confrontalo con
initial_count.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Split _c0 on the tab character and store the list in a variable
tmp_fields = ____(annotations_df['_c0'], ____)
# Create the colcount column on the DataFrame
annotations_df = annotations_df.____('____', ____(____))
# Remove any rows containing fewer than 5 fields
annotations_df_filtered = annotations_df.____(~ (____))
# Count the number of rows
final_count = ____
print("Initial count: %d\nFinal count: %d" % (initial_count, final_count))