Inizia subitoInizia gratis

Rimozione delle righe non valide

Ora che hai rimosso con successo le righe commentate, hai ricevuto alcune informazioni sul formato generale dei dati. Nel DataFrame dovrebbero esserci almeno 5 colonne separate da tabulazioni. Ricorda che il tuo DataFrame originale ha una sola colonna, quindi dovrai suddividere i dati sui caratteri di tabulazione (\t).

Il DataFrame annotations_df è già disponibile, con le righe commentate rimosse. La libreria spark.sql.functions è disponibile con l'alias F. Il numero iniziale di righe presenti nel DataFrame è memorizzato nella variabile initial_count.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Crea una nuova variabile tmp_fields usando la colonna '_c0' del DataFrame annotations_df, suddividendola sul carattere di tabulazione.
  • Crea una nuova colonna in annotations_df chiamata 'colcount' che rappresenti il numero di campi definito nel passaggio precedente.
  • Filtra da annotations_df tutte le righe che contengono meno di 5 campi.
  • Conta il numero di righe nel DataFrame e confrontalo con initial_count.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Split _c0 on the tab character and store the list in a variable
tmp_fields = ____(annotations_df['_c0'], ____)

# Create the colcount column on the DataFrame
annotations_df = annotations_df.____('____', ____(____))

# Remove any rows containing fewer than 5 fields
annotations_df_filtered = annotations_df.____(~ (____))

# Count the number of rows
final_count = ____
print("Initial count: %d\nFinal count: %d" % (initial_count, final_count))
Modifica ed esegui il codice