Začněte nyníZačněte zdarma

Text na DataFrame

Teď, když jsi vygeneroval/a příznaky založené na počtech výskytů a máš je uložené v poli, je potřeba je přeformátovat, aby šly kombinovat se zbytkem datasetu. Toho dosáhneš tak, že pole převedeš na pandas DataFrame – jako názvy sloupců použiješ příznaky, které jsi zjistil/a dříve – a pak ho zřetězíš s původním DataFramem.

Numpy pole (cv_array) a vektorizátor (cv), který jsi natrénoval/a v předchozím cvičení, máš k dispozici v pracovním prostředí.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř DataFrame cv_df, kde jako hodnoty použiješ cv_array a jako názvy sloupců příznaky vektorizátoru.
  • Přidej ke názvům sloupců prefix Counts_ pro snazší identifikaci.
  • Zřetěz tento DataFrame (cv_df) s původním DataFramem (speech_df) po sloupcích.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a DataFrame with these features
cv_df = pd.DataFrame(____, 
                     columns=____).____('Counts_')

# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())
Upravit a spustit kód