Text na DataFrame
Teď, když jsi vygeneroval/a příznaky založené na počtech výskytů a máš je uložené v poli, je potřeba je přeformátovat, aby šly kombinovat se zbytkem datasetu. Toho dosáhneš tak, že pole převedeš na pandas DataFrame – jako názvy sloupců použiješ příznaky, které jsi zjistil/a dříve – a pak ho zřetězíš s původním DataFramem.
Numpy pole (cv_array) a vektorizátor (cv), který jsi natrénoval/a v předchozím cvičení, máš k dispozici v pracovním prostředí.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Vytvoř DataFrame
cv_df, kde jako hodnoty použiješcv_arraya jako názvy sloupců příznaky vektorizátoru. - Přidej ke názvům sloupců prefix
Counts_pro snazší identifikaci. - Zřetěz tento DataFrame (
cv_df) s původním DataFramem (speech_df) po sloupcích.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a DataFrame with these features
cv_df = pd.DataFrame(____,
columns=____).____('Counts_')
# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())