Из текста в DataFrame
Теперь, когда вы получили признаки на основе подсчёта в виде массива, необходимо преобразовать их в формат, совместимый с остальными данными. Для этого нужно конвертировать массив в DataFrame библиотеки pandas, задав в качестве названий столбцов имена признаков, найденные ранее, а затем объединить его с исходным DataFrame.
Массив numpy (cv_array) и векторизатор (cv), обученный в предыдущем упражнении, доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Создайте DataFrame
cv_df, используяcv_arrayв качестве значений и имена признаков в качестве названий столбцов. - Добавьте префикс
Counts_к названиям столбцов для удобства идентификации. - Объедините этот DataFrame (
cv_df) с исходным DataFrame (speech_df) по столбцам.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a DataFrame with these features
cv_df = pd.DataFrame(____,
columns=____).____('Counts_')
# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())