НачатьНачать бесплатно

Из текста в DataFrame

Теперь, когда вы получили признаки на основе подсчёта в виде массива, необходимо преобразовать их в формат, совместимый с остальными данными. Для этого нужно конвертировать массив в DataFrame библиотеки pandas, задав в качестве названий столбцов имена признаков, найденные ранее, а затем объединить его с исходным DataFrame.

Массив numpy (cv_array) и векторизатор (cv), обученный в предыдущем упражнении, доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте DataFrame cv_df, используя cv_array в качестве значений и имена признаков в качестве названий столбцов.
  • Добавьте префикс Counts_ к названиям столбцов для удобства идентификации.
  • Объедините этот DataFrame (cv_df) с исходным DataFrame (speech_df) по столбцам.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a DataFrame with these features
cv_df = pd.DataFrame(____, 
                     columns=____).____('Counts_')

# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())
Редактировать и запускать код