Ajuste de un modelo de conversión de texto a voz

Trabajarás con el corpus VCTK, que incluye alrededor de 44 horas de datos de voz pronunciados por hablantes de inglés con diversos acentos, para perfeccionar un modelo de conversión de texto a voz que reproduzca los acentos regionales.

dataset SpeechT5ForTextToSpeech Seq2SeqTrainingArguments Seq2SeqTrainer El paquete de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la biblioteca de funciones de la Se ha predefinido un recopilador de datos (data_collator).

No llames al .train() en la configuración del entrenador, ya que este código agotará el tiempo de espera en este entorno.

Este ejercicio forma parte del curso

Modelos multimodales con Hugging Face

Instrucciones del ejercicio

Carga el modelo preentrenado microsoft/speecht5_tts utilizando SpeechT5ForTextToSpeech.
Crea una instancia de Seq2SeqTrainingArguments con: gradient_accumulation_steps establecido en 8, learning_rate establecido en 0.00001, warmup_steps establecido en 500 y max_steps establecido en 4000.
Configura el entrenador con los nuevos argumentos de entrenamiento y los datos, el archivo « model » y el archivo « processor » proporcionados.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)

Editar y ejecutar código

Este ejercicio forma parte del curso

Modelos multimodales con Hugging Face

IntermedioNivel de habilidad

4.9+

Empieza el curso gratis

Navega por el centro de modelos de Hugging Face y transforma texto sin procesar, audio y datos visuales en formatos compatibles con la IA. Aprende a encontrar los modelos más populares y recientes para tareas como la generación de texto y aprovecha la potencia de los procesos predefinidos.

Exercise 1: Navegación por el modelo Hugging Face Exercise 2: ¿Cuántos modelos?Exercise 3: Encontrar el modelo de texto a imagen más popular Exercise 4: Preprocesamiento de diferentes modalidades Exercise 5: Tokenización de texto Exercise 6: Preprocesamiento de imágenes Exercise 7: Preprocesamiento de audio Exercise 8: Tareas y evaluaciones de la canalización Exercise 9: Generación de leyendas de tuberías Exercise 10: Pasar argumentos con nombre Exercise 11: Evaluación del modelo en un conjunto de datos personalizado

Aprende a dominar modalidades individuales con modelos de última generación. Sumérgete en la visión artificial para la clasificación y segmentación de imágenes, explora el reconocimiento de voz y la síntesis de texto a voz, y aprende técnicas eficaces de ajuste fino. Desarrolla habilidades prácticas con modelos preentrenados de la biblioteca de transformadores de Hugging Face.

Exercise 1: Visión artificial Exercise 2: Clasificación de imágenes Exercise 3: Detección de objetos Exercise 4: Eliminación del fondo de una imagen Exercise 5: Ajuste de modelos de visión artificial Exercise 6: Ajuste del CV: preparación del conjunto de datos Exercise 7: Ajuste del CV: clases de modelos Exercise 8: Ajuste del CV: configuración del entrenador Exercise 9: Reconocimiento de voz y generación de audio Exercise 10: Reconocimiento automático del habla Exercise 11: Creación de incrustaciones de voz Exercise 12: Eliminación de ruido en audio Exercise 13: Ajuste de los modelos de conversión de texto a voz Exercise 14: Ajuste de un modelo de conversión de texto a voz

Ejercicio actual

Exercise 15: Generación de nuevo discurso

Aprende a fusionar información visual, textual y de audio para crear aplicaciones de IA más completas. Domina técnicas como CLIP para la clasificación sin entrenamiento previo, crea analizadores de sentimientos que ven y leen, y crea detectores de emociones que combinan expresiones faciales con la voz. Lleva tus modelos de IA más allá del pensamiento unimododal.

Exercise 1: Clasificación de imágenes sin entrenamiento previo Exercise 2: Aprendizaje sin disparos con CLIP Exercise 3: Evaluación automática de la calidad de los pies de foto Exercise 4: Análisis multimodal del sentimiento Exercise 5: Modelos de lenguaje visual (VLM) con indicaciones Exercise 6: Clasificación multimodal del sentimiento con Qwen Exercise 7: Clasificación de vídeos sin entrenamiento previo Exercise 8: División de audio y vídeo Exercise 9: Análisis de sentimiento en vídeo con CLIP CLAP

¡Transforma tus ideas en realidad! Domina técnicas de IA de vanguardia para generar y manipular contenido visual utilizando indicaciones de texto. Crea imágenes impresionantes, edita fotos de forma inteligente y crea potentes sistemas de preguntas y respuestas para imágenes y documentos. Convierte tu visión creativa en realidad digital con IA multimodal.

Exercise 1: Respuesta visual a preguntas (VQA)Exercise 2: VQA con transformadores de lenguaje visual (ViLT)Exercise 3: Document VQA con LayoutLM Exercise 4: Edición de imágenes con modelos de difusión Exercise 5: Edición personalizada de imágenes Exercise 6: Relleno de imágenes Exercise 7: Generación de vídeo Exercise 8: ¡Crea un vídeo!Exercise 9: Evaluación del rendimiento de la generación de vídeos Exercise 10: ¡Enhorabuena!