Clasificación multimodal del sentimiento con Qwen

Ahora vamos a integrar tu comando con el modelo de lenguaje visual Qwen2. Utilizarás la plantilla de indicaciones que creaste anteriormente, disponible en chat_template.

¡Veamos qué opina la modelo sobre este artículo! Se han cargado el modelo (vl_model) y el procesador (vl_model_processor).

Este ejercicio forma parte del curso

Modelos multimodales con Hugging Face

Instrucciones del ejercicio

Utiliza el procesador para preprocesar chat_template.
Utiliza el modelo para generar los ID de salida, asegurándote de limitar los nuevos tokens a 500.
Decodifica los ID generados recortados, omitiendo los tokens especiales.

Ejercicio interactivo práctico

Prueba este ejercicio y completa el código de muestra.

text = vl_model_processor.apply_chat_template(chat_template, tokenize=False, add_generation_prompt=True)
image_inputs, _ = process_vision_info(chat_template)

# Use the processor to preprocess the text and image
inputs = ____(
    text=[____],
    images=____,
    padding=True,
    return_tensors="pt",
)

# Use the model to generate the output IDs
generated_ids = vl_model.____(**inputs, ____)
generated_ids_trimmed = [out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)]

# Decode the generated IDs
output_text = vl_model_processor.____(
    generated_ids_trimmed, skip_special_tokens=True
)
print(output_text[0])

Editar y ejecutar código

Este ejercicio forma parte del curso

Modelos multimodales con Hugging Face

IntermedioNivel de habilidad

4.9+

Comienza el curso gratis

Navega por el centro de modelos de Hugging Face y transforma texto sin procesar, audio y datos visuales en formatos compatibles con la IA. Aprende a encontrar los modelos más populares y recientes para tareas como la generación de texto y aprovecha la potencia de los procesos predefinidos.

Exercise 1: Navegación por el modelo Hugging Face Exercise 2: ¿Cuántos modelos?Exercise 3: Encontrar el modelo de texto a imagen más popular Exercise 4: Preprocesamiento de diferentes modalidades Exercise 5: Tokenización de texto Exercise 6: Preprocesamiento de imágenes Exercise 7: Preprocesamiento de audio Exercise 8: Tareas y evaluaciones de la canalización Exercise 9: Generación de leyendas de tuberías Exercise 10: Pasar argumentos clave Exercise 11: Evaluación del modelo en un conjunto de datos personalizado

Aprende a dominar modalidades individuales con modelos de última generación. Sumérgete en la visión artificial para la clasificación y segmentación de imágenes, explora el reconocimiento de voz y la síntesis de texto a voz, y aprende técnicas eficaces de ajuste fino. Desarrolla habilidades prácticas con modelos preentrenados de la biblioteca de transformadores de Hugging Face.

Exercise 1: Visión artificial Exercise 2: Clasificación de imágenes Exercise 3: Detección de objetos Exercise 4: Eliminación del fondo de una imagen Exercise 5: Ajuste de modelos de visión artificial Exercise 6: Ajuste del CV: preparación del conjunto de datos Exercise 7: Ajuste del CV: clases de modelos Exercise 8: Ajuste del CV: configuración del entrenador Exercise 9: Reconocimiento de voz y generación de audio Exercise 10: Reconocimiento automático del habla Exercise 11: Creación de incrustaciones de voz Exercise 12: Eliminación de ruido en audio Exercise 13: Ajuste de los modelos de conversión de texto a voz Exercise 14: Ajuste de un modelo de conversión de texto a voz Exercise 15: Generación de nuevo discurso

Aprende a fusionar información visual, textual y de audio para crear aplicaciones de IA más completas. Domina técnicas como CLIP para la clasificación sin entrenamiento previo, crea analizadores de sentimientos que ven y leen, y crea detectores de emociones que combinan expresiones faciales con la voz. Lleva tus modelos de IA más allá del pensamiento unimododal.

Exercise 1: Clasificación de imágenes sin entrenamiento previo Exercise 2: Aprendizaje sin disparos con CLIP Exercise 3: Evaluación automatizada de la calidad de los subtítulos Exercise 4: Análisis multimodal del sentimiento Exercise 5: Modelos de lenguaje visual (VLM) con indicaciones Exercise 6: Clasificación multimodal del sentimiento con Qwen

Ejercicio actual

Exercise 7: Clasificación de vídeos sin entrenamiento previo Exercise 8: División de audio y vídeo Exercise 9: Análisis del sentimiento en vídeos con CLIP CLAP

¡Transforma tus ideas en realidad! Domina técnicas de IA de vanguardia para generar y manipular contenido visual utilizando indicaciones de texto. Crea imágenes impresionantes, edita fotos de forma inteligente y crea potentes sistemas de preguntas y respuestas para imágenes y documentos. Convierte tu visión creativa en realidad digital con IA multimodal.

Exercise 1: Respuesta visual a preguntas (VQA)Exercise 2: VQA con transformadores de lenguaje visual (ViLT)Exercise 3: Document VQA con LayoutLM Exercise 4: Edición de imágenes con modelos de difusión Exercise 5: Edición personalizada de imágenes Exercise 6: Relleno de imágenes Exercise 7: Generación de vídeo Exercise 8: ¡Crea un vídeo!Exercise 9: Evaluación del rendimiento de la generación de vídeos Exercise 10: ¡Enhorabuena!