La próxima semana comenzará el #MOOC "Inteligencia artificial aplicada a información multimedia: Procesando imagen, audio y texto para extraer conocimiento (2ª Edición)". Inscríbete en UPM En Abierto short.upm.es/1lo69 #MOOCsUPM #somosUPM youtu.be/bO-_N7cv7wk?...
short.upm.es
Inteligencia artificial aplicada a información multimedia: Procesando imagen, audio y texto para extraer (edición 2)
Para matricularte en este MOOC pulsa sobre "Inscribirse". Te dirigirá a UPM En Abierto, donde deberás identificarte con tu correo UPM o como usuario externo a la universidad e introducir la clave de matriculación: INSCRIBIRSE Clave de matriculación: IA-aplicada Este MOOC se imparte en UPM En Abierto y podrás obtener de manera gratuita un Diploma de Superación del curso al superar el 50% de la calificación total del mismo. Todos los cursos MOOC de la UPM son online, asíncronos y gratuitos. ACCESO A TODA LA OFERTA DE MOOC EN LA UPM Duración del curso 60 horas (10 semanas). Descripción del curso Aprende a extraer, interpretar y combinar información de imágenes, audio y texto para desarrollar sistemas inteligentes multimodales. Objetivos del curso Este curso explora el fascinante y creciente campo de la extracción de características de datos multimodales, una competencia clave para el desarrollo de sistemas inteligentes capaces de interpretar el mundo real a través de distintas fuentes de información: imágenes, audio y texto. En un contexto en el que la inteligencia artificial forma parte de ámbitos tan diversos como la medicina, la industria, la educación o el entretenimiento, la capacidad de analizar datos heterogéneos de manera integrada es más relevante que nunca. El curso sigue un enfoque progresivo y estructurado: se comienza trabajando cada modalidad por separado (imagen y vídeo, audio, y texto), abordando primero las técnicas tradicionales de procesado de señales e ingeniería de características, que permiten entender la naturaleza y representación de cada tipo de dato. A continuación, se introducen técnicas más avanzadas basadas en aprendizaje profundo, mostrando su aplicación en tareas concretas como: - En imagen y vídeo: clasificación, detección y segmentación de objetos, análisis de movimiento, detección de poses o generación de imágenes. - En audio: análisis espectral, clasificación de eventos sonoros, reconocimiento de voz o detección de emociones y separación de fuentes. - En texto: análisis semántico, clasificación, extracción de entidades, resumen automático o generación de texto usando modelos LLM. Una vez comprendidas las particularidades y potenciales de cada tipo de dato, el curso se orienta hacia el análisis multimodal, abordando técnicas que permiten combinar información visual, acústica y textual para desarrollar sistemas más robustos, interpretables y cercanos al razonamiento humano. Se estudiarán modelos y arquitecturas actuales como CLIP, SAM, Data2Vec o Flamingo, que representan el estado del arte en el aprendizaje multimodal. Diseñado para estudiantes, investigadores y profesionales del ámbito tecnológico y científico, el curso proporciona las herramientas conceptuales y prácticas necesarias para abordar problemas complejos del mundo real con una visión integral, crítica y aplicada. En una era de crecimiento exponencial del volumen y la variedad de datos, dominar las técnicas para extraer, interpretar y combinar información multimodal se convierte en una de las habilidades más demandadas e influyentes del futuro próximo. ¿A quién va dirigido el curso? Este curso está dirigido a estudiantes, investigadores y profesionales de áreas tecnológicas y científicas que quieran adquirir competencias avanzadas en el procesado y análisis integrado de datos multimodales (imagen, audio y texto), aplicando tanto técnicas tradicionales como modelos de aprendizaje profundo en problemas reales. Conocimientos previos recomendados No se requieren conocimientos previos, pero se valora (opcional) conocer unas bases del lenguaje de programación Python de cara a la parte más práctica del curso en cuanto a programación. De cara a las demás herramientas que se usarán durante el curso, no se requiere un conocimiento previo de las mismas, pero sí una soltura básica en instalación de software y ejecución de comandos en terminal en entornos Windows/Linux/Mac. Requisitos técnicos Un ordenador (cualquier sistema operativo es adecuado parta el trabajo), conexión a internet (en el caso de instalación y uso de algunas herramientas) y cuenta de Google para acceso a Google Colab. Sistema de evaluación - Módulo 0: Cuestionario inicial de autoevaluación para conocer el nivel previo del alumnado. - Módulo 1: Test con preguntas teóricas sobre conceptos básicos de visión por computador. - Módulo 2: Test sobre arquitecturas y tareas avanzadas en imagen y vídeo. - Módulo 3: Test práctico basado en notebooks. Preguntas sobre la ejecución, modificación y resultados de las técnicas aplicadas. - Módulo 4: Test sobre teoría del procesamiento de audio y extracción clásica de características. - Módulo 5: Test sobre arquitecturas y tareas avanzadas con modelos de audio. - Módulo 6: Test práctico centrado en notebooks de audio: interpretación de código, resultados y posibilidad de adaptación. - Módulo 7: Test sobre teoría del NLP clásico: representación del texto, vectorización y análisis básico. - Módulo 8: Test sobre arquitecturas modernas de NLP. - Módulo 9: Test práctico a partir de notebooks de NLP. Interpretación, modificación y análisis de resultados en tareas de texto. - Módulo 10: Test de integración final. Preguntas sobre conceptos de multimodalidad, modelos combinados y reflexiones sobre su aplicación práctica.