Casos de Éxito | Blog | Newsletter | Contacto
Curso - Modelos de Deep Learning: Construcción, Entrenamiento y Evaluación
Modelos de Deep Learning aplicados a texto, imagen y sonido: aprende a construirlos, entrenarlos y evaluarlos con PyTorch, experimentando con arquitecturas e hiperparámetros.
- Home
- Formaciones
- Inteligencia Artificial
- Modelos De Deep Learning
-
Abilways
- }
Los modelos de Deep Learning permiten abordar problemas relacionados con texto, imagen y sonido mediante diferentes arquitecturas de redes neuronales. En esta formación aprenderás a construir y entrenar modelos de extremo a extremo, experimentar con sus hiperparámetros, evaluar su rendimiento e identificar sus límites y posibilidades de mejora.
La formación está dirigida a data scientists e ingenieros de Machine Learning que quieran adquirir una comprensión práctica de la construcción de modelos de Deep Learning mediante el entrenamiento de modelos sobre problemas reales de texto, imagen y sonido.
Objetivos de la formación Modelos de Deep Learning
Al finalizar esta formación serás capaz de:
- Construir de extremo a extremo modelos de Deep Learning sobre tres modalidades: texto, imagen y sonido.
- Comprender mediante la experimentación el impacto de los hiperparámetros sobre la calidad de los modelos.
- Identificar los límites de un modelo y saber cuándo y cómo superarlos.
- Adquirir los reflejos prácticos necesarios para la construcción de modelos: preparación de los datos, elección de la arquitectura, entrenamiento, evaluación e iteración.
Requisitos previos
Para realizar esta formación es necesario:
- Tener un buen dominio de Python.
- Haber realizado la formación «Inteligencia Artificial (IA) y herramientas del Deep Learning (TensorFlow, Caffe, PyTorch…) – Comprender sus aportaciones» o disponer de conocimientos equivalentes sobre redes neuronales: CNN, RNN, funciones de pérdida y optimizadores.
Está disponible un cuestionario para validar los conocimientos previos antes de realizar la formación.
Programa de la formación Modelos de Deep Learning
Metodología para construir y entrenar modelos de Deep Learning
- Enfoque experimental: formular una hipótesis, entrenar, medir e iterar.
- Ciclo de construcción: datos > arquitectura > entrenamiento > evaluación > diagnóstico > ajuste.
- Preparación de un dataset de entrenamiento: recopilación, limpieza, división train/validation/test y equilibrado de clases.
- Baseline: por qué empezar siempre por un modelo simple.
- Hiperparámetros clave: learning rate, batch size, número de epochs, tamaño del modelo, dropout y regularización.
- Herramientas de seguimiento: TensorBoard y Weights & Biases.
- Visualización de curvas de pérdida y detección de overfitting y underfitting.
- Diagnóstico de un modelo que no converge: checklist de las causas más frecuentes.
Ejercicio práctico
Puesta en marcha del entorno de trabajo con PyTorch, TensorBoard y un dataset sintético simple. Entrenamiento de una baseline, modificación sistemática de los hiperparámetros y observación y documentación de sus efectos.
Construir un modelo de lenguaje con Deep Learning
- Creación de un micro-lenguaje inventado: gramática simple, vocabulario controlado y reglas de sintaxis definidas por los participantes.
- Generación del dataset de entrenamiento a partir de la gramática.
- Construcción paso a paso de un modelo secuencia a secuencia: embeddings, RNN/LSTM y posteriormente un Transformer minimal.
- Entrenamiento y observación: comprobar si el modelo aprende las reglas e identificar dónde falla.
- Experimentación con tamaño del vocabulario, dimensión de los embeddings, número de capas y learning rate.
- Medición del impacto de los hiperparámetros sobre la capacidad del modelo para aprender la gramática.
- Análisis de los límites: complejidad del lenguaje frente al tamaño del modelo, datos insuficientes y overfitting sobre un corpus pequeño.
- Incorporación de reglas más complejas, como concordancias y dependencias largas, para observar cuándo comienza a fallar el modelo.
Ejercicios prácticos
Cada participante definirá su propio micro-lenguaje, generará el dataset, entrenará el modelo y llevará los hiperparámetros hasta sus límites.
Se compararán los resultados entre participantes para analizar qué lenguajes presentan mayor dificultad de aprendizaje y por qué.
Construir un modelo de reconocimiento de imágenes con CNN
- Clasificación de imágenes sobre un dataset controlado: objetos cotidianos, caracteres manuscritos o imagen médica simplificada, entre otros posibles ejemplos.
- Construcción incremental de una CNN: convoluciones, pooling y capas densas.
- Incorporación progresiva de complejidad.
- Data augmentation mediante rotaciones, recorte y ruido, y análisis de su impacto sobre la generalización.
- Experimentación con profundidad de la red, tamaño de los filtros, dropout y batch normalization.
- Transfer learning a partir de modelos preentrenados como ResNet o EfficientNet.
- Congelación y descongelación de capas.
- Comparación con un modelo construido from scratch.
- Análisis de los límites: datasets demasiado pequeños, clases ambiguas y modelos que memorizan en lugar de generalizar.
- Interpretabilidad mediante GradCAM para visualizar qué elementos analiza el modelo y facilitar su diagnóstico.
El uso de CNN y transfer learning para clasificación de imágenes es coherente con los flujos de entrenamiento documentados actualmente por PyTorch.
Ejercicio práctico
Construcción de un clasificador de imágenes de extremo a extremo a partir de un dataset personalizado (con fotografías de los participantes o un dataset proporcionado), creación de una CNN from scratch y aplicación posterior de transfer learning, comparando el rendimiento y utilizando GradCAM para su visualización.
Construir un modelo de reconocimiento de sonidos
- Introducción al tratamiento de audio para Deep Learning.
- Señal temporal, espectrogramas y mel-espectrogramas.
- Transformación del sonido en una representación explotable por una red.
- Clasificación de sonidos: comandos de voz, sonidos del entorno o ruidos de máquinas.
- Preparación de los datos de audio: recorte, normalización y augmentation mediante ruido, pitch shift y time stretch.
- Enfoque CNN sobre espectrogramas y reutilización de las competencias adquiridas en reconocimiento de imágenes.
- Enfoque secuencial mediante RNN/LSTM directamente sobre la señal.
- Comparación entre el enfoque secuencial y el basado en espectrogramas.
- Experimentación con la resolución del espectrograma, tamaño de la ventana FFT y arquitectura de la red.
- Análisis del impacto sobre la capacidad para distinguir sonidos próximos.
- Límites relacionados con el ruido ambiente, la variabilidad entre locutores y la similitud entre sonidos.
- Diagnóstico y estrategias de mejora.
- Aplicación transversal de baseline, hiperparámetros, overfitting y augmentation a las tres modalidades.
Ejercicios prácticos
Clasificación de sonidos mediante grabaciones o un dataset proporcionado, extracción de espectrogramas, construcción de un clasificador y experimentación con hiperparámetros.
Comparación de los resultados obtenidos sobre texto, imagen y sonido para analizar las diferencias entre las distintas modalidades.
Optimización y puesta en producción de modelos de Deep Learning
- Análisis transversal de la construcción de modelos de texto, imagen y sonido.
- Puntos comunes y diferencias entre las tres modalidades.
- Grilla de diagnóstico universal: underfitting, overfitting, desequilibrio de clases y datos ruidosos.
- Modelo custom frente a modelo preentrenado: criterios de decisión según el tamaño del dataset, la especificidad del dominio y el presupuesto de cómputo.
- Fine-tuning de modelos preentrenados.
- Modelos multimodales: texto + imagen.
- Modelos generativos.
- Buenas prácticas de reproducibilidad: seeds, versionado de datasets y experimentos y documentación.
- Puesta en producción de un modelo construido a medida: exportación, optimización y monitorización de la deriva.
Proyecto final
Cada participante elegirá una modalidad y un problema para construir un modelo optimizado aplicando los aprendizajes de los bloques anteriores. Finalmente, presentará al grupo sus resultados y el diagnóstico realizado.
Nota: El contenido del programa puede adaptarse en función del nivel, los requisitos previos y las necesidades de los participantes.
Metodología de la formación Modelos de Deep Learning
La formación puede impartirse de forma presencial o a distancia, mediante blended learning, e-learning o clase virtual.
El formador alternará métodos demostrativos, interrogativos y activos mediante ejercicios prácticos y/o simulaciones.
A lo largo de la formación, los participantes trabajarán con entornos instalados en los equipos o disponibles online, además de soportes de curso y ejercicios. En función de la modalidad, se utilizarán ordenadores Mac o PC, conexión a Internet, pizarra blanca o paperboard, videoproyector o pantalla táctil interactiva.
En caso de formación in company en instalaciones externas, el cliente deberá disponer de los recursos materiales y pedagógicos necesarios para desarrollar la formación conforme a los requisitos indicados.
Evaluación del aprendizaje
La evaluación se realizará mediante:
- Análisis de los resultados individuales obtenidos por cada participante durante los ejercicios prácticos, con correcciones a lo largo de la formación.
- Realización de una prueba completa sobre un proyecto global al finalizar la formación, analizada por el consultor-formador.
- Cuestionario individual de evaluación de los aprendizajes al finalizar cada sesión.
Esta formación es bonificable a través de FUNDAE para todas las empresas que cuenten con trabajadores en régimen general de la Seguridad Social y dispongan de crédito formativo. SKOLAE Formación gestiona todo el proceso administrativo necesario para que tu empresa pueda recuperar el importe invertido en la formación, siempre que se cumplan los requisitos legales y de comunicación establecidos por FUNDAE.
Profesional especializado en Inteligencia Artificial, Machine Learning y Deep Learning, con experiencia práctica en el desarrollo y entrenamiento de modelos y dominio de Python y frameworks como PyTorch.
Cuenta con conocimientos avanzados en redes neuronales, modelos de lenguaje, visión por computador y procesamiento de audio, así como experiencia en el ajuste, evaluación y diagnóstico de modelos de Deep Learning.
Objetivos
Objetivos de la formación Modelos de Deep Learning
Al finalizar esta formación serás capaz de:
- Construir de extremo a extremo modelos de Deep Learning sobre tres modalidades: texto, imagen y sonido.
- Comprender mediante la experimentación el impacto de los hiperparámetros sobre la calidad de los modelos.
- Identificar los límites de un modelo y saber cuándo y cómo superarlos.
- Adquirir los reflejos prácticos necesarios para la construcción de modelos: preparación de los datos, elección de la arquitectura, entrenamiento, evaluación e iteración.
Requisitos previos
Para realizar esta formación es necesario:
- Tener un buen dominio de Python.
- Haber realizado la formación «Inteligencia Artificial (IA) y herramientas del Deep Learning (TensorFlow, Caffe, PyTorch…) – Comprender sus aportaciones» o disponer de conocimientos equivalentes sobre redes neuronales: CNN, RNN, funciones de pérdida y optimizadores.
Está disponible un cuestionario para validar los conocimientos previos antes de realizar la formación.
Duración
Programa
Programa de la formación Modelos de Deep Learning
Metodología para construir y entrenar modelos de Deep Learning
- Enfoque experimental: formular una hipótesis, entrenar, medir e iterar.
- Ciclo de construcción: datos > arquitectura > entrenamiento > evaluación > diagnóstico > ajuste.
- Preparación de un dataset de entrenamiento: recopilación, limpieza, división train/validation/test y equilibrado de clases.
- Baseline: por qué empezar siempre por un modelo simple.
- Hiperparámetros clave: learning rate, batch size, número de epochs, tamaño del modelo, dropout y regularización.
- Herramientas de seguimiento: TensorBoard y Weights & Biases.
- Visualización de curvas de pérdida y detección de overfitting y underfitting.
- Diagnóstico de un modelo que no converge: checklist de las causas más frecuentes.
Ejercicio práctico
Puesta en marcha del entorno de trabajo con PyTorch, TensorBoard y un dataset sintético simple. Entrenamiento de una baseline, modificación sistemática de los hiperparámetros y observación y documentación de sus efectos.
Construir un modelo de lenguaje con Deep Learning
- Creación de un micro-lenguaje inventado: gramática simple, vocabulario controlado y reglas de sintaxis definidas por los participantes.
- Generación del dataset de entrenamiento a partir de la gramática.
- Construcción paso a paso de un modelo secuencia a secuencia: embeddings, RNN/LSTM y posteriormente un Transformer minimal.
- Entrenamiento y observación: comprobar si el modelo aprende las reglas e identificar dónde falla.
- Experimentación con tamaño del vocabulario, dimensión de los embeddings, número de capas y learning rate.
- Medición del impacto de los hiperparámetros sobre la capacidad del modelo para aprender la gramática.
- Análisis de los límites: complejidad del lenguaje frente al tamaño del modelo, datos insuficientes y overfitting sobre un corpus pequeño.
- Incorporación de reglas más complejas, como concordancias y dependencias largas, para observar cuándo comienza a fallar el modelo.
Ejercicios prácticos
Cada participante definirá su propio micro-lenguaje, generará el dataset, entrenará el modelo y llevará los hiperparámetros hasta sus límites.
Se compararán los resultados entre participantes para analizar qué lenguajes presentan mayor dificultad de aprendizaje y por qué.
Construir un modelo de reconocimiento de imágenes con CNN
- Clasificación de imágenes sobre un dataset controlado: objetos cotidianos, caracteres manuscritos o imagen médica simplificada, entre otros posibles ejemplos.
- Construcción incremental de una CNN: convoluciones, pooling y capas densas.
- Incorporación progresiva de complejidad.
- Data augmentation mediante rotaciones, recorte y ruido, y análisis de su impacto sobre la generalización.
- Experimentación con profundidad de la red, tamaño de los filtros, dropout y batch normalization.
- Transfer learning a partir de modelos preentrenados como ResNet o EfficientNet.
- Congelación y descongelación de capas.
- Comparación con un modelo construido from scratch.
- Análisis de los límites: datasets demasiado pequeños, clases ambiguas y modelos que memorizan en lugar de generalizar.
- Interpretabilidad mediante GradCAM para visualizar qué elementos analiza el modelo y facilitar su diagnóstico.
El uso de CNN y transfer learning para clasificación de imágenes es coherente con los flujos de entrenamiento documentados actualmente por PyTorch.
Ejercicio práctico
Construcción de un clasificador de imágenes de extremo a extremo a partir de un dataset personalizado (con fotografías de los participantes o un dataset proporcionado), creación de una CNN from scratch y aplicación posterior de transfer learning, comparando el rendimiento y utilizando GradCAM para su visualización.
Construir un modelo de reconocimiento de sonidos
- Introducción al tratamiento de audio para Deep Learning.
- Señal temporal, espectrogramas y mel-espectrogramas.
- Transformación del sonido en una representación explotable por una red.
- Clasificación de sonidos: comandos de voz, sonidos del entorno o ruidos de máquinas.
- Preparación de los datos de audio: recorte, normalización y augmentation mediante ruido, pitch shift y time stretch.
- Enfoque CNN sobre espectrogramas y reutilización de las competencias adquiridas en reconocimiento de imágenes.
- Enfoque secuencial mediante RNN/LSTM directamente sobre la señal.
- Comparación entre el enfoque secuencial y el basado en espectrogramas.
- Experimentación con la resolución del espectrograma, tamaño de la ventana FFT y arquitectura de la red.
- Análisis del impacto sobre la capacidad para distinguir sonidos próximos.
- Límites relacionados con el ruido ambiente, la variabilidad entre locutores y la similitud entre sonidos.
- Diagnóstico y estrategias de mejora.
- Aplicación transversal de baseline, hiperparámetros, overfitting y augmentation a las tres modalidades.
Ejercicios prácticos
Clasificación de sonidos mediante grabaciones o un dataset proporcionado, extracción de espectrogramas, construcción de un clasificador y experimentación con hiperparámetros.
Comparación de los resultados obtenidos sobre texto, imagen y sonido para analizar las diferencias entre las distintas modalidades.
Optimización y puesta en producción de modelos de Deep Learning
- Análisis transversal de la construcción de modelos de texto, imagen y sonido.
- Puntos comunes y diferencias entre las tres modalidades.
- Grilla de diagnóstico universal: underfitting, overfitting, desequilibrio de clases y datos ruidosos.
- Modelo custom frente a modelo preentrenado: criterios de decisión según el tamaño del dataset, la especificidad del dominio y el presupuesto de cómputo.
- Fine-tuning de modelos preentrenados.
- Modelos multimodales: texto + imagen.
- Modelos generativos.
- Buenas prácticas de reproducibilidad: seeds, versionado de datasets y experimentos y documentación.
- Puesta en producción de un modelo construido a medida: exportación, optimización y monitorización de la deriva.
Proyecto final
Cada participante elegirá una modalidad y un problema para construir un modelo optimizado aplicando los aprendizajes de los bloques anteriores. Finalmente, presentará al grupo sus resultados y el diagnóstico realizado.
Nota: El contenido del programa puede adaptarse en función del nivel, los requisitos previos y las necesidades de los participantes.
Metodología
Metodología de la formación Modelos de Deep Learning
La formación puede impartirse de forma presencial o a distancia, mediante blended learning, e-learning o clase virtual.
El formador alternará métodos demostrativos, interrogativos y activos mediante ejercicios prácticos y/o simulaciones.
A lo largo de la formación, los participantes trabajarán con entornos instalados en los equipos o disponibles online, además de soportes de curso y ejercicios. En función de la modalidad, se utilizarán ordenadores Mac o PC, conexión a Internet, pizarra blanca o paperboard, videoproyector o pantalla táctil interactiva.
En caso de formación in company en instalaciones externas, el cliente deberá disponer de los recursos materiales y pedagógicos necesarios para desarrollar la formación conforme a los requisitos indicados.
Evaluación del aprendizaje
La evaluación se realizará mediante:
- Análisis de los resultados individuales obtenidos por cada participante durante los ejercicios prácticos, con correcciones a lo largo de la formación.
- Realización de una prueba completa sobre un proyecto global al finalizar la formación, analizada por el consultor-formador.
- Cuestionario individual de evaluación de los aprendizajes al finalizar cada sesión.
Bonificación Fundae
Esta formación es bonificable a través de FUNDAE para todas las empresas que cuenten con trabajadores en régimen general de la Seguridad Social y dispongan de crédito formativo. SKOLAE Formación gestiona todo el proceso administrativo necesario para que tu empresa pueda recuperar el importe invertido en la formación, siempre que se cumplan los requisitos legales y de comunicación establecidos por FUNDAE.
Formador
Profesional especializado en Inteligencia Artificial, Machine Learning y Deep Learning, con experiencia práctica en el desarrollo y entrenamiento de modelos y dominio de Python y frameworks como PyTorch.
Cuenta con conocimientos avanzados en redes neuronales, modelos de lenguaje, visión por computador y procesamiento de audio, así como experiencia en el ajuste, evaluación y diagnóstico de modelos de Deep Learning.
Preguntas frecuentes sobre la formación Modelos de Deep Learning
Qué aprenderé en la formación sobre modelos de Deep Learning?
Aprenderás a construir, entrenar y evaluar modelos de Deep Learning aplicados a texto, imagen y sonido, experimentar con hiperparámetros, diagnosticar problemas y analizar los límites de los modelos.
¿Qué tecnologías se utilizan durante la formación?
El programa incluye el uso de tecnologías y conceptos como PyTorch, TensorBoard, Weights & Biases, CNN, RNN/LSTM, Transformers, transfer learning y GradCAM.
¿Qué conocimientos necesito para realizar la formación?
Es necesario tener un buen dominio de Python y conocimientos sobre redes neuronales, incluyendo CNN, RNN, funciones de pérdida y optimizadores.
¿Se trabaja con modelos de texto, imagen y sonido?
Sí. El programa aborda las tres modalidades mediante la construcción de un modelo de lenguaje, un modelo de reconocimiento de imágenes y un modelo de reconocimiento de sonidos.








