- ES Español

- EN English

3.7. Fundamentos Matemáticos de la Ciencia de Datos (FDS)
Esta área cubre la teoría matemática que subyace a la ciencia de datos moderna y el aprendizaje automático: teoría del aprendizaje estadístico, optimización, teoría de la información, reducción de dimensionalidad y la matemática del aprendizaje profundo, todos esenciales para estudiantes de Computación en IA, ciencia de datos e ingeniería de software.
| Área de Conocimiento (KA) | CS Core | KA Core |
3.7.1 Teoría del Aprendizaje Estadístico | Electivo | |
3.7.2 Optimización para el Aprendizaje Automático | Electivo | |
3.7.3 Teoría de la Información | Electivo | |
3.7.4 Reducción de Dimensionalidad | Electivo | |
3.7.5 Fundamentos Matemáticos del Aprendizaje Profundo | Electivo | |
3.7.1. FDS/Teoría del Aprendizaje Estadístico ↑ Volver arriba
Marco PAC de aprendizaje, dimensión VC, complejidad de Rademacher, cotas de generalización y la compensación sesgo-varianza.
Temas:
Core
- Marco de aprendizaje PAC: complejidad muestral, clases de hipótesis y aprendizabilidad
- Dimensión VC: definición, ejemplos y el teorema fundamental del aprendizaje
- Complejidad de Rademacher y cotas de convergencia uniforme
- Descomposición sesgo-varianza y el fenómeno de doble descenso
- Regularización: regularización de Tikhonov y minimización del riesgo estructural
Aprendizaje esperado (Learning Outcomes):
Core:
- Enunciar la definición de aprendizaje PAC y determinar si una clase de hipótesis es PAC-aprendible [Familiarizarse]
- Calcular la dimensión VC de clases de hipótesis estándar y derivar cotas de complejidad muestral [Usar]
- Analizar el error de generalización usando la complejidad de Rademacher y explicar el fenómeno de doble descenso [Evaluar]
3.7.2. FDS/Optimización para el Aprendizaje Automático ↑ Volver arriba
Teoría de optimización convexa, SGD y sus variantes, métodos adaptativos y los paisajes de optimización no convexos para el entrenamiento de modelos de aprendizaje.
Temas:
Core
- Convexidad, convexidad fuerte y dualidad de Fenchel en optimización
- Descenso de gradiente estocástico: tasas de convergencia para objetivos convexos y no convexos
- Métodos de gradiente adaptativos: AdaGrad, RMSProp y Adam
- Optimización no convexa: puntos de silla, mínimos locales y geometría del paisaje de pérdida de redes neuronales
- Métodos de gradiente proximal y descenso de coordenadas para problemas estructurados
Aprendizaje esperado (Learning Outcomes):
Core:
- Explicar las garantías de convergencia del SGD para funciones convexas suaves e identificar el papel de la tasa de aprendizaje [Familiarizarse]
- Aplicar Adam y los métodos de gradiente proximal para entrenar modelos de aprendizaje automático regularizados [Usar]
- Analizar el paisaje de pérdida de una red sobreparametrizada y explicar por qué el SGD encuentra buenos mínimos [Evaluar]
3.7.3. FDS/Teoría de la Información ↑ Volver arriba
Entropía de Shannon, información mutua, capacidad del canal, teoría de la distorsión y aplicaciones al aprendizaje automático y la compresión de datos en computación.
Temas:
Core
- Entropía de Shannon, entropía conjunta y condicional, y la regla de la cadena
- Información mutua, divergencia KL y la desigualdad de procesamiento de datos
- Capacidad del canal: el teorema de codificación de canal ruidoso de Shannon y el canal binario simétrico
- Teoría de la tasa-distorsión y la compensación entre compresión y fidelidad
- Fundamentos de la teoría de la información en ML: MDL, inferencia variacional (ELBO) y el cuello de botella de la información
Aprendizaje esperado (Learning Outcomes):
Core:
- Calcular la entropía de Shannon y la información mutua para distribuciones discretas e interpretar su significado [Familiarizarse]
- Aplicar el teorema de capacidad del canal de Shannon para determinar la tasa máxima de transmisión confiable [Usar]
- Analizar un algoritmo de aprendizaje usando el principio del cuello de botella de la información y relacionar la compresión con la generalización [Evaluar]
3.7.4. FDS/Reducción de Dimensionalidad ↑ Volver arriba
Reducción de dimensionalidad lineal y no lineal: ACP, proyecciones aleatorias, aprendizaje de variedades y métodos modernos (t-SNE, UMAP), ampliamente usados en ciencia de datos y visualización.
Temas:
Core
- ACP: descomposición en valores singulares, varianza explicada y aproximación óptima de bajo rango
- Lema de Johnson-Lindenstrauss y proyecciones aleatorias para reducción de dimensionalidad
- Aprendizaje de variedades: Isomap, embedding lineal local (LLE) y embedding espectral
- Métodos no lineales modernos: t-SNE y UMAP; teoría, parámetros y limitaciones
- Autoencoders y autoencoders variacionales (VAE) como reducción de dimensionalidad no lineal
Aprendizaje esperado (Learning Outcomes):
Core:
- Explicar el Lema de Johnson-Lindenstrauss y justificar por qué las proyecciones aleatorias preservan las distancias [Familiarizarse]
- Aplicar ACP y t-SNE a datos de alta dimensionalidad e interpretar los embeddings de baja dimensión resultantes [Usar]
- Comparar los métodos de reducción de dimensionalidad lineal y no lineal respecto a la preservación de la geometría y el costo computacional [Evaluar]
3.7.5. FDS/Fundamentos Matemáticos del Aprendizaje Profundo ↑ Volver arriba
Aproximación universal, el núcleo tangente neuronal, sesgo implícito del SGD, sobreparametrización y aprendizaje profundo geométrico, la matemática de frontera de la IA moderna.
Temas:
Core
- Teoremas de aproximación universal: compensaciones de anchura y profundidad para redes ReLU
- Núcleo tangente neuronal (NTK) y el límite de ancho infinito de las redes neuronales
- Regularización implícita y sesgo implícito del SGD hacia soluciones de norma mínima
- Sobreajuste benigno y doble descenso en modelos sobreparametrizados
- Aprendizaje profundo geométrico: equivarianza, simetría de grupos y redes neuronales de grafos
Aprendizaje esperado (Learning Outcomes):
Core:
- Enunciar el teorema de aproximación universal e identificar sus hipótesis y limitaciones [Familiarizarse]
- Explicar el núcleo tangente neuronal y su papel en la comprensión de la dinámica de entrenamiento de redes anchas [Usar]
- Analizar el sesgo implícito del descenso de gradiente y relacionarlo con la generalización en regímenes sobreparametrizados [Evaluar]