3.7. Fundamentos Matemáticos de la Ciencia de Datos (FDS)
Esta área cubre la teoría matemática subyacente a la ciencia de datos moderna y el aprendizaje automático, incluyendo aprendizaje estadístico, optimización, métodos de kernel, reducción de dimensionalidad, análisis topológico de datos, teoría de la información y las matemáticas del aprendizaje profundo.
| área de Conocimiento (Knowledge Area-KA) (KA) | Core Tier1 | Core Tier2 | Electivo |
| 3.7.1 Teoría del Aprendizaje Estadístico |
|
| No |
| 3.7.2 Optimización para Aprendizaje Automático |
|
| No |
| line:11305?? Análisis Topológico de Datos |
|
| No |
| 3.7.4 Reducción de Dimensionalidad |
|
| No |
| line:11307?? Métodos de Kernel y Espacios de Hilbert con Núcleo Reproductor |
|
| No |
| 3.7.3 Teoría de la Información |
|
| No |
| 3.7.5 Fundamentos Matemáticos del Aprendizaje Profundo |
|
| No |
3.7.1. FDS/Teoría del Aprendizaje Estadístico
Marco PAC-learning, dimensión VC, complejidad de Rademacher, cotas de generalización y equilibrio
sesgo-varianza.
Temas:
Core
- Marco PAC-learning: complejidad muestral, clases de hipótesis y capacidad de aprendizaje
- Dimensión VC: definición, ejemplos y el teorema fundamental del aprendizaje
- Complejidad de Rademacher y cotas de convergencia uniforme
- Descomposición sesgo-varianza y el fenómeno de doble descenso
- Regularización: regularización de Tikhonov y minimización del riesgo estructural
Aprendizaje esperado (Learning Outcomes):
Core:
- 1.
- Enunciar la definición de PAC-learning y determinar si una clase de hipótesis es PAC-aprendible [Familiarizarse]
- 2.
- Calcular la dimensión VC de clases de hipótesis estándar y derivar cotas de complejidad muestral [Usar]
- 3.
- Analizar el error de generalización usando complejidad de Rademacher y explicar el fenómeno de doble descenso [Evaluar]
3.7.2. FDS/Optimización para Aprendizaje Automático
Teoría de optimización convexa, SGD y sus variantes, métodos adaptativos y paisajes de optimización no
convexa.
Temas:
Core
- Convexidad, convexidad fuerte y dualidad de Fenchel en optimización
- Descenso de gradiente estocástico: tasas de convergencia para objetivos convexos y no convexos
- Métodos de gradiente adaptativo: AdaGrad, RMSProp y Adam
- Optimización no convexa: puntos de silla, mínimos locales y geometría del paisaje de pérdida de redes neuronales
-
Métodos de gradiente proximal y descenso por coordenadas para problemas estructurados
Aprendizaje esperado (Learning Outcomes):
Core:
- 1.
- Explicar las garantías de convergencia de SGD para funciones convexas suaves e identificar el papel de la tasa de aprendizaje [Familiarizarse]
- 2.
- Aplicar Adam y métodos de gradiente proximal para entrenar modelos de aprendizaje automático regularizados [Usar]
- 3.
- Analizar el paisaje de pérdida de una red sobreparametrizada y explicar por qué SGD encuentra buenos mínimos [Evaluar]
3.7.3. FDS/Teoría de la Información
Entropía de Shannon, información mutua, capacidad de canal, teoría de tasa-distorsión y aplicaciones al
aprendizaje automático.
Temas:
Core
- Entropía de Shannon, entropía conjunta y condicional, y la regla de la cadena
- Información mutua, divergencia KL y la desigualdad de procesamiento de datos
- Capacidad de canal: teorema de codificación de canal ruidoso de Shannon y el canal binario simétrico
- Teoría de tasa-distorsión y el equilibrio entre compresión y fidelidad
- Fundamentos de teoría de la información en ML: MDL, inferencia variacional (ELBO) y el cuello de botella de la información
Aprendizaje esperado (Learning Outcomes):
Core:
- 1.
- Calcular entropía de Shannon e información mutua para distribuciones discretas e interpretar su significado [Familiarizarse]
- 2.
- Aplicar el teorema de capacidad de canal de Shannon para determinar la tasa máxima de transmisión confiable [Usar]
- 3.
- Analizar un algoritmo de aprendizaje usando el principio del cuello de botella de la información y relacionar compresión con generalización [Evaluar]
3.7.4. FDS/Reducción de Dimensionalidad
Reducción de dimensionalidad lineal y no lineal: PCA, proyecciones aleatorias, aprendizaje de variedades y
métodos modernos (t-SNE, UMAP).
Temas:
Core
- PCA: descomposición en valores singulares, varianza explicada y aproximación óptima de bajo rango
- Lema de Johnson-Lindenstrauss y proyecciones aleatorias para reducción de dimensionalidad
- Aprendizaje de variedades: Isomap, incrustación lineal local (LLE) e incrustación espectral
- Métodos no lineales modernos: t-SNE y UMAP; teoría, parámetros y limitaciones
- Autoencoders y autoencoders variacionales (VAEs) como reducción de dimensionalidad no lineal
Aprendizaje esperado (Learning Outcomes):
Core:
- 1.
- Explicar el lema de Johnson-Lindenstrauss y justificar por qué las proyecciones aleatorias preservan distancias [Familiarizarse]
- 2.
- Aplicar PCA y t-SNE a datos de alta dimensión e interpretar las incrustaciones resultantes en baja dimensión [Usar]
- 3.
- Comparar métodos de reducción de dimensionalidad lineales y no lineales con respecto a la preservación de la geometría y el costo computacional [Evaluar]
3.7.5. FDS/Fundamentos Matemáticos del Aprendizaje Profundo
Aproximación universal, kernel tangente neural, sesgo implícito de SGD, sobreparametrización y aprendizaje
profundo geométrico.
Temas:
Core
- Teoremas de aproximación universal: compromisos entre anchura y profundidad para redes ReLU
- Kernel tangente neural (NTK) y el límite de anchura infinita de redes neuronales
- Regularización implícita y sesgo implícito de SGD hacia soluciones de norma mínima
- Sobreajuste benigno y doble descenso en modelos sobreparametrizados
- Aprendizaje profundo geométrico: equivarianza, simetría de grupo y redes neuronales de grafos
Aprendizaje esperado (Learning Outcomes):
Core:
- 1.
- Enunciar el teorema de aproximación universal e identificar sus supuestos y limitaciones [Familiarizarse]
- 2.
- Explicar el kernel tangente neural y su papel en la comprensión de la dinámica de entrenamiento de redes anchas [Usar]
- 3.
- Analizar el sesgo implícito del descenso de gradiente y relacionarlo con la generalización en regímenes sobreparametrizados [Evaluar]