3.7. Fundamentos Matemáticos de la Ciencia de Datos (FDS)

3.7. Fundamentos Matemáticos de la Ciencia de Datos (FDS)

Esta área cubre la teoría matemática que subyace a la ciencia de datos moderna y el aprendizaje automático: teoría del aprendizaje estadístico, optimización, teoría de la información, reducción de dimensionalidad y la matemática del aprendizaje profundo, todos esenciales para estudiantes de Computación en IA, ciencia de datos e ingeniería de software.

Tabla 3.7: Lista de KUs del área de Fundamentos Matemáticos de la Ciencia de Datos.

3.7.1. FDS/Teoría del Aprendizaje Estadístico ↑ Volver arriba

Marco PAC de aprendizaje, dimensión VC, complejidad de Rademacher, cotas de generalización y la compensación sesgo-varianza.
Temas:
Core

  • Marco de aprendizaje PAC: complejidad muestral, clases de hipótesis y aprendizabilidad
  • Dimensión VC: definición, ejemplos y el teorema fundamental del aprendizaje
  • Complejidad de Rademacher y cotas de convergencia uniforme
  • Descomposición sesgo-varianza y el fenómeno de doble descenso
  • Regularización: regularización de Tikhonov y minimización del riesgo estructural

Aprendizaje esperado (Learning Outcomes):
Core:

  1. Enunciar la definición de aprendizaje PAC y determinar si una clase de hipótesis es PAC-aprendible [Familiarizarse]
  2. Calcular la dimensión VC de clases de hipótesis estándar y derivar cotas de complejidad muestral [Usar]
  3. Analizar el error de generalización usando la complejidad de Rademacher y explicar el fenómeno de doble descenso [Evaluar]

3.7.2. FDS/Optimización para el Aprendizaje Automático ↑ Volver arriba

Teoría de optimización convexa, SGD y sus variantes, métodos adaptativos y los paisajes de optimización no convexos para el entrenamiento de modelos de aprendizaje.
Temas:
Core

  • Convexidad, convexidad fuerte y dualidad de Fenchel en optimización
  • Descenso de gradiente estocástico: tasas de convergencia para objetivos convexos y no convexos
  • Métodos de gradiente adaptativos: AdaGrad, RMSProp y Adam
  • Optimización no convexa: puntos de silla, mínimos locales y geometría del paisaje de pérdida de redes neuronales
  • Métodos de gradiente proximal y descenso de coordenadas para problemas estructurados

Aprendizaje esperado (Learning Outcomes):
Core:

  1. Explicar las garantías de convergencia del SGD para funciones convexas suaves e identificar el papel de la tasa de aprendizaje [Familiarizarse]
  2. Aplicar Adam y los métodos de gradiente proximal para entrenar modelos de aprendizaje automático regularizados [Usar]
  3. Analizar el paisaje de pérdida de una red sobreparametrizada y explicar por qué el SGD encuentra buenos mínimos [Evaluar]

3.7.3. FDS/Teoría de la Información ↑ Volver arriba

Entropía de Shannon, información mutua, capacidad del canal, teoría de la distorsión y aplicaciones al aprendizaje automático y la compresión de datos en computación.
Temas:
Core

  • Entropía de Shannon, entropía conjunta y condicional, y la regla de la cadena
  • Información mutua, divergencia KL y la desigualdad de procesamiento de datos
  • Capacidad del canal: el teorema de codificación de canal ruidoso de Shannon y el canal binario simétrico
  • Teoría de la tasa-distorsión y la compensación entre compresión y fidelidad
  • Fundamentos de la teoría de la información en ML: MDL, inferencia variacional (ELBO) y el cuello de botella de la información

Aprendizaje esperado (Learning Outcomes):
Core:

  1. Calcular la entropía de Shannon y la información mutua para distribuciones discretas e interpretar su significado [Familiarizarse]
  2. Aplicar el teorema de capacidad del canal de Shannon para determinar la tasa máxima de transmisión confiable [Usar]
  3. Analizar un algoritmo de aprendizaje usando el principio del cuello de botella de la información y relacionar la compresión con la generalización [Evaluar]

3.7.4. FDS/Reducción de Dimensionalidad ↑ Volver arriba

Reducción de dimensionalidad lineal y no lineal: ACP, proyecciones aleatorias, aprendizaje de variedades y métodos modernos (t-SNE, UMAP), ampliamente usados en ciencia de datos y visualización.
Temas:
Core

  • ACP: descomposición en valores singulares, varianza explicada y aproximación óptima de bajo rango
  • Lema de Johnson-Lindenstrauss y proyecciones aleatorias para reducción de dimensionalidad
  • Aprendizaje de variedades: Isomap, embedding lineal local (LLE) y embedding espectral
  • Métodos no lineales modernos: t-SNE y UMAP; teoría, parámetros y limitaciones
  • Autoencoders y autoencoders variacionales (VAE) como reducción de dimensionalidad no lineal

Aprendizaje esperado (Learning Outcomes):
Core:

  1. Explicar el Lema de Johnson-Lindenstrauss y justificar por qué las proyecciones aleatorias preservan las distancias [Familiarizarse]
  2. Aplicar ACP y t-SNE a datos de alta dimensionalidad e interpretar los embeddings de baja dimensión resultantes [Usar]
  3. Comparar los métodos de reducción de dimensionalidad lineal y no lineal respecto a la preservación de la geometría y el costo computacional [Evaluar]

3.7.5. FDS/Fundamentos Matemáticos del Aprendizaje Profundo ↑ Volver arriba

Aproximación universal, el núcleo tangente neuronal, sesgo implícito del SGD, sobreparametrización y aprendizaje profundo geométrico, la matemática de frontera de la IA moderna.
Temas:
Core

  • Teoremas de aproximación universal: compensaciones de anchura y profundidad para redes ReLU
  • Núcleo tangente neuronal (NTK) y el límite de ancho infinito de las redes neuronales
  • Regularización implícita y sesgo implícito del SGD hacia soluciones de norma mínima
  • Sobreajuste benigno y doble descenso en modelos sobreparametrizados
  • Aprendizaje profundo geométrico: equivarianza, simetría de grupos y redes neuronales de grafos

Aprendizaje esperado (Learning Outcomes):
Core:

  1. Enunciar el teorema de aproximación universal e identificar sus hipótesis y limitaciones [Familiarizarse]
  2. Explicar el núcleo tangente neuronal y su papel en la comprensión de la dinámica de entrenamiento de redes anchas [Usar]
  3. Analizar el sesgo implícito del descenso de gradiente y relacionarlo con la generalización en regímenes sobreparametrizados [Evaluar]

¿Encontraste una errata, un curso desactualizado, un enlace roto, o tienes una sugerencia? Cuéntanos.

Escanea para abrir en tu teléfono