La inteligencia artificial suele describirse como el aprendizaje de un modelo a partir de datos. Es una familia importante de enfoques, no una definición universal de inteligencia. En meteorología, oceanografía, sistemas energéticos, procesos industriales y muchos otros dominios físicos, ya existen ecuaciones, leyes de conservación, condiciones de frontera y décadas de conocimiento científico. El verdadero reto suele ser combinar ese conocimiento con observaciones escasas, ruidosas e incompletas.
01 Un pronóstico puede obedecer todas las ecuaciones y aun así partir del mundo equivocado
Un modelo dinámico describe cómo evoluciona un sistema a partir de un estado inicial. Escríbelo dx/dt = F(x) con x(0) = x₀, donde el vector de estado x(t) vive en ℝⁿ. Si ese estado inicial x₀ es incorrecto, el modelo puede resolver sus ecuaciones a la perfección y aun así producir la trayectoria equivocada. En sistemas no lineales, como la atmósfera o el océano, pequeños errores en el estado de partida crecen rápidamente: es la propiedad que define al caos determinista, y la razón por la que un pronóstico nunca vale más que su inicialización.
Las observaciones no resuelven el problema por sí solas. Satélites, boyas, radares y sensores miden solo ciertas variables, en lugares y momentos determinados, y con incertidumbre. El estado completo del modelo puede contener millones de valores; el vector de observación suele ser mucho más pequeño. Reconstruir el estado completo y físicamente coherente a partir de esos fragmentos no es interpolación: es inferencia bajo una restricción, donde la restricción es el modelo mismo.
Las ecuaciones codifican estructura y consistencia física, pero el estado inicial y los parámetros pueden ser inciertos.
Las mediciones anclan el modelo en la realidad, pero no describen todas las variables ni cada punto del espacio y del tiempo.
Inferir la condición inicial, los parámetros o la trayectoria ocultos que mejor explican la evidencia sin dejar de respetar el modelo.
Este es el territorio de los problemas inversos, y conviene ser formal al respecto, porque el curso lo es. El modelado matemático describe un sistema mediante ecuaciones —por lo general, ecuaciones diferenciales ordinarias o parciales— que involucran parámetros, condiciones iniciales y condiciones de frontera. Resolverlas en el sentido natural es el problema directo: dadas las entradas y los parámetros, calcular la salida. Si se escribe un modelo como una aplicación M : (x, p) ↦ y de las entradas x y los parámetros p hacia la salida y, el problema inverso consiste en recorrer esa aplicación en sentido contrario: a partir de un conocimiento parcial de y, reconstruir x o p. Los problemas inversos surgen precisamente cuando un sistema solo se conoce de manera parcial pero puede observarse, y se quieren reconstruir características que no son directamente medibles.
Las aplicaciones están en todas partes hacia donde apunta el curso: imágenes médicas (tomografía por rayos X y por ultrasonido, elastografía), análisis de imágenes (corrección de desenfoque, eliminación de ruido, inpainting, restauración), geociencias (tomografía sísmica, imagen radioastronómica y asimilación de datos para el pronóstico meteorológico), procesamiento de señales (deconvolución) e ingeniería mecánica (detección de fisuras y otros ensayos no destructivos). Y hay un puente hacia el aprendizaje automático que el curso establece de manera explícita: el ajuste de modelos y la identificación de parámetros son problemas inversos. La regresión lineal multivariada —reconstruir la matriz de coeficientes A en y = Ax a partir de pares observados, en el sentido de mínimos cuadrados— es el más sencillo. El mismo marco abarca el entrenamiento de redes neuronales y la estimación de parámetros en modelos de EDO y EDP, incluida la calibración de gemelos digitales.
Por qué los problemas inversos son difíciles: Hadamard y la inestabilidad de ejecutar un modelo hacia atrás
En 1902, Jacques Hadamard introdujo la noción de problema bien planteado. Un problema está bien planteado si se cumplen tres propiedades: una solución existe, la solución es única y la solución depende de forma continua de los datos. Si alguna de las tres falla, el problema está mal planteado.
La existencia y la unicidad son requisitos intuitivos: sin unicidad, incluso datos perfectos podrían no determinar lo que se quiere reconstruir. La tercera condición, la estabilidad, es la sutil y la de mayores consecuencias. Establece que un pequeño cambio en los datos —por lo general, un error de medición— debería producir solo un pequeño cambio en la solución reconstruida. Los problemas directos suelen ser estables; los problemas inversos, porque a menudo chocan con la irreversibilidad o la causalidad, con frecuencia no lo son. El carácter mal planteado es la regla, no la excepción.
El curso lo hace concreto con el ejemplo más claro posible: la derivación. Derivar es la inversa de integrar, y es inestable. Toma una función suave f y perturbala con una mínima oscilación de alta frecuencia, f_δ,n(x) = f(x) + δ·sin(nx). La perturbación de la función tiene amplitud δ, que puedes hacer tan pequeña como quieras. Pero la perturbación de su derivada tiene amplitud δ·n, que crece sin cota conforme aumenta la frecuencia n. Un error arbitrariamente pequeño en los datos produce un error arbitrariamente grande en la respuesta. La identificación de parámetros en una ecuación diferencial se comporta igual: en la ecuación del calor unidimensional −d/dx(a(x)·du/dx) = f, reconstruir la conductividad desconocida a a partir de mediciones de temperatura se escribe con facilidad y, sin embargo, está mal planteado dondequiera que el gradiente de temperatura se anule —ahí no existe solución alguna—.
La consecuencia práctica es la regularización: se añade información previa para restaurar la estabilidad, cambiando un poco de fidelidad a los datos ruidosos por una solución que no se dispara. No es un truco añadido al final; es una decisión de modelado sobre lo que se cree antes de mirar. Conservar esa idea —que la elección del a priori es un supuesto deliberado e inspeccionable— constituye la mayor parte de lo que distingue una reconstrucción defendible de un artefacto de apariencia segura.
02 Asimilación de datos: hacer que el modelo escuche sin que olvide lo que sabe
La asimilación de datos es el campo matemático situado en la interfaz entre el modelo y la observación. No pide que los datos sustituyan al modelo ni que el modelo ignore los datos. Busca el estado que haga a ambos tan compatibles como sea posible: una negociación controlada en la que el modelo aporta la dinámica (qué evoluciones son físicamente posibles), las observaciones aportan la corrección (dónde se aparta de la realidad la trayectoria simulada) y un conjunto de supuestos estadísticos decide cuánto debe confiarse en cada fuente.
El curso enseña el campo tal como existe realmente: no un solo algoritmo, sino una pequeña familia de clases de métodos, cada una con un trato distinto entre optimalidad, supuestos y costo.
Un pequeño laboratorio de asimilación
Esta ilustración, deliberadamente sencilla, combina una trayectoria del modelo con observaciones. El análisis en tono verde azulado cambia conforme varía la confianza supuesta en las observaciones. La asimilación de datos real utiliza estructuras de covarianza, restricciones dinámicas y métodos de optimización más ricos.
- Los métodos variacionales tratan la asimilación como la minimización de una función de costo. La 3D-Var encuentra la mejor estimación de estado en un solo instante; la 4D-Var encuentra la mejor estimación de estado a lo largo de toda una ventana de asimilación, y se formula mediante la teoría del control óptimo. (La 3D-Var fue el método operativo en Météo-France hasta 2000 —un recordatorio útil de que el “estado del arte” lleva fecha—.)
- Los métodos secuenciales alternan un paso de pronóstico con un paso de corrección estadística. La interpolación óptima es fácil de implementar pero físicamente incoherente; el filtro de Kalman es la teoría de la estimación estadística óptima; las variantes de ensamble y de orden reducido (EnKF, el filtro SEEK) existen precisamente porque el filtro completo no escala —más sobre esto abajo—.
- Los métodos de nudging añaden un término de retroalimentación a las ecuaciones del modelo, acercando de manera continua el estado simulado a las observaciones. Son, en el lenguaje de la teoría del control, observadores —y son el lugar donde Blum y Auroux hicieron su propia aportación, el tema del §05—.
El encuadre honesto, de principio a fin, es el mismo en el que insiste el curso: un estado reconstruido solo vale lo que valen la evidencia y el mecanismo que lo sustentan. Construida sin cuidado, la asimilación blanquea supuestos en conclusiones. Construida bien, es una forma de razonar con rigor sobre un sistema que no se puede observar por completo.
03 La optimización es el puente —y aquí es donde converge el plan de estudios
La asimilación variacional de datos convierte la reconstrucción en un problema de optimización, y este es el punto preciso en el que el curso de optimización de la escuela deja de ser un prerrequisito que tachar para convertirse en el motor del método. La función de costo de la 4D-Var, en la notación que usa el curso, es
Los detalles matemáticos determinan cómo se ponderan los errores y cómo se propaga la incertidumbre. La idea central es una búsqueda con restricciones de la trayectoria más consistente tanto con las ecuaciones como con las mediciones.
Simular el sistema a partir de la estimación actual del estado inicial.
Determinar cómo cambia la discrepancia cuando se modifican las incógnitas.
Actualizar la estimación, ejecutar de nuevo y continuar hasta alcanzar una solución aceptable.
Las incógnitas son el estado inicial x₀ y los parámetros del modelo u. El primer término mantiene la solución cerca de una estimación previa x_b (el background), ponderada por la inversa de la covarianza del error de background B. El segundo término penaliza la brecha entre la trayectoria del modelo y las observaciones en cada instante tᵢ, ponderada por la inversa de la covarianza del error de observación Rᵢ, con el operador de observación Hᵢ que proyecta el estado del modelo al espacio de observación. Minimizar J sujeto al modelo dx/dt = F(x, u) es exactamente un problema de control óptimo: hallar la condición inicial y los parámetros que producen la trayectoria más consistente tanto con las ecuaciones como con las mediciones.
Todo lo que construye el curso Continuous Optimisation se necesita aquí. La función de costo es un objetivo de valor real sobre un espacio de alta dimensión; el modelo es una restricción; las normas ponderadas por covarianzas son formas cuadráticas; la convexidad (o su ausencia) decide si un mínimo es global; y el minimizador no se halla mediante una inversa en forma cerrada, sino mediante un método de gradiente iterativo. En un solo instante, la 3D-Var admite incluso la solución explícita x* = [B⁻¹ + HᵀR⁻¹H]⁻¹(B⁻¹x_b + HᵀR⁻¹x_obs) —y el curso se cuida de señalar por qué esa fórmula es inútil en la práctica: las matrices son demasiado grandes para invertirse, así que en su lugar se evalúan J y su gradiente y se entregan a un algoritmo de optimización—.
Eso plantea la pregunta sobre la que gira todo el método: ¿cómo se obtiene el gradiente de J respecto de un vector de control que puede tener decenas de millones de componentes? Las diferencias finitas requerirían una ejecución del modelo por componente —del todo imposible—. La respuesta es el método del adjunto: ejecutar una vez el modelo directo, luego integrar un modelo adjunto hacia atrás a lo largo de la ventana, recogiendo un término de forzamiento en cada instante de observación, y leer el gradiente completo en la solución adjunta. El costo es una resolución directa más una resolución hacia atrás, independiente de la dimensión del vector de control. Ese solo hecho es lo que hace siquiera viable la asimilación variacional a gran escala.
El curso no oculta lo exigente que es esto, y dos de sus advertencias vale la pena destacar, porque son justo el tipo de detalle que separa un sistema que funciona de uno que solo parece plausible:
- El adjunto del modelo discretizado no es la discretización del adjunto continuo. Derivar las ecuaciones adjuntas en el papel y luego discretizarlas da el gradiente equivocado; la vía correcta es diferenciar directamente el modelo discreto (en la práctica, mediante diferenciación automática —tangente-lineal para la derivada directa, adjunto para la inversa—). “Diferenciar y luego discretizar” y “discretizar y luego diferenciar” no conmutan, e invertir este orden es una fuente de error clásica y silenciosa.
- Para un modelo no lineal,
Jpor lo general no es convexa. Puede tener varios mínimos locales, de modo que el resultado depende de dónde arranque la optimización, y se añade un término de regularización —α‖x₀ − x₀_background‖² + β‖u − u_background‖²— para domar el problema. Coeficientes grandes penalizan; coeficientes pequeños regularizan; la elección es, una vez más, una decisión de modelado y no un valor por defecto.
Hay una disciplina más que los laboratorios vuelven innegociable, y es el mismo escepticismo que exige la teoría de los problemas inversos: antes de confiar en un gradiente adjunto, verifícalo numéricamente. Compara el gradiente que produce el adjunto con una derivada direccional por diferencias finitas en una dirección aleatoria. Si ambos no coinciden, el adjunto tiene un error —y una 4D-Var construida sobre un gradiente equivocado minimizará lo que no debe mientras luce del todo sana—.
04 Back and Forth Nudging: corregir sin adjunto
Jacques Blum y Didier Auroux introdujeron el algoritmo Back and Forth Nudging (BFN) en 2005. El nudging estándar añade un término de retroalimentación a las ecuaciones del modelo —un observador de Luenberger (asintótico), en términos de la teoría del control— que acerca el estado simulado a las observaciones a medida que el modelo se ejecuta. El aporte de Blum y Auroux fue aplicar esa corrección tanto hacia adelante como hacia atrás dentro de la misma ventana de asimilación:
Partir de la estimación actual e integrar el modelo físico mientras el nudging acerca su trayectoria a las observaciones.
Usar el estado final corregido para integrar hacia atrás en la misma ventana, con un término de retroalimentación del signo adecuado.
El estado reconstruido al inicio de la ventana se convierte en la siguiente estimación inicial. Iterar hasta que la trayectoria reconstruida se estabilice.
El primer artículo demostró la convergencia para un sistema lineal de ecuaciones diferenciales ordinarias. Igual de importante, hizo atractivo el método en la práctica: su formulación central no requiere linealización del modelo, ni construcción de un adjunto, ni un bucle de minimización aparte —justo la maquinaria que vuelve pesada a la 4D-Var—. Trabajos posteriores desarrollaron la teoría y probaron el enfoque en sistemas de Lorenz, ecuaciones de transporte, modelos de aguas someras y modelos oceánicos completos.
| Familia de métodos | Mecanismo central | Fortaleza | Reto de ingeniería |
|---|---|---|---|
| 4D-Var | Minimizar un costo en una ventana temporal. | Formulación variacional estructurada de manera global; asimila toda una ventana de una vez. | El desarrollo del adjunto y las integraciones repetidas del modelo son exigentes; B es difícil de estimar. |
| Filtros de Kalman / de ensamble | Alternar pronóstico y corrección estadística. | Tratamiento explícito de la evolución de la incertidumbre. | La propagación de covarianzas o los ensambles grandes son costosos; la no linealidad obliga a aproximar. |
| BFN / DBFN | Alternar observadores hacia adelante y hacia atrás. | Retroalimentación directa, implementación comparativamente ligera, convergencia rápida en los escenarios estudiados; sin adjunto. | La estabilidad hacia atrás, la selección de ganancias y la adecuación del modelo siguen requiriendo cuidado matemático. |
La extensión Diffusive Back and Forth Nudging (DBFN) se diseñó para modelos difusivos, donde la integración ingenua hacia atrás es inestable. En experimentos con un modelo bidimensional de aguas someras y un modelo oceánico tridimensional de ecuaciones primitivas, estabilizó el paso hacia atrás y redujo el impacto de las observaciones ruidosas. Es un resultado de investigación en escenarios específicos —no una afirmación de que un algoritmo sustituya a todos los demás métodos—. La postura madura, que el curso enuncia con claridad, es que los métodos se eligen según la estructura del modelo, el sistema de observación, la incertidumbre y el presupuesto de cómputo. “Usar IA” todavía no es una especificación de método.
05 Dos vidas de investigación, una cultura común de matemáticas aplicadas
La colaboración es poderosa porque se inscribe en carreras mucho más amplias. El mismo lenguaje matemático —ecuaciones diferenciales parciales, control, optimización, análisis numérico y problemas inversos— viaja desde la física de plasmas hasta la circulación oceánica, el procesamiento de imágenes, el pronóstico meteorológico y el modelado industrial.

Pr Jacques Blum
Pr Jacques Blum — análisis numérico, control y asimilación de datos. Tras la École normale supérieure y un doctorado bajo la dirección de Jacques-Louis Lions, investigación en el CNRS y cátedras en Grenoble, la École Polytechnique y Niza, Jacques Blum construyó una carrera en torno a la simulación, identificación y control óptimo de sistemas físicos regidos por ecuaciones diferenciales parciales.
Su trabajo abarca el equilibrio de plasmas en tokamaks, la reconstrucción en tiempo real, la circulación oceánica y la asimilación de datos. En DSTI es miembro del Consejo Científico y ayudó a definir el enfoque de la escuela para brindar apoyo matemático a todo el estudiantado. Entre sus distinciones: la Medalla de Bronce del CNRS (1984), el Prix Blaise-Pascal (1990), el Premio Seymour Cray (1998) y el Grand Prix de la Ville de Nice (2017).
Pr Didier Auroux
Pr Didier Auroux — director de la Maison de la Modélisation, de la Simulation et des Interactions. Didier Auroux se formó en la École normale supérieure de Lyon y obtuvo su doctorado bajo la dirección de Jacques Blum —Étude de différentes méthodes d’assimilation de données pour l’environnement (2003)—, seguido de una habilitación sobre algoritmos rápidos para procesamiento de imágenes y asimilación de datos.
Su investigación reúne geofísica, observadores, control óptimo, problemas inversos, análisis numérico y cómputo científico. Actualmente dirige la Maison de la Modélisation, de la Simulation et des Interactions de la Université Côte d’Azur, una estructura que apoya la investigación mediante modelado, simulación, cómputo de alto rendimiento y ciencia de datos.
Ambos tienen un compromiso especial con enseñar a todo el estudiantado, incluyendo a quienes se encuentran lejos de su propio nivel de investigación. Jacques propuso crear las Support Sessions de DSTI, inspiradas en las recitation classes de las mejores universidades; Didier dirige regularmente sesiones de apoyo para los módulos con fuerte contenido matemático. La confianza matemática no se construye bajando el techo intelectual. Se construye creando una ruta confiable para alcanzarla: que es, al final, la razón de ser de la cadena de cursos del §06.
06 La cadena de enseñanza: de las matemáticas aplicadas a la asimilación de datos
Lo que vuelve distintiva a la versión de DSTI no es que dos matemáticos eminentes figuren en una lista de docentes. Es que esas dos mismas personas imparten una secuencia conectada de cursos, cada uno un prerrequisito genuino del siguiente, que lleva al estudiante del gradiente de una función de una variable hasta una 4D-Var en funcionamiento. Jacques Blum y Didier Auroux imparten los tres cursos juntos, alternando los días de clase entre ellos, de modo que un grupo ve a ambos profesores a lo largo de la cadena en vez de encontrarse con uno por materia. El destino es difícil; la ruta se construye de manera deliberada.
Warm Up — Fundamentals of Mathematics. Cada MSc de datos de DSTI comienza con un Warm Up que establece los fundamentos matemáticos, con grupos cuya preparación previa varía considerablemente. Es el paso de nivelación antes de cualquier especialización.
Applied Mathematics for Data Science. En el conjunto de los MSc de datos, este curso aporta las matemáticas de trabajo que todo lo posterior da por supuesto: la derivación en una y varias variables, el gradiente, el desarrollo de Taylor; el álgebra lineal a través de vectores y matrices, los sistemas lineales, la diagonalización, los valores propios y vectores propios, y las formas cuadráticas; y los números complejos. El temario es franco sobre sus herramientas: “papel, lápiz y cerebro; R o Python para verificar los cálculos”. No son temas arbitrarios: el gradiente reaparece como el objeto que sigue un optimizador, la descomposición en elementos propios subyace a la estructura de covarianzas, y las formas cuadráticas son la forma de toda función de costo del §04.
Continuous Optimisation. Esta es la bisagra de toda la secuencia. Desarrolla funciones de costo y restricciones (de igualdad, de desigualdad, y restricciones dadas por una ecuación diferencial); diferenciabilidad en el sentido de Fréchet y de Gâteaux; convexidad; condiciones de optimalidad de primer y segundo orden; la existencia y unicidad de un mínimo —incluido el material verdaderamente avanzado de la minimización en espacios de Hilbert, la convergencia débil y la semicontinuidad inferior—; multiplicadores de Lagrange y dualidad; el teorema de Kuhn-Tucker (KKT) y los puntos silla; y luego los algoritmos que hacen el trabajo: descenso de gradiente con paso fijo y paso óptimo, gradiente conjugado, gradiente proyectado y el algoritmo de Uzawa. De manera reveladora, el curso ya plantea los problemas inversos como optimización —entre sus ejemplos trabajados están los mínimos cuadrados (Av = b) y la identificación de un coeficiente desconocido en −div(K∇u) = f mediante la minimización de J = Σ [u(xᵢ) − uᵢ]²—. El puente hacia la asimilación de datos está integrado en el propio temario de optimización.
Jacques propuso crear las Support Sessions de DSTI, inspiradas en las recitation classes de las universidades de la Ivy League y de las principales universidades de California. Didier dirige regularmente sesiones de apoyo para módulos con fuerte contenido matemático. El nivel es alto y el estudiantado recibe enseñanza estructurada adicional para ayudarle a alcanzarlo.
Inverse Problems & Data Assimilation. El campo de investigación entra directamente al plan de estudios. El curso cubre problemas bien planteados frente a mal planteados (Hadamard); métodos variacionales (control óptimo, el lagrangiano, métodos del adjunto); métodos secuenciales (filtrado de Kalman); y nudging (observadores). Sus prerrequisitos declarados son exactos y sin sentimentalismos: “Maths, Continuous Optimisation & Python Labs”, apoyándose también en los fundamentos de estadística y aprendizaje automático de la escuela. Los ejemplos son la identificación de parámetros y la calibración de modelos —el mismo marco de problema inverso del §01, ahora a plena potencia—.
Didier imparte Mathematics Harmonisation con la Dra Christine Malot, ayudando al estudiantado a establecer una base matemática común antes de avanzar hacia trabajos cuantitativos posteriores. Explorar el plan de estudios.
Jacques imparte el componente de física, conectando el cómputo con los sistemas físicos, los límites energéticos y las cuestiones ambientales en las que influye. Explorar el plan de estudios.
El trabajo de laboratorio es donde los métodos del propio artículo se vuelven algo que el estudiante ha construido con sus manos. Los laboratorios usan el sistema de Lorenz —el modelo caótico canónico de baja dimensión— en un diseño de experimento gemelo: generar una trayectoria “verdadera” conocida, crear a partir de ella observaciones escasas y ruidosas (observar dos de las tres variables, cada cien pasos, con ruido añadido), y luego partir de un background deliberadamente equivocado e intentar reconstruir la verdad. En ese único y honesto banco de pruebas, el estudiantado implementa por turnos las tres familias de métodos:
- Nudging — hacia adelante y luego hacia atrás, es decir, la propia BFN, codificada directamente;
- 4D-Var — la función de costo, el modelo adjunto para su gradiente, y la verificación numérica del gradiente antes de confiar en él;
- Kalman — el filtro lineal, y luego el filtro de Kalman extendido, que expone con exactitud qué se rompe cuando se fuerza un modelo no lineal a través de una corrección linealizada.
El experimento gemelo es en sí mismo una lección de validación: como la verdad se conoce por construcción, cada método puede evaluarse frente a ella —por eso es el lugar correcto para aprender, y también por eso es más fácil que la realidad operativa, donde la verdad es precisamente lo que falta—. Esa brecha entre un juguete diagnóstico y el sistema real se nombra, no se disimula.
Una nota sobre las personas detrás de la cadena, porque es un linaje intelectual real y no un adorno. Jacques Blum realizó su doctorado bajo la dirección de Jacques-Louis Lions, cuya teoría del control óptimo para sistemas gobernados por ecuaciones diferenciales parciales es el fundamento matemático sobre el que descansa la 4D-Var. Didier Auroux, a su vez, realizó su doctorado bajo la dirección de Jacques Blum —Étude de différentes méthodes d’assimilation de données pour l’environnement, defendido en 2003—. La maquinaria de control óptimo que se enseña en el curso de asimilación de datos es, en sentido directo, la tradición que ambos heredaron y extendieron —y el algoritmo Back and Forth Nudging surgió de esa misma colaboración—. La cadena docente, Lions → Blum → Auroux, recapitula una de investigación.
La cadena descrita aquí es la columna vertebral de los MSc de datos, pero no agota su docencia. A nivel licenciatura, Didier Auroux también imparte Mathematics Harmonisation en el BSc Computer Science & Engineering, con la Dra Christine Malot, ayudando al estudiantado a construir una base matemática común antes de trabajos cuantitativos posteriores; y Jacques Blum imparte la física del eje Energy – Climate – Sustainable IT del BSc, tratada por separado en Efficient IT begins before the code.
07 El problema de escala, y por qué la estructura se gana su lugar
Sería fácil confundir todo esto con teoría elegante. El curso es enfático en que no lo es, y la razón es la escala. Para la atmósfera y los océanos, una malla realista tiene del orden de cincuenta niveles verticales y varios cientos de puntos en cada dirección horizontal —muy por encima de diez millones de puntos de malla— con varias variables físicas (componentes de velocidad, presión, temperatura, humedad o salinidad, concentraciones químicas) en cada uno. El vector de control de una 4D-Var puede, por tanto, alcanzar de 10⁷ a 10⁹ componentes; el número de observaciones es de 10⁵–10⁶; las matrices de covarianza son nominalmente de tamaño n × n, es decir, astronómicamente grandes; y un centro de pronóstico operativo debe producir un análisis en tres a seis horas. Estimar siquiera la covarianza del error de background B es un problema de investigación por derecho propio, y el pronóstico es sensible a esa elección.
Esta es la realidad de ingeniería detrás de las matemáticas, y es un territorio reconociblemente de DSTI: el lugar donde la memoria, el costo de cómputo y un presupuesto de tiempo estricto deciden qué método es admisible. Es también la razón por la que representar la estructura conocida no es una preferencia de estilo sino una eficiencia: un método más pequeño y estructurado puede significar menos movimiento de datos, menos entrenamiento, una consistencia física más fuerte y una explicación más clara de las fallas que un sistema de aprendizaje genérico más grande. La disciplina consiste en mantener la frontera inspeccionable: saber qué parte del sistema se impone desde la física y qué parte se aprende a partir de los datos.
No obligues al sistema de aprendizaje a redescubrir lo que el dominio ya sabe.
Cuando existan leyes físicas, restricciones, taxonomías o relaciones confiables, represéntalas. Usa el aprendizaje basado en datos para la incertidumbre residual, los parámetros desconocidos, las escalas no resueltas y los patrones que el modelo explícito no puede aportar. La inteligencia está en la combinación.
Las leyes de conservación, las ecuaciones diferenciales, las restricciones causales y el conocimiento del dominio son información. Descartarlos no es neutralidad: es una decisión de diseño.
Los datos son invaluables cuando los parámetros son inciertos, los modelos están incompletos, los efectos submalla no se resuelven o los patrones no pueden especificarse analíticamente.
El trabajo difícil consiste en decidir cómo interactúan el error del modelo, el error de observación y los componentes aprendidos, y en validar el sistema resultante.
Asimilación de datos
Combinar un modelo dinámico con observaciones para que el estado reconstruido respete tanto la evidencia como las leyes que gobiernan la evolución.
Web semántica
Representar de manera explícita las entidades y relaciones conocidas, en vez de pedir que cada sistema posterior las infiera una y otra vez a partir de datos no estructurados.
Ese principio resuena en otra parte del plan de estudios —en la enseñanza de las tecnologías de la Web semántica por Pr Fabien Gandon, el mismo instinto aplicado al conocimiento en lugar de a la física: representar de manera explícita lo que ya se conoce, en vez de volver a aprender sistemáticamente el modelo entero a partir de datos crudos—. La disciplina compartida es saber lo que sabes, aprender lo que no sabes y hacer de la frontera entre ambos algo que puedas inspeccionar.
08 La trayectoria de investigación detrás de las clases
El artículo se apoya en una secuencia de publicaciones que recorre el trabajo desde la introducción de un algoritmo y la demostración de su convergencia hasta la comparación numérica, el desarrollo teórico y las aplicaciones geofísicas.
La nota fundacional; introduce la BFN y demuestra la convergencia para un sistema lineal de EDO.
Desarrollo más completo y estudio numérico para la asimilación oceanográfica.
La extensión DBFN para la difusión en la integración hacia atrás.
Pruebas en modelos de aguas someras y modelos oceánicos completos, incluido el comportamiento ante ruido en las observaciones.
Fundamentos: problemas inversos, control óptimo, asimilación de datos
- Hadamard, J. (1902). Sur les problèmes aux dérivées partielles et leur signification physique. — La definición original del carácter bien planteado.
- Lions, J.-L. (1971). Optimal Control of Systems Governed by Partial Differential Equations. Springer. — La teoría del control óptimo que subyace a la asimilación variacional de datos.
- Kalnay, E. (2003). Atmospheric Modeling, Data Assimilation and Predictability. Cambridge University Press. — Texto de referencia; en la lista de lecturas del curso.
- Evensen, G. (2006). Data Assimilation: The Ensemble Kalman Filter. Springer. — Texto de referencia; en la lista de lecturas del curso.
- Bennett, A. F. (2002). Inverse Modeling of the Ocean and Atmosphere. Cambridge University Press. — En la lista de lecturas del curso.
- Auroux, D. (2003). Étude de différentes méthodes d’assimilation de données pour l’environnement. Tesis doctoral, Université de Nice-Sophia Antipolis (bajo la dirección de Jacques Blum).
Los profesores
- Pr Jacques Blum — Página universitaria · Biografía
- Pr Didier Auroux — Página universitaria · Publicaciones · Maison de la Modélisation, de la Simulation et des Interactions
El contenido de los §§01–07 que describe la estructura, el alcance y el contenido trabajado de los cursos (el encuadre y los ejemplos de problemas inversos, el tratamiento del carácter bien planteado de Hadamard y la inestabilidad de la derivación, las funciones de costo 3D/4D-Var y el método del adjunto, la advertencia “discretizar frente a diferenciar”, las cifras de escala y las restricciones operativas, la taxonomía de métodos, y los laboratorios de experimento gemelo de Lorenz que implementan nudging, 4D-Var y Kalman con una verificación del gradiente) proviene de los propios materiales de curso de DSTI de los profesores Blum y Auroux —los temarios, las notas de clase y los cuadernos del estudiantado de Applied Mathematics for Data Science, Continuous Optimisation, e Inverse Problems & Data Assimilation— y no de citas públicas, salvo donde se enlaza una fuente pública en el texto.
Para cerrar: la idea que el estudiantado debe retener
La inteligencia artificial no es una sola clase de modelos. Es la construcción disciplinada de sistemas que infieren, optimizan y actúan bajo incertidumbre. A veces los datos deben aprender el modelo. A veces los datos deben corregir un modelo que ya codifica física real. Saber distinguir la diferencia —y poder defender la elección con una función de costo, una covarianza de error, un argumento de convergencia y una explicación honesta de lo que se supuso— forma parte de formarse como profesional de la ingeniería que comprende los fundamentos científicos y no solo las herramientas.
Es apropiado que el curso exista dentro de una cadena que empieza con el gradiente de una sola función y termina en una frontera de la investigación, impartida por dos matemáticos que aprendieron el campo de quien fundó en buena medida su mitad ligada a la teoría del control. Esa es la versión de la pericia que DSTI procura enseñar: no la confianza para ejecutar una simulación, sino el criterio para saber cuánto vale una reconstrucción.