De un número a un sistema: cómo se monitoriza una epidemia con datos abiertos

De un número a un sistema: cómo se monitoriza una epidemia con datos abiertos

Juan Marcelo Gutierrez M.

De un número a un sistema: cómo se monitoriza una epidemia con datos abiertos

Juan Marcelo Gutierrez M. | TodoEconometria

Hace un tiempo publiqué en este blog una estimación del número de reproducción (R₀) del COVID-19 en Bolivia: cuántas personas contagiaba, en promedio, cada caso (ver el artículo). Ese número responde a una pregunta —¿a qué velocidad crece?— pero no a la que viene después: ¿cómo se vigila la evolución, día a día, durante tres años?

Esa segunda pregunta no se responde con un indicador, sino con un sistema. Este artículo es la retrospectiva de cómo se construyó: qué se midió, con qué técnicas y qué deja ver que una tabla de casos no muestra. Al final está la aplicación, para que la explore usted mismo.

Alcance. Datos diarios de casos, decesos y recuperados por país (Johns Hopkins CSSE, ene-2020 a mar-2023). El foco es la monitorización descriptiva y comparada, no la inferencia causal de políticas sanitarias.


1. Por qué un panel y no un informe

Un informe estático envejece el día que se publica. Una epidemia es una serie temporal que cambia a diario, en decenas de países a la vez. Vigilarla exige tres cosas que un PDF no da: actualización, comparación y exploración. De ahí un panel interactivo: el dato manda, y quien analiza decide qué mirar.

2. Agrupar trayectorias, no países

La pregunta interesante no es "¿qué país tiene más casos?" sino "¿qué países se comportan igual a lo largo del tiempo?". Dos curvas pueden parecerse aunque estén desfasadas semanas: el pico llega antes en uno que en otro.

Para eso se usa agrupamiento con Dynamic Time Warping (DTW), que compara la forma de dos series permitiendo estiramientos en el tiempo, en lugar de exigir que coincidan punto a punto. Así, dos olas con la misma silueta pero distinto calendario quedan en el mismo grupo.

Fundamento. DTW alinea series temporales de longitud o fase distinta minimizando la distancia acumulada del mejor emparejamiento (Berndt & Clifford, 1994). El agrupamiento se implementó con el paquete dtwclust (Sardá-Espinosa, 2019). Es la técnica estándar cuando importa el patrón temporal y no el nivel absoluto.

El resultado: clústeres de países con dinámicas comparables —útiles para anticipar, mirando a quien va por delante, lo que puede venir después.

3. Ver los flujos, no solo los totales

Un número agregado esconde su composición. El panel incluye representaciones de flujo y jerarquía —diagramas de Sankey y de cuerda (Chord), árboles colapsables— que muestran cómo se reparte y conecta el total entre categorías y regiones. Se construyeron con networkD3 y chorddiag. No son adorno: hacen visible de un vistazo una estructura que en una tabla exigiría leer cien filas.

4. Anticipar, con la cautela declarada

Sobre cada serie se ofrece un pronóstico de corto plazo mediante suavizado exponencial (familia ETS), que modela nivel, tendencia y estacionalidad de forma transparente y reproducible.

Fundamento. Los modelos ETS y su selección automática por criterios de información están descritos en Hyndman & Athanasopoulos (Forecasting: Principles and Practice, 3.ª ed., 2021). Un pronóstico epidemiológico es orientativo: su validez cae cuando cambian las condiciones (nuevas variantes, medidas, cobertura de test). El panel lo presenta como tal, no como certeza.

5. Reproducible y desplegado

El panel no vive en una sola máquina: es reproducible (entorno fijado) y está contenedorizado con Docker, desplegado en Hugging Face Spaces e integrado en esta web. Pasar de un análisis a un servicio que cualquiera puede abrir en el navegador es parte del trabajo, no un extra.


Pruébelo

La aplicación está en línea. Elija países, compare trayectorias, mire los clústeres y los flujos:

👉 Abrir CoronaDash Bolivia

Y si lo que ve le sugiere un panel parecido para sus datos —ventas, salud, operaciones, lo que vigile a diario—, eso es exactamente lo que construyo.


Referencias

Datos:

  • Dong, E., Du, H., & Gardner, L. (2020). An interactive web-based dashboard to track COVID-19 in real time. The Lancet Infectious Diseases (Johns Hopkins CSSE).

Métodos:

  • Berndt, D. J., & Clifford, J. (1994). Using dynamic time warping to find patterns in time series. AAAI Workshop on Knowledge Discovery in Databases.
  • Sardá-Espinosa, A. (2019). Time-series clustering in R using the dtwclust package. The R Journal, 11(1).
  • Hyndman, R. J., & Athanasopoulos, G. (2021). Forecasting: Principles and Practice (3.ª ed.). OTexts.
  • Cori, A., Ferguson, N. M., Fraser, C., & Cauchemez, S. (2013). A new framework and software to estimate time-varying reproduction numbers during epidemics. American Journal of Epidemiology, 178(9).

Reproducibilidad

La aplicación es código R + Docker, desplegada en Hugging Face Spaces.

Cita: Juan Marcelo Gutierrez M. | TodoEconometria · Datos: Johns Hopkins CSSE

🚀Comparte este artículo

Math Chaos Texture

¿Necesitas resolver algo parecido?

Modelización cuantitativa, validación de modelos y data leadership. Trabajo bajo NDA si lo pides.

Háblame de tu proyecto →