
De un número a un sistema: cómo se monitoriza una epidemia con datos abiertos
De un número a un sistema: cómo se monitoriza una epidemia con datos abiertos
Juan Marcelo Gutierrez M. | TodoEconometria
Hace un tiempo publiqué en este blog una estimación del número de reproducción (R₀) del COVID-19 en Bolivia: cuántas personas contagiaba, en promedio, cada caso (ver el artículo). Ese número responde a una pregunta —¿a qué velocidad crece?— pero no a la que viene después: ¿cómo se vigila la evolución, día a día, durante tres años?
Esa segunda pregunta no se responde con un indicador, sino con un sistema. Este artículo es la retrospectiva de cómo se construyó: qué se midió, con qué técnicas y qué deja ver que una tabla de casos no muestra. Al final está la aplicación, para que la explore usted mismo.
Alcance. Datos diarios de casos, decesos y recuperados por país (Johns Hopkins CSSE, ene-2020 a mar-2023). El foco es la monitorización descriptiva y comparada, no la inferencia causal de políticas sanitarias.
1. Por qué un panel y no un informe
Un informe estático envejece el día que se publica. Una epidemia es una serie temporal que cambia a diario, en decenas de países a la vez. Vigilarla exige tres cosas que un PDF no da: actualización, comparación y exploración. De ahí un panel interactivo: el dato manda, y quien analiza decide qué mirar.
2. Agrupar trayectorias, no países
La pregunta interesante no es "¿qué país tiene más casos?" sino "¿qué países se comportan igual a lo largo del tiempo?". Dos curvas pueden parecerse aunque estén desfasadas semanas: el pico llega antes en uno que en otro.
Para eso se usa agrupamiento con Dynamic Time Warping (DTW), que compara la forma de dos series permitiendo estiramientos en el tiempo, en lugar de exigir que coincidan punto a punto. Así, dos olas con la misma silueta pero distinto calendario quedan en el mismo grupo.
Fundamento. DTW alinea series temporales de longitud o fase distinta minimizando la distancia acumulada del mejor emparejamiento (Berndt & Clifford, 1994). El agrupamiento se implementó con el paquete
dtwclust(Sardá-Espinosa, 2019). Es la técnica estándar cuando importa el patrón temporal y no el nivel absoluto.
El resultado: clústeres de países con dinámicas comparables —útiles para anticipar, mirando a quien va por delante, lo que puede venir después.
3. Ver los flujos, no solo los totales
Un número agregado esconde su composición. El panel incluye representaciones de
flujo y jerarquía —diagramas de Sankey y de cuerda (Chord), árboles
colapsables— que muestran cómo se reparte y conecta el total entre categorías y
regiones. Se construyeron con networkD3 y chorddiag. No son adorno: hacen
visible de un vistazo una estructura que en una tabla exigiría leer cien filas.
4. Anticipar, con la cautela declarada
Sobre cada serie se ofrece un pronóstico de corto plazo mediante suavizado exponencial (familia ETS), que modela nivel, tendencia y estacionalidad de forma transparente y reproducible.
Fundamento. Los modelos ETS y su selección automática por criterios de información están descritos en Hyndman & Athanasopoulos (Forecasting: Principles and Practice, 3.ª ed., 2021). Un pronóstico epidemiológico es orientativo: su validez cae cuando cambian las condiciones (nuevas variantes, medidas, cobertura de test). El panel lo presenta como tal, no como certeza.
5. Reproducible y desplegado
El panel no vive en una sola máquina: es reproducible (entorno fijado) y está contenedorizado con Docker, desplegado en Hugging Face Spaces e integrado en esta web. Pasar de un análisis a un servicio que cualquiera puede abrir en el navegador es parte del trabajo, no un extra.
Pruébelo
La aplicación está en línea. Elija países, compare trayectorias, mire los clústeres y los flujos:
Y si lo que ve le sugiere un panel parecido para sus datos —ventas, salud, operaciones, lo que vigile a diario—, eso es exactamente lo que construyo.
Referencias
Datos:
- Dong, E., Du, H., & Gardner, L. (2020). An interactive web-based dashboard to track COVID-19 in real time. The Lancet Infectious Diseases (Johns Hopkins CSSE).
Métodos:
- Berndt, D. J., & Clifford, J. (1994). Using dynamic time warping to find patterns in time series. AAAI Workshop on Knowledge Discovery in Databases.
- Sardá-Espinosa, A. (2019). Time-series clustering in R using the dtwclust package. The R Journal, 11(1).
- Hyndman, R. J., & Athanasopoulos, G. (2021). Forecasting: Principles and Practice (3.ª ed.). OTexts.
- Cori, A., Ferguson, N. M., Fraser, C., & Cauchemez, S. (2013). A new framework and software to estimate time-varying reproduction numbers during epidemics. American Journal of Epidemiology, 178(9).
Reproducibilidad
La aplicación es código R + Docker, desplegada en Hugging Face Spaces.
Cita: Juan Marcelo Gutierrez M. | TodoEconometria · Datos: Johns Hopkins CSSE

¿Necesitas resolver algo parecido?
Modelización cuantitativa, validación de modelos y data leadership. Trabajo bajo NDA si lo pides.
Háblame de tu proyecto →