Anatomía de un incidente de latencia con rate limiting, timeouts, workers saturados, jobs batch y falta de aislamiento operativo.
Problema #
Un flujo crítico de búsqueda empezó a presentar latencias altas, errores intermitentes y respuestas inconsistentes. La primera hipótesis era aumentar infraestructura.
Señales #
- 429 sostenidos.
- Timeouts hacia dependencia interna.
- Saturación de workers de aplicación.
- Jobs batch procesando millones de registros.
- Health checks afectados.
- Recursos compartidos entre flujos de diferente costo.
Hallazgo #
El diseño no aislaba suficientemente flujos de diferente costo ni limitaba el radio de impacto de una dependencia lenta, cliente pesado o job batch.
Lección #
No todo incidente de latencia se resuelve agregando infraestructura. A veces la prioridad es observabilidad, aislamiento, límites de concurrencia, deadlines y circuit breakers.