Anatomía de un incidente de latencia con rate limiting, timeouts, workers saturados, jobs batch y falta de aislamiento operativo.

Problema #

Un flujo crítico de búsqueda empezó a presentar latencias altas, errores intermitentes y respuestas inconsistentes. La primera hipótesis era aumentar infraestructura.

Señales #

Hallazgo #

El diseño no aislaba suficientemente flujos de diferente costo ni limitaba el radio de impacto de una dependencia lenta, cliente pesado o job batch.

Lección #

No todo incidente de latencia se resuelve agregando infraestructura. A veces la prioridad es observabilidad, aislamiento, límites de concurrencia, deadlines y circuit breakers.