Cuando declarar un incidente se convierte en el atajo favorito de todos

En ingeniería de software, el proceso de gestión de incidentes se diseñó para responder a emergencias reales, pero con el tiempo tiende a usarse como atajo para todo lo demás. Un gestor declara un Sev-2 para colocar el problema de su equipo al principio de la cola de prioridades de otro; un product

Empirik sale de Sequoia con 21 millones para anticipar caídas de sistemas

Empirik, una startup incubada por Sequoia Capital, anunció este martes su salida como compañía independiente tras cerrar una ronda semilla de 21 millones de dólares con la participación de Sequoia, Canapi y Alumni Ventures. La herramienta utiliza modelos de lenguaje para rastrear cambios en la infra

Una web para filtrar los más de mil incidentes de GitHub desde 2016

La página «Is GitHub Cooked?» es una herramienta independiente que recopila y filtra el historial de incidencias publicadas por GitHub desde marzo de 2016. Su creador la ideó para que cada equipo pudiera acotar la consulta al conjunto de servicios y niveles de gravedad que realmente afectan a los pr

La falsa ilusión de sustituir componentes: lo que revela la caída de GitHub

Un reciente análisis profundiza en uno de los detalles técnicos que rodearon la caída de GitHub del pasado 18 de agosto: la política de autoescalado del servicio afectado. El incidente se originó cuando un pod con un sidecar de Istio alcanzó sus límites de concurrencia y no logró escalar correctamen

Cómo incident.io eliminó Pub/Sub como punto único de fallo

incident.io procesa cada día alrededor de 240 millones de mensajes a través de más de 800 temas de eventos, por lo que su bróker de mensajería se había convertido en un componente crítico. Hasta ahora la compañía dependía exclusivamente de Google Cloud Pub/Sub, un servicio con un SLA del 99,95 % que

Por qué 'no healthy upstream' no siempre señala al origen que crees

Detrás de un error intermitente del tipo 'no healthy upstream' no siempre está la causa que parece más obvia. Este artículo analiza un caso real en un backend de búsqueda donde la explicación inicial apuntaba a la limitación de CPU, pero las pruebas desmontaron esa hipótesis: no había trabajos inten

El pipeline de desarrollo también es un sistema en producción

La cadena que conecta una petición del cliente con su entrega —desde el sistema de tickets, pasando por el IDE, los compiladores, los repositorios de paquetes, las pruebas automáticas, el entorno de QA y las herramientas de integración y despliegue continuo (CI/CD)— debería tratarse como un sistema

«En nuestro lado no ha cambiado nada»: tres incidentes reales de Big Data

Gregory Weintraub, líder de un equipo de Big Data en IBM, relata tres incidentes de producción recientes en los que la frase «en nuestro lado no ha cambiado nada» resultó falsa o insuficiente. En el primer caso, una actualización del framework que escribe eventos en un data lake optimizó la velocida

Metastabilidad en la recuperación: cascadas y bucles en sistemas distribuidos

Una entrada reciente del blog de Andrey Karpenko (Charap.co), titulada “Metastability in Recovery: Cascading Recovery with a Loop”, profundiza en un fenómeno poco tratado en ingeniería de sistemas: las cascadas de recuperación y los bucles de retroalimentación que pueden hacer inviable la recuperaci

La caída de AOL de 1996: una posmortem humana sobre la fragilidad de internet

El 7 de agosto de 1996, America Online sufrió una interrupción de 19 horas que, además de frustrar a millones de usuarios, desplazó de la portada del New York Times la noticia del hallazgo de la NASA sobre posible vida en Marte. El apagón, originado por una tarea de mantenimiento rutinario, habría p

Elastic acuerda la compra de Deductive AI por hasta 85 millones de dólares

Elastic, la empresa de software corporativo conocida por Elasticsearch, ha alcanzado un acuerdo para adquirir Deductive AI, una startup que utiliza inteligencia artificial para detectar y resolver errores en software, por un importe de hasta 85 millones de dólares, según una fuente conocedora de la

La IA exige más disciplina de ingeniería, no menos

La autora, ingeniera de fiabilidad en Honeycomb, sostiene que la inteligencia artificial no relaja los estándares de ingeniería: los desplaza. Partiendo de su experiencia con el paso de servidores artesanales a infraestructura inmutable, argumenta que 2025 invirtió la economía de la producción de có