Coinbase analiza la interrupción de mayo: un fallo en cascada de AWS revela riesgos arquitectónicos

By: www.chaincatcher.com|2026/06/01 13:42:00

Coinbase publicó un informe retrospectivo sobre la interrupción del servicio a gran escala ocurrida el 7 de mayo de 2026.

La caída duró aproximadamente 8 horas y la recuperación total llevó unas 12 horas. Durante este tiempo, las operaciones de trading, depósitos, retiros y la mayoría de los servicios principales estuvieron inactivos o gravemente afectados. Coinbase declaró que la interrupción fue causada por el fallo simultáneo de varias unidades de refrigeración en un centro de datos dentro de una zona de disponibilidad (use1-az4) en la región us-east-1 de AWS, lo que activó los sistemas de protección térmica de los armarios. Esto provocó que las instancias EC2 y los volúmenes EBS quedaran fuera de servicio, afectando a múltiples servicios de internet.

Durante el proceso de recuperación, el motor de emparejamiento de trading de Coinbase perdió el quórum debido a que la arquitectura de clúster desplegada en un único centro de datos de AWS perdió la mayoría de sus nodos. Fue necesario realizar ajustes urgentes en el código y reconstruir un nuevo grupo de nodos para restaurar la operación, reiniciando gradualmente el trading de mercado durante la recuperación.

Además, el servicio Kafka gestionado por AWS (MSK) experimentó fallos en el plano de control, lo que impidió la reelección automática de los líderes de partición, bloqueando aún más las cotizaciones, las comisiones y algunos sistemas de liquidación y flujo de datos, lo que amplificó el impacto general.

Tras la migración manual de particiones en colaboración con el equipo de ingeniería de AWS, el sistema volvió gradualmente a la normalidad. Coinbase declaró que este incidente puso de manifiesto sus carencias en las capacidades de conmutación automática entre zonas de disponibilidad y en la recuperación ante desastres para middleware gestionado. La empresa actualizará su arquitectura de respaldo en caliente entre regiones, reforzará los simulacros de fallo periódicos y migrará el sistema Kafka de un despliegue en dos zonas de disponibilidad a uno en tres, además de trabajar con AWS para avanzar en las soluciones y mejoras de la causa raíz.

Precio de --

--
--
--

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:[email protected]
Programa VIP:[email protected]