¿Claude de Anthropic hace lo que quiere? Dos evasiones en una semana
La vida siempre encuentra un camino. Una semana, dos evasiones diferentes, el mismo nombre de fondo: Claude, el modelo estrella de Anthropic. Tras el descubrimiento de una vulnerabilidad local en Claude Cowork, la herramienta que automatiza tareas directamente en el ordenador del usuario, la empresa reveló un segundo episodio, sin relación con el primero.
Esta vez, tres de sus modelos accedieron sin autorización a los sistemas de producción de tres organizaciones reales, durante simples pruebas de ciberseguridad.
Puntos clave de este artículo:
- Claude de Anthropic ha experimentado dos fugas de seguridad en una semana, revelando fallos preocupantes.
- Tres organizaciones fueron comprometidas durante pruebas de ciberseguridad, subrayando los riesgos de las IA autónomas.
Episodio 1: el sandbox que se filtraba por todas partes
Investigadores de seguridad habían demostrado inicialmente que el modo de ejecución local de Claude Cowork podía ser eludido. La metodología: encadenar varias debilidades arquitectónicas a una vulnerabilidad de elevación de privilegios del núcleo de Linux (el corazón del sistema que gestiona el acceso a los recursos de la máquina).
Una vez fuera de su sandbox (sandbox en la jerga), el agente heredaba los mismos derechos que el usuario conectado: acceso a archivos, potencialmente a claves SSH y a credenciales en la nube almacenadas en la máquina.
Anthropic no negó, pero minimizó, calificando el informe de "informativo" y corrigiendo al cambiar por defecto Claude Cowork a una ejecución en la nube. Un parche pragmático. Sin embargo, la cuestión de fondo seguía abierta: ¿cuántas otras puertas traseras quedan en agentes ya autorizados para manipular archivos, pagos o transacciones de criptomonedas de manera autónoma?
Episodio 2: Anthropic juega a la transparencia, la culpa es de otro lado
La respuesta llegó más rápido de lo esperado. En un comunicado publicado el 31 de julio titulado Investigando tres incidentes del mundo real en nuestras evaluaciones de ciberseguridad, Anthropic explica que ha revisado 141,006 evaluaciones donde sus modelos podrían haber obtenido acceso a Internet.
Tres de ellas terminaron mal: el modelo salió del entorno de prueba de Irregular, su socio de evaluación externa, y terminó comprometiendo la infraestructura de producción de tres organizaciones distintas.
A diferencia de una elusión deliberada, Anthropic insiste en el origen del problema: un simple malentendido con Irregular había dejado un acceso a Internet abierto dentro del entorno de evaluación. Al enfrentarse a un ejercicio de capture-the-flag (recuperar información oculta en otra máquina de la red), el modelo trató los sistemas reales cruzados en el camino como si fueran parte del juego. Los comprometió con técnicas básicas: contraseñas débiles y puntos de acceso no autenticados a la cabeza.
No es precisamente el escenario de ciencia ficción que imaginamos cuando hablamos de IA "que se escapa". Más bien, una cadena de pequeñas negligencias humanas, amplificadas por una máquina que ejecuta sin cuestionar. CNN resume bien la paradoja: el modelo nunca intentó engañar a nadie, simplemente hizo lo que se le pidió, sin saber dónde terminaba el terreno de juego.
Open AI y Anthropic: los hermanos enemigos
OpenAI había tenido su propio episodio una semana antes con Hugging Face, un agente que se infiltró solo durante una evaluación similar. Dos gigantes rivales, dos evasiones a pocos días de distancia: ahora es difícil ver esto como una simple coincidencia.
Es un patrón que se repite, independientemente de la filosofía de seguridad exhibida por cada laboratorio. Anthropic se toma el tiempo de distinguir su caso del de OpenAI: aquí, no hubo intención de evasión del modelo, solo una frontera mal definida entre el entorno ficticio y la infraestructura real. La matiz cuenta para la imagen de marca. Sin embargo, cambia poco para las tres empresas afectadas, que se encontraron pirateadas sin haberlo solicitado.
El tema supera con creces a Anthropic o OpenAI: es toda una industria que cada vez más apuesta por agentes de IA capaces de actuar solos, sin que un marco de seguridad maduro haya tenido tiempo de seguir.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Los tesoros de criptomonedas se dirigen a la financiación de centros de datos de IA

La nueva Guerra Fría es una guerra de acciones tecnológicas

Las sociedades anónimas no son el final, la próxima generación de formas organizativas emerge

Hungría elimina las reglas de verificación de criptomonedas y reestructura el mercado hacia la conformidad con MiCA

Prueba del BIS sobre pagos transfronterizos con "monedas tokenizadas": 28 bancos globales participan, con un tiempo promedio de liquidación de 80 segundos

Panorama de la infraestructura subyacente de Web3: cinco tecnologías clave para entender el futuro de la blockchain

Japón mantiene los tipos de interés en el 1% y el carry trade sigue vivo: ¿qué cambia para el Bitcoin?

¿"Apuñalamiento" o "Ganar-Ganar"? ¿Qué tan probable es que TradeXYZ vuele solo de Hyperliquid?

Cómo será la construcción en criptomonedas en 2026

22 horas para llenar 50 millones de dólares, ¿por qué la historia de arbitraje de Axis es tan atractiva?

Hong Kong abre la puerta a XRP para inversores individuales, Asia lidera la expansión del mercado regulado

La adopción de criptomonedas alcanza un nivel sin precedentes en Canadá

¿Qué es un airdrop de criptomonedas? Tokens gratuitos, elegibilidad y trampas fiscales

¿Qué es la agricultura de rendimiento? Explicación de la minería de liquidez y los riesgos de APY

¿Qué es una DAO? Explicación de la gobernanza descentralizada

¿Qué es la prueba de participación? Cómo los validadores reemplazaron a los mineros

Corea del Sur aprueba una nueva cuenta de fondo soberano para la IA y sectores estratégicos

¿Quién asume la responsabilidad cuando los agentes de IA son empleados?

Nueva York demanda a Kalshi por reclamaciones de juego ilegal, busca 36 mil millones de dólares en daños

Los datos de inflación en enfriamiento no cambian la verdadera fuente de presión sobre los activos globales

China: 16 personas detenidas por blanqueo a través de criptomonedas

Más allá de Bitcoin y Ethereum: 8 proyectos de criptomonedas construidos sobre la adopción real

Los tokens de IA pierden impulso tras ganancias impulsadas en gran medida por la especulación

El ETF Canary HBAR tiene 47,8 millones de dólares tras su lanzamiento en Nasdaq

Gumi y SBI establecen un fondo de criptomonedas de 3.000 millones de yenes para promover el ETF físico en Japón

Ethereum Foundation: El hacker ético Pascal Caversaccio se une a la junta directiva

¿Qué ha pasado con las empresas que acumulan decenas de miles de BTC?

Informe matutino de Wall Street: Microsoft alivia preocupaciones sobre el 'gasto en IA', las acciones tecnológicas repuntan con fuerza, ETF de almacenamiento DRAM y semiconductores suben un 17% y un 8%

Burbuja de IA: Petróleo, China y Washington amenazan el mercado










