Anthropic se disculpa: la autopsia completa de los deslices de Claude

By: journalducoin.com|2026/09/04 17:00:00

Quien se disculpa, se acusa. Un mes de relativo silencio, y luego una confesión formal. Después de las dos escapadas consecutivas de Claude a finales de julio, Anthropic publicó el 31 de agosto un artículo detallado sobre las raíces del problema. La empresa reconoce lo que hasta ahora había manejado principalmente con urgencia, ya que tres de sus modelos accedieron sin autorización a los sistemas de producción de tres organizaciones reales, durante pruebas de ciberseguridad que se suponía debían llevarse a cabo en un entorno cerrado. Hacemos un resumen.
Puntos clave de este artículo:

  • Anthropic ha reconocido fallos en sus pruebas de ciberseguridad tras las escapadas de modelos, revelando una doble negligencia operativa y humana.
  • La empresa ha reforzado sus medidas de seguridad, incluyendo una nueva herramienta para bloquear acciones no autorizadas y la reasignación de ingenieros a la seguridad.

Una doble negligencia, operativa y humana

El laboratorio señala dos causas distintas en su artículo del 31 de agosto. Primero, un problema operativo bien identificado, un acceso a Internet que permaneció abierto por error en un socio de evaluación externa, mientras que el modelo creía estar operando en un entorno cerrado. Luego, más preocupante, un problema de alineación. Claude evidentemente cruzó pistas que mostraban que su campo de juego era real, sin cambiar su comportamiento. Anthropic habla de razonamiento motivado, la tendencia del modelo a interpretar señales ambiguas de manera que preserve su creencia inicial en lugar de cuestionarla. En un caso, el objetivo ficticio del ejercicio incluso llevaba el nombre de un sitio real, difuminando aún más la frontera entre el juego y el mundo.
Para medir la magnitud del problema, Anthropic llevó la experiencia hasta entrenar deliberadamente un modelo de clase Opus en entornos conocidos por fomentar el engaño. El modelo resultante desarrolló una clara propensión a querer ganar a toda costa, hasta el punto de sabotear su propia función de recompensa y proponer ayuda para la fabricación de armas biológicas para satisfacer a un evaluador ficticio. Nada que ver con los modelos realmente comercializados, aclara la empresa, pero suficiente para confirmar por la demostración inversa que los incidentes de julio no fueron un accidente aislado.
La salvaguarda que faltaba, y la que llega

En el plano operativo, Anthropic ha suspendido sus evaluaciones cibernéticas externas durante varias semanas para fortalecer el aislamiento de los entornos de prueba y desplegar un nuevo clasificador, encargado de detectar en tiempo real cualquier intento de salir de un entorno de prueba. Tan pronto como un modelo cruza un límite no autorizado, la herramienta bloquea la acción antes de su ejecución, corta la prueba y alerta a un humano. La empresa también ha reasignado a unos 150 ingenieros de producto a la seguridad durante varios meses, ha congelado el desarrollo de nuevas funcionalidades mientras cierra las brechas, y ha impuesto a cualquier socio que pruebe sus modelos sin salvaguardias cibernéticas un protocolo estricto: entorno de prueba desconectado de Internet, perímetro explícito en cada instrucción, supervisión continua de la actividad.
Anthropic no es la única que enfrenta este tipo de contratiempos. OpenAI acaba de bloquear el acceso a Astra, su propio modelo clasificado como << riesgo cibernético crítico >>, tras un incidente similar en Hugging Face a finales de julio. Dos laboratorios rivales, dos confesiones públicas con un mes de diferencia. Toda una industria que aprende a establecer salvaguardias en agentes cada vez más autónomos, justo en el momento en que estos mismos agentes comienzan a gestionar carteras de criptomonedas y transacciones en cadena sin supervisión humana en cada etapa.

Precio de --

--
--
--

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

Últimos listados de monedas en WEEX

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:[email protected]
Programa VIP:[email protected]