OpenAI presenta GPT-Red, una IA que ataca sus propios modelos para reforzarlos
OpenAI presentó el miércoles 15 de julio de 2026 una herramienta de red-teaming automatizada llamada GPT-Red, encargada de fortalecer la resistencia de GPT-5.6 a los ataques por inyección de prompt. El concepto parte de una constatación simple: los métodos humanos de prueba de intrusión ya no siguen el ritmo de las capacidades de los modelos. El desafío ahora es mayor, ya que estas vulnerabilidades afectan directamente la seguridad de los agentes autónomos.
En resumen
- GPT-Red logró el 84 % de los escenarios de evaluación internos de inyección de prompt, frente al 13 % de los equipos rojos humanos.
- OpenAI entrenó a GPT-Red mediante aprendizaje por refuerzo en auto-confrontación para endurecer GPT-5.6 antes de su despliegue.
- La Fundación Ethereum también desplegó agentes de IA para auditar su infraestructura de red crítica en julio de 2026.
GPT-Red se basa en esta lógica de seguridad ofensiva automatizada. GPT-Red recibe su nombre del "red teaming", esta práctica de ciberseguridad que consiste en intentar romper un sistema de manera voluntaria para identificar sus debilidades antes de que un atacante las explote.
OpenAI explica que el modelo fue entrenado mediante aprendizaje por refuerzo en auto-confrontación (self-play). Genera ataques por inyección de prompt cada vez más sofisticados, mientras que los modelos defensores aprenden a resistirlos. Cada asalto exitoso alimenta luego el entrenamiento de GPT-5.6, que se vuelve más robusto incluso antes de su implementación.
En un caso de estudio citado por OpenAI, el sistema manipuló un agente autónomo que gestionaba un dispensador automático, llevándolo a bajar los precios, a ordenar existencias a precios reducidos y a cancelar el pedido de otro cliente.
La vulnerabilidad fue reportada y corregida antes de cualquier explotación real. El ejemplo muestra cuán poderosa puede ser una inyección de prompt para transformar un asistente en un instrumento desviado, sin que el usuario se dé cuenta.
La cifra que impacta en el anuncio de OpenAI es la diferencia de rendimiento medida internamente. En los mismos escenarios de evaluación, GPT-Red logró el 84 % de los ataques por inyección de prompt, frente al 13 % de los equipos rojos humanos.
OpenAI justifica esta automatización en un mensaje publicado en X. "A medida que las capacidades de los modelos aumentan, la seguridad y el alineamiento deben evolucionar al mismo ritmo", escribe la empresa.
El modelo funciona mediante auto-confrontación adversarial, precisa OpenAI. "GPT-Red aprende mediante auto-confrontación adversarial, su objetivo es inyectar prompts en una variedad de modelos defensores difíciles", detalla la empresa.
El ciclo se alimenta a sí mismo, y eso es precisamente lo que los investigadores buscaban: un motor de mejora continua en lugar de una campaña de pruebas puntual.
GPT-Red prolonga varios años de esfuerzos de ciberseguridad lanzados por OpenAI tras el éxito público de ChatGPT. La empresa creó en 2023 su OpenAI Red Teaming Network, reclutando investigadores externos para examinar sus modelos en busca de vulnerabilidades antes de su publicación.
El paso al modelo automatizado marca un cambio de enfoque, ya que una IA produce ataques a una escala inalcanzable para los humanos solos.
Este anuncio se inscribe en un movimiento más amplio: el de la IA que asegura a la IA. A principios de julio de 2026, la Fundación Ethereum indicó haber desplegado agentes de IA para auditar su infraestructura de red crítica, descubriendo una vulnerabilidad en un software utilizado por sus clientes de consenso.
OpenAI mantiene a GPT-Red bajo llave, pero lo ve como un círculo virtuoso.
OpenAI conserva a GPT-Red como una herramienta puramente interna. El modelo contiene capacidades ofensivas desarrolladas intencionadamente, lo que excluye cualquier difusión pública. Sin embargo, la empresa lo ve como el inicio de un círculo virtuoso.
"Creemos que con GPT-Red hemos comenzado a desbloquear un efecto de entrenamiento similar para la seguridad, donde los modelos de hoy ayudan a hacer que los modelos de mañana sean más robustos, alineados y dignos de confianza", concluye.
En resumen, OpenAI ha convertido el ataque automatizado en un escudo para GPT-5.6, con una diferencia de rendimiento que impone respeto: 84 % de éxito para GPT-Red frente al 13 % para los humanos. Este cambio hacia una IA que asegura a otra IA redefine la postura de seguridad de la industria, desde laboratorios hasta blockchains.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Tax Star recauda 1,75 millones de dólares y busca expandirse en el Golfo

La actualización de Bitchat para Android se encuentra estancada en la revisión de Google Play

Modelos intercambiables y herramientas plug-and-play: DeepSeek lleva la competencia de agentes del "cerebro" al "sistema operativo"

Apple propone un 15% de comisión por pagos externos

Filtración de datos en Trezor, límite de ₽300 mil para no cualificados

BAXUS se une a la tienda de aplicaciones móviles de Solana
![[Exclusiva] Los intercambios de criptomonedas en el extranjero no se pueden buscar en el país... 65 en Google y 56 en Apple](/public-static/22_d448f7b258.png?format=avif)
[Exclusiva] Los intercambios de criptomonedas en el extranjero no se pueden buscar en el país... 65 en Google y 56 en Apple

Apple introduce Block Blast sin anuncios en Apple Arcade

Cobi recauda un millón de dólares liderado por Lunara Partners

Proof of Play cierra, desarrollador de juegos Web3 fundado por Amitt Mahajan

Irán advierte a EE. UU. sobre el acceso limitado al estrecho; filial de SK Hynix busca financiación para IPO

Proof of Play cesa operaciones, código y activos artísticos de Pirate Nation de código abierto

Bitget finaliza sus servicios en Japón con restricciones progresivas

Un invento de bolsillo dos en uno: el altavoz Bluetooth que también te permite crear tu propia música

Tecnópolis: Un Gigante del Entretenimiento Se Une a la Licitación de la Concesión del Sitio

La aplicación de Binance retirada de la Play Store en Francia y España

BAX, la aplicación de IA de CABA, supera las 110,000 descargas

Fish Audio completa una ronda de financiación inicial de 50 millones de dólares

El stablecoin único "WEMIX Dollar" de WEMIX sufre daños por la toma de control del contrato inteligente—emisión y fuga no autorizadas

El videoanalista de la Selección española se refirió a la final del Mundial 2026: "España fue muy superior"

PlayStation: La decisión de abandonar el soporte físico amenaza un negocio de 7.200 millones de dólares

La aplicación de Binance se retira de Google Play en algunos países de la UE

El malware SparkKitty escanea fotos móviles en busca de frases semilla de billeteras criptográficas

29 intercambios de criptomonedas en el extranjero eliminados de la tienda Google Play de Corea del Sur

Messi invierte en World Labs fundado por Fei-Fei Li

Cashea completa una financiación de 100 millones de dólares, con FinSight Ventures liderando la ronda B

Bit-Play lanza oficialmente su plataforma de intercambio descentralizada

Copa del Mundo 2026: Los mercados predictivos registran 5,57 mil millones de dólares en intercambios antes de la final

El futuro de los mercados de predicción y el mercado japonés, el CEO de Limitless habla sobre el diseño del sistema|WebX2026









