Microsoft afirma que MDASH supera a Claude Mythos y GPT-5.6 Sol en prueba de ciberseguridad

By: rootdata|2026/07/27 19:01:04

Microsoft ha lanzado su primer modelo dedicado a la ciberseguridad llamado MAI-Cyber-1-Flash y lo ha integrado en MDASH, un sistema de búsqueda de vulnerabilidades que, según la empresa, supera a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI, mientras cuesta un 50% menos que la mejor configuración actual de MDASH de Microsoft.

La configuración combinada obtuvo un 95.95% en CyberGym, según Microsoft. CyberGym es un estándar que pide a los agentes de IA reproducir 1,507 vulnerabilidades conocidas en 188 proyectos de código abierto, y luego los puntúa según el porcentaje que se reprodujo con éxito en un entorno controlado.

Esto coloca a MDASH por delante de GPT-5.5 Cyber con un 85.6%, Mythos 5 con un 83.8%, GPT-5.6 Sol con un 83.6% y Gemini 3.5 Flash Cyber con un 83.2%. El resultado es autoinformado por Microsoft y no había aparecido en la tabla de clasificación pública de CyberGym en el momento de la publicación, aunque el estándar utiliza un conjunto de pruebas público y una métrica de éxito definida.

MAI-Cyber-1-Flash no trabaja solo. Microsoft afirma que maneja hasta el 90% de las tareas, mientras que MDASH dirige el 10% más difícil a GPT-5.4. Esto es importante porque los tokens—los fragmentos de texto que procesa una IA—cuestan dinero cada vez que un modelo lee código o produce una respuesta.

Esta es la primera vez que un modelo de Microsoft diseñado para la eficiencia es capaz de superar a un modelo denso de última generación construido con capacidades generales en mente. "Cuando se combina con MDASH, (MAI-Cyber-1-Flash) ofrece un rendimiento de clase mundial al 50 por ciento del costo de los modelos líderes", escribió el CEO de Microsoft, Satya Nadella.

Un modelo (en este caso MAI-Cyber-1-Flash) es la IA que razona sobre el código. Un arnés (MDASH en este caso) es la maquinaria que lo rodea: los agentes, herramientas, controles y flujos de trabajo que deciden dónde buscar, desafiar hallazgos sospechosos, eliminar duplicados y demostrar que un error puede ser activado.

MDASH utiliza más de 100 agentes especializados asignados a auditar código, debatir si un hallazgo es genuino y construir una prueba de concepto—una demostración funcional de que la falla existe.

Microsoft dijo que los escaneos ocasionales y los parches retrasados están quedando obsoletos a medida que la IA hace que el descubrimiento de errores sea más barato. La empresa argumenta que décadas de datos de seguridad le dan una ventaja, añadiendo: "Nadie puede fabricar esta historia".

Desde el lanzamiento de Claude Mythos, los expertos en ciberseguridad han estado tratando de superar o igualar sus capacidades. Los investigadores reprodujeron la búsqueda de vulnerabilidades al estilo de Mythos con modelos públicos por menos de $30 por escaneo. Dawid Moczadło, uno de los investigadores involucrados, dijo: "la trinchera se está moviendo del acceso al modelo a la validación".

La parte escasa se está convirtiendo en el sistema que prueba hallazgos sin enterrar a los desarrolladores bajo falsas alarmas.

Decrypt también informó que GPT-5.5 Cyber había tomado recientemente la delantera pública de CyberGym con una puntuación del 85.6%, superando por poco a Mythos. La puntuación de Microsoft es aproximadamente 10 puntos superior a la de GPT-5.5 Cyber y 7.5 puntos por encima del resultado anterior de MDASH, pero evalúa el sistema completo en lugar de MAI-Cyber-1-Flash por sí solo.

Microsoft está poniendo MDASH en vista previa privada a través de Microsoft Security Exposure Management en el portal de Defender. Los clientes pueden escanear repositorios de Git, ver hallazgos clasificados de improbable a probado, y usar el CLI de Defender para generar propuestas de correcciones de código para revisión de desarrolladores.

La vista previa actualmente limita los repositorios a aproximadamente 256MB y permite un escaneo concurrente por inquilino. Se espera que Project Perception extienda el mismo enfoque de múltiples agentes más allá del escaneo de código hacia un monitoreo de amenazas más amplio y flujos de trabajo de remediación.

Precio de --

--

Aviso legal: Este contenido se brinda únicamente con fines informativos y de marca, y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Ningún evento, recompensa, evento en línea o información relacionada que se mencione aquí debe considerarse una recomendación, solicitud o invitación para comprar, vender, intercambiar u operar de cualquier otra forma con criptoactivos ni para utilizar ningún servicio. Los criptoactivos son altamente volátiles y pueden generar pérdidas. Los servicios y eventos en línea de WEEX pueden no estar disponibles en todas las regiones y están sujetos a las leyes, regulaciones y requisitos de elegibilidad aplicables. Usted es responsable de asegurarse de que su uso de los servicios de WEEX cumpla con las leyes locales y de evaluar cuidadosamente los riesgos antes de participar en cualquier actividad relacionada con criptomonedas.

Te puede gustar

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:[email protected]
Programa VIP:[email protected]