Paul Miller, un desarrollador que mantiene bibliotecas de criptografía utilizadas en proyectos de Bitcoin y Ethereum, probó 7 agentes de inteligencia artificial (IA) para clasificar y corregir 5 vulnerabilidades de seguridad reales reportadas por el Equipo Rojo de Bitcoin. Los resultados mostraron diferencias marcadas entre los modelos, tanto en el costo en dólares incurrido para ejecutar cada uno como en la precisión de sus diagnósticos.
De los 7 agentes evaluados, 3 no completaron la tarea. Qwen 3.8 de Alibaba se quedó atascado durante el proceso, sin que Miller indicara el motivo. GPT-5.6 Sol de OpenAI y Fable de Anthropic se negaron rotundamente a trabajar en el código, según el propio Miller, a pesar de que la tarea era identificar y corregir fallos, no explotarlos.
Los 4 agentes que sí completaron el trabajo, Grok 4.6 (xAI), Kimi K3 (Moonshot AI), DeepSeek V4 Pro y DeepSeek V4 Flash (DeepSeek), tuvieron costos en dólares muy diferentes por consumo de tokens (instrucciones del usuario) al ser ejecutados:
El tiempo también varió considerablemente. DeepSeek V4 Pro completó su trabajo en 30 minutos, Kimi K3 en 40 minutos, y Grok 4.6 en 1 hora, mientras que DeepSeek V4 Flash tardó 3 horas, seis veces (500%) más que DeepSeek V4 Pro para la misma tarea.
Según Miller, solo Grok 4.6 coincidió con su propia evaluación de la gravedad de las 5 vulnerabilidades.
Los otros 3 agentes que completaron el trabajo (Kimi K3, DeepSeek V4 Pro y DeepSeek V4 Flash) exageraron la gravedad de los fallos encontrados, algo que, según el propio Miller, afectó en última instancia la calidad general de los resultados entregados por esos 3 modelos.
La prueba de Miller se lleva a cabo en medio de una ola de ataques que utilizan inteligencia artificial para acelerar la búsqueda y explotación de fallos de seguridad en el ecosistema de Bitcoin.
En las últimas semanas, Coldcard, Boltz, ZEUS, BTCPay Server y LNP2Pbot sufrieron incidentes de seguridad vinculados a fallos que los atacantes identificaron y explotaron con la ayuda de modelos de IA. Ninguno de estos casos afectó al protocolo de Bitcoin en sí, sino a productos y servicios que operan fuera de la red.
Esta ola de incidentes llevó al Equipo Rojo de Bitcoin, un grupo de desarrolladores dedicados a encontrar fallos de seguridad en proyectos de Bitcoin de código abierto, a lanzar una auditoría masiva asistida por IA del ecosistema.
La auditoría del Equipo Rojo de Bitcoin ya ha cubierto más de 300 repositorios de código abierto, y de ese trabajo surgieron las 5 vulnerabilidades que Miller utilizó como base para su propia prueba sobre los 7 agentes de IA, entre otros 8,000 fallos encontrados por ese grupo de investigadores, según informó CriptoNoticias.
De los 7 agentes que Miller probó, 4 son de código abierto, Kimi K3, DeepSeek V4 Pro, DeepSeek V4 Flash y Qwen 3.8. Esto significa que las empresas que los entrenaron publicaron sus parámetros, permitiendo a cualquier usuario descargarlos y ejecutarlos en sus propias máquinas sin depender de la aprobación de esas empresas.
Los otros 3 agentes, Grok 4.6, GPT-5.6 Sol y Fable, son cerrados, por lo que solo se pueden utilizar a través de la plataforma o la interfaz de programación de aplicaciones (API) de la empresa que los desarrolló.
Esta distinción entre modelos de código abierto y cerrados es relevante para la seguridad del ecosistema de Bitcoin. Al ejecutarse en los propios servidores de las empresas, los modelos cerrados permiten a sus creadores mantener filtros de seguridad activos, como los que llevaron a GPT-5.6 Sol y Fable a negarse a trabajar en las vulnerabilidades en esta prueba.
Los modelos de código abierto, por otro lado, pueden ejecutarse en una computadora local y ser modificados por cualquier usuario, lo que hace posible eliminar esos filtros de seguridad. Un atacante podría utilizar una versión sin restricciones de uno de estos mismos modelos para ayudar en ataques reales contra plataformas en el ecosistema de Bitcoin, algo que ningún filtro externo podría prevenir.
La prueba de Miller expone que, más allá del avance de la inteligencia artificial en la detección de vulnerabilidades, persisten diferencias significativas entre los diversos modelos en lo que respecta a clasificarlas y corregirlas con precisión, tanto en el costo en dólares incurrido por cada uno como en los criterios que aplican.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























