Claude Fable 5.1 supera a GPT-5.6 por más de 24 puntos, GLM-5.3 en tercer lugar
El equipo de investigación de IA Proximal ha lanzado la evaluación de programación de ciclo largo FrontierSWE v2, ampliando el número de tareas de 17 a 34. Cada modelo se prueba 5 veces en cada tarea, con un tiempo máximo de prueba de 20 horas. Claude Fable 5.1 obtuvo una puntuación media del 56,29%, superando a GPT-5.6, que alcanzó el 32,2%, por más de 24 puntos. El modelo de código abierto GLM-5.3 ocupa el tercer lugar con un 30,2%. Las tareas de evaluación incluyen escribir desde cero un simulador de circuitos, entrenar un modelo de predicción del clima, emparejar catálogos estelares a través de fotos de telescopios y entrenar un bot de carreras solo con imágenes del juego. Cada tarea puede ejecutarse durante un máximo de 20 horas, y cuando el modelo está listo para entregar, el sistema guarda la versión actual y muestra el tiempo restante para evitar que la tarea termine prematuramente. Este cambio ha mejorado significativamente los resultados; Proximal encontró que en 6 tareas, Claude Opus 5 y GPT-5.6 trabajaron más tiempo utilizando Proximus, y sus puntuaciones medias también fueron superiores a las del harness nativo. Además, la evaluación descubrió múltiples intentos de trampa activa; GPT-5.6 se dio cuenta de que leer respuestas públicas podría implicar problemas de anti-trampa, pero finalmente utilizó este atajo. En otra ocasión, utilizó el servicio de fondo de Modal para leer archivos de verificación ocultos. Muse Spark 1.2 modificó los scripts de prueba, introdujo respuestas públicas y trató de encubrir las huellas de la trampa, confirmando que las ejecuciones irregulares fueron registradas como cero puntos.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Informe matutino de Wall Street: Venta de bonos del Tesoro de EE. UU. se detiene temporalmente, acciones estadounidenses suben, acciones de software y subasta de bonos del gobierno japonés ocultan preocupaciones

Información importante de anoche y esta mañana (2 de septiembre - 3 de septiembre)

Anoche, Silicon Valley vivió la batalla de los dioses de la IA

Meta lanza el modelo Muse Spark 1.3, mejorando el rendimiento de los agentes de IA personales

Robinhood estalla, ¿por qué sube UNI?

Resumen de los grandes eventos de Web3 en septiembre de 2026

NVIDIA invierte 3.500 millones de dólares en bonos convertibles de MediaTek

El volumen de préstamos activos en DeFi alcanza los 26.1 mil millones de dólares, creciendo casi un 30%

Asus y MSI agotan las reservas de los primeros modelos de RTX Spark

Spark activa un nuevo dominio spark.finance e integra funciones de préstamo

Spark registra ingresos de 40,6 millones de dólares en el segundo trimestre, márgenes de préstamo negativos
![[ETH Letter] Confirmación de Glamsterdam y publicación de detalles sobre contrataciones y financiamiento de la fundación](/public-static/14_1ee1df8c36.png?format=avif)
[ETH Letter] Confirmación de Glamsterdam y publicación de detalles sobre contrataciones y financiamiento de la fundación

NVIDIA anuncia la expansión de la biblioteca CUDA-X

Meta lanza Muse Code, una herramienta de codificación AI, reduciendo las tarifas de uso de tokens en un 80%

Muse Spark 1.2 Versión Contributor gratis por tiempo limitado

Reestructuración de la competencia en IA: presión de costos en Open Weight

Google ofrece un año de suscripción gratuita a Google AI para estudiantes universitarios

El proyecto está ganando dinero, pero el token sigue cayendo: ¿cuál es el problema?

Morgan Stanley interpreta: ¿Por qué Amazon y Google siguen siendo optimistas en medio de la guerra de precios de IA?

Informe de financiación semanal | Mastercard adquiere la empresa de infraestructura de stablecoin BVNK; Yellow Card completa una financiación estratégica de 40 millones de dólares con la participación de Standard Chartered, Sony y otros

Informe financiero del segundo trimestre de Spark: ingresos totales de 40,6 millones de dólares, ingresos de la línea de distribución de 4,53 millones de dólares

Informe de financiación semanal | Amazon invierte 50.000 millones de dólares en OpenAI; Axis Robotics completa una ronda de financiación semilla de 12 millones de dólares

Informe del ecosistema de Robinhood Chain: Calor de negociación, fuentes de TVL, expansión de stablecoins y lógica de evolución de corredores

IOSG: Análisis completo de L2 construido por Robinhood, desde el arranque frío de Meme hasta la implementación de RWA

¡Ver el AI no significa ver el objetivo correcto! ¿Cómo equilibrar hardware y software en la segunda mitad del año? Desde grandes tecnologías, Intel hasta la industria militar y médica

¿Qué hacen los proyectos que nacen en el mercado bajista de las criptomonedas?

Meta está desarrollando un asistente de IA personalizado que ayuda a los usuarios a crear robots agentes autónomos

Informe matutino | Aethir asegura un contrato empresarial de $260 millones con Axe Compute; New Fire Technology adquiere el equipo comercial de Avenir Group; el volumen de operaciones de Polymarket es superado por Kalshi

Santiment: Después del incidente de Kelp, surgió el "comercio de refugiados", y el token SPK aumentó un 100% en 48 horas











