Claude Opus 5 supera a Fable 5 en la mayoría de los benchmarks—al half del precio
Claude Opus 5 se lanza hoy. Es más barato para las empresas operar que el modelo líder de Anthropic, Claude Fable 5, que la compañía había posicionado como el producto de frontera cotidiano para los usuarios de pago. Además, Opus 5 también lo supera en benchmarks significativos.
Para entender dónde encaja Opus 5: la línea de productos de Anthropic tiene cuatro niveles. Haiku es rápido y barato. Sonnet es de gama media. Opus es el caballo de batalla pesado. Por encima de eso está la clase Mythos---un nivel que Anthropic introdujo esta primavera---que incluye Claude Fable 5 para el público, y Claude Mythos 5, una versión con menos restricciones reservada a través del Proyecto Glasswing para investigadores de ciberseguridad verificados y operadores de infraestructura crítica.
Fable 5 ha tenido un recorrido difícil como el buque insignia de suscriptores. Se lanzó el 9 de junio, fue retirado globalmente tres días después tras la emisión de una orden de control de exportación de emergencia por parte del gobierno de EE. UU. citando una vulnerabilidad de jailbreak, y volvió el 30 de junio---solo para cambiar inmediatamente a un modelo solo de créditos, ya no incluido en los planes estándar. Opus 5 ahora ocupa el lugar que Fable 5 no pudo mantener.
Lovable, una plataforma de desarrollo con millones de usuarios, ejecutó Opus 5 en sus evaluaciones internas y notó que las ganancias se extienden más allá de las puntuaciones brutas: "No solo es mejor en nuestras tareas de codificación más difíciles, un 22% más que Opus 4.7, es más estable, con mucha menos variación de ejecución a ejecución", dijo Fabian Hedin en una declaración compartida por Anthropic.
Los benchmarks
Puede sonar extraño, pero Opus supera a Fable en casi todo lo que importa al usuario cotidiano sin estar etiquetado como de clase Mythos como Fable.
En Frontier-Bench v0.1---un benchmark que prueba si los agentes de codificación de IA pueden completar tareas de ingeniería de software reales de extremo a extremo, puntuado como un porcentaje de tareas aprobadas---Opus 5 alcanzó el 43.3%. Fable 5 llegó al 33.7%. GPT-5.6 Sol de OpenAI, el principal rival comercial de Anthropic, obtuvo un 34.4%.
El margen más amplio está en ARC-AGI-3, una prueba de resolución de problemas genuina construida en torno a rompecabezas novedosos que un modelo no podría haber memorizado de los datos de entrenamiento, puntuado como un porcentaje de rompecabezas resueltos. Opus 5 alcanzó el 30.2%; GPT-5.6 Sol puntuó 7.8%; y Fable 5 no fue probado en absoluto. En GDPval-AA v2---un benchmark de trabajo de conocimiento puntuado a través de calificaciones Elo, el sistema de clasificación estilo ajedrez utilizado para medir el rendimiento relativo en tareas profesionales reales---Opus 5 alcanzó 1,861 frente a los 1,747 de Fable 5 y los 1,736 de GPT-5.6 Sol.
Zapier probó Opus 5 en AutomationBench, una evaluación que puntúa si un modelo puede llevar a cabo un flujo de trabajo empresarial completo de principio a fin sin ayuda humana. Su veredicto: el modelo "tomó un libro de trabajo de salud de cuenta en bruto y ejecutó una secuencia completa de prevención de cancelaciones de extremo a extremo: señalando cuentas en riesgo, alertando al propietario correcto y resumiendo para operaciones de retención. Los modelos anteriores no pasaron; Opus 5 alcanzó el 100%."
Anthropic también está promocionando Opus 5 como una mejora para la investigación. Ultima Genomics, una empresa de secuenciación de ADN, dijo que el modelo "se comporta más como un científico cuidadoso que cualquier modelo que hayamos ejecutado. Busca las pruebas estadísticas correctas para descartar confusores, verifica sus propios resultados mediante métodos independientes y se mantiene en el camino a través de análisis largos de múltiples pasos."
Dicho esto, estas dos áreas---legal y salud---son las únicas en las que Fable 5 sobresale por un pequeño margen.
El lanzamiento llega una semana después de que Moonshot AI, una startup con sede en Pekín respaldada por Alibaba, presentó Kimi K3---un modelo de peso abierto de 2.8 billones de parámetros (lo que significa que cualquiera puede descargar el código subyacente para ejecutarlo de forma independiente) que Moonshot describe como el sistema de IA abierto más grande del mundo. Los benchmarks independientes colocan consistentemente a Kimi K3 en tercer lugar en general, detrás de Fable 5 y GPT-5.6 Sol, superando a esos dos en áreas específicas.
Opus 5 está disponible ahora a través de API a $5 por millón de tokens de entrada y $25 por millón de salida. (Los tokens son la unidad básica de información que un modelo de IA puede procesar tanto en entrada como en salida). También está disponible un modo rápido que funciona a aproximadamente 2.5 veces la velocidad predeterminada, al doble del precio base---$10 por millón de tokens de entrada y $50 por millón de salida.
Este lanzamiento puede poner fin a la ansiedad por la falta de disponibilidad pública de Fable 5. Opus también está disponible a través de suscripción para todos.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Colaborador de Dogecoin advierte sobre vulnerabilidad en billeteras BitBox

Los salarios han aumentado, pero los trabajadores no lo sienten

NOT A HOTEL de Japón completa una financiación de aproximadamente 112 millones de dólares

Samara Weaving interpretará a Emma Frost en el reinicio de X-Men

"No hay un objetivo de inflación suave en la FED": Kevin Warsh

Michael Saylor: La evolución de Bitcoin radica en la permanencia

ByteDance gana 30 millones en bolsa: análisis de estrategias de inversión

Charles Schwab executive: Bitcoin did not crash because of Saylor, but rather lost its momentum trading dominance

Vitalik habla sobre el futuro de la Ethereum Foundation: una nave más pequeña, más distintiva y más duradera

Zamanat aborda el déficit de financiación de PYMEs de 250 mil millones de dólares en el CCG con un fondo de crédito privado tokenizado de hasta 100 millones de dólares

El fundador de CoinFactory, Rasoul Rezvani, revela la visión detrás de RZ Oasis

Lo que creías que era una verificación de seguridad y cumplimiento, resultó en entregar tus activos a un hacker

Cuando el enigma sin resolver de Bitcoin se encuentra con un nuevo Meme

DEEPCOIN se une a HackenProof para completar pruebas de penetración del sistema y fortalecer la seguridad de los activos

¿Hacia dónde se dirige Solana en su camino de supervivencia en el año 17 de la era cripto?

Crisis del petróleo: 5 razones por las que el aumento no se detendrá

La Comisión de Valores de Tailandia revela avances en medidas clave para impulsar el "mercado de inversión tailandés" hacia la calidad

Evaluación real de World.xyz: comercio en milisegundos y apuestas contra los creadores de mercado

¿Se está abriendo el espacio independiente de Waller ante la caída de las encuestas de Trump y el descontrol del mercado de deuda?

La ESMA alerta sobre los vínculos crecientes entre cripto y finanzas

Cómo Calcular las Ganancias de Bitcoin para Principiantes de Manera Sencilla - Mundo Fintech
![[Informe completo] Fundación Solana: "El STO en Corea debe comenzar dentro del marco regulatorio y expandirse globalmente"](/public-static/10_5acc261b9b.png?format=avif)
[Informe completo] Fundación Solana: "El STO en Corea debe comenzar dentro del marco regulatorio y expandirse globalmente"

¿Se Puede Comprar Bitcoin con 50.000 Rupias? Así es Como - Mundo Fintech

Bab el-Mandeb: petróleo, Bitcoin o... ¿cuáles son las consecuencias para la economía?

Anthropic: El informe que implica a Claude, entre misiles, espionaje en Malí y saqueo chino

La Comisión de Servicios Financieros recibe 1.961 consultas sobre fraudes en productos de inversión y criptomonedas entre abril y junio, con más del 80% de casos de víctimas

JPMorgan optimista sobre Meta: Muse, Model API y suscripciones apoyan un precio objetivo de 820 dólares

Análisis completo de Pump.fun: ¿Está subestimado gravemente y cuál debería ser su precio objetivo?

Bitget Wallet se une a BCCC para participar en el debate sobre la custodia propia en Japón



