Claude Opus 5 supera Fable 5 nella maggior parte dei benchmark—al prezzo della metà

By: rootdata|2026/07/24 18:28:43

Claude Opus 5 è disponibile da oggi. È più economico per le aziende rispetto al modello leader di Anthropic, Claude Fable 5, che l'azienda aveva posizionato come prodotto di frontiera per gli utenti paganti. Inoltre, Opus 5 supera anche Fable 5 in importanti benchmark.

Per capire dove si colloca Opus 5: la gamma di Anthropic comprende quattro livelli. Haiku è veloce ed economico. Sonnet è di fascia media. Opus è il cavallo da lavoro pesante. Sopra di esso si trova la classe Mythos---un livello che Anthropic ha introdotto questa primavera---che include Claude Fable 5 per il pubblico e Claude Mythos 5, una versione con meno restrizioni riservata tramite il Progetto Glasswing a ricercatori di cybersecurity verificati e operatori di infrastrutture critiche.

Fable 5 ha avuto un percorso difficile come flagship per gli abbonati. È stato lanciato il 9 giugno, ritirato globalmente tre giorni dopo dopo che il governo degli Stati Uniti ha emesso un ordine di controllo delle esportazioni d'emergenza citando una vulnerabilità di jailbreak, e è tornato il 30 giugno---solo per passare immediatamente a un modello solo a crediti, non più incluso nei piani standard. Opus 5 ora riempie il posto che Fable 5 non è riuscito a mantenere.

Lovable, una piattaforma per sviluppatori con milioni di utenti, ha eseguito Opus 5 nelle sue valutazioni interne e ha notato che i guadagni si estendono oltre i punteggi grezzi: "Non è solo migliore nei nostri compiti di codifica agentici più difficili, con un aumento del 22% rispetto a Opus 4.7, è anche più stabile, con molta meno variabilità da esecuzione a esecuzione," ha dichiarato Fabian Hedin in una dichiarazione condivisa da Anthropic.

I benchmark

Può sembrare strano, ma Opus supera Fable in quasi tutto ciò che conta per l'utente quotidiano pur non essendo etichettato come classe Mythos come Fable.

Su Frontier-Bench v0.1---un benchmark che testa se gli agenti di codifica AI possono completare compiti di ingegneria del software reali end-to-end, valutato come percentuale di compiti superati---Opus 5 ha raggiunto il 43,3%. Fable 5 si è fermato al 33,7%. Il GPT-5.6 Sol di OpenAI, principale rivale commerciale di Anthropic, ha ottenuto il 34,4%.

Il margine più ampio è su ARC-AGI-3, un test di problem-solving genuino costruito attorno a puzzle nuovi che un modello non avrebbe potuto memorizzare dai dati di addestramento, valutato come percentuale di puzzle risolti. Opus 5 ha raggiunto il 30,2%; GPT-5.6 Sol ha ottenuto il 7,8%; e Fable 5 non è stato testato affatto. Su GDPval-AA v2---un benchmark di lavoro conoscitivo valutato tramite punteggi Elo, il sistema di ranking in stile scacchistico utilizzato per misurare le prestazioni relative su compiti professionali reali---Opus 5 ha raggiunto 1.861 contro i 1.747 di Fable 5 e i 1.736 di GPT-5.6 Sol.

Zapier ha testato Opus 5 su AutomationBench, una valutazione che misura se un modello può gestire un flusso di lavoro aziendale completo dall'inizio alla fine senza aiuto umano. Il loro verdetto: il modello "ha preso un workbook sulla salute degli account e ha eseguito un'intera sequenza di prevenzione del churn dall'inizio alla fine: segnalando gli account a rischio, avvisando il proprietario giusto e riassumendo per le operazioni di retention. I modelli precedenti non hanno superato; Opus 5 ha raggiunto il 100%."

Anthropic sta anche proponendo Opus 5 come un aggiornamento per la ricerca. Ultima Genomics, un'azienda di sequenziamento del DNA, ha dichiarato che il modello "si comporta più come uno scienziato attento rispetto a qualsiasi modello che abbiamo utilizzato. Raggiunge i giusti test statistici per escludere i confonditori, verifica i propri risultati con metodi indipendenti e rimane concentrato attraverso lunghe analisi multi-step."

Detto ciò, queste due aree---legale e salute---sono le uniche in cui Fable 5 eccelle di un margine minimo.

Il rilascio avviene una settimana dopo che Moonshot AI, una startup con sede a Pechino sostenuta da Alibaba, ha svelato Kimi K3---un modello open-weight da 2,8 trilioni di parametri (significa che chiunque può scaricare il codice sottostante per eseguirlo in modo indipendente) che Moonshot descrive come il più grande sistema AI open al mondo. I benchmark indipendenti collocano costantemente Kimi K3 al terzo posto in generale, dietro sia a Fable 5 che a GPT-5.6 Sol, superando questi due in aree specifiche.

Opus 5 è disponibile ora tramite API a $5 per milione di token di input e $25 per milione di output. (I token sono l'unità base di informazione che un modello AI può elaborare sia in input che in output). È disponibile anche una modalità veloce che funziona a circa 2,5 volte la velocità predefinita, al doppio del prezzo base---$10 per milione di token di input e $50 per milione di output.

Questo rilascio potrebbe porre fine all'ansia per la mancanza di disponibilità pubblica di Fable 5. Opus è anche disponibile tramite abbonamento per tutti.

Disclaimer: il presente contenuto è fornito esclusivamente a scopo informativo e di branding generale e non costituisce consulenza finanziaria, di investimento, legale o fiscale. Qualsiasi evento, ricompensa, evento online o informazione correlata menzionata nel presente documento non deve essere considerata una raccomandazione, una sollecitazione o un invito ad acquistare, vendere, fare trading o altrimenti negoziare asset di criptovalute o a utilizzare i relativi servizi. Le criptovalute sono altamente volatili e possono comportare perdite. I servizi e gli eventi online di WEEX potrebbero non essere disponibili in tutte le regioni e sono soggetti alle leggi, ai regolamenti e ai requisiti di idoneità applicabili. Sei responsabile di garantire che il tuo utilizzo dei servizi WEEX sia conforme alle leggi locali e di valutare attentamente i rischi prima di partecipare a qualsiasi attività correlata alle criptovalute.

Potrebbe interessarti anche

iconiconiconiconiconiconicon
Assistenza clienti:@weikecs
Cooperazione aziendale:@weikecs
Trading quantitativo e MM:[email protected]
Programma VIP:[email protected]