Claude Fable 5 n'est pas nerfé. Le routeur est juste paranoïaque
Claude Fable 5 est revenu en ligne le 1er juillet, et le verdict sur les réseaux sociaux n'était pas agréable : cassé, nerfé, lobotomisé, sous-performant, pas le même modèle.
Les critiques des utilisateurs étaient retentissantes. Puis, deux benchmarks---BridgeBench AI et Arena AI---ont publié des données le même jour et ont atteint des conclusions opposées. L'un a trouvé une dégradation sévère de la qualité des sorties, l'autre a trouvé des différences si petites qu'elles pourraient ne pas être suffisamment pertinentes pour être remarquées.
Tous deux, à leur manière, ont raison.
La version courte : le modèle n'est pas devenu plus bête. Le gardien devant lui est devenu beaucoup plus agressif. Cette distinction est très importante selon l'utilisation que vous faites de Fable.
Ce que BridgeBench a réellement mesuré
BridgeMind---une plateforme d'évaluation de l'IA---a relancé sa suite de codage complète contre la version du 1er juillet de Fable 5 le jour de son retour.
BridgeBench teste des tâches de codage du monde réel à travers des catégories incluant le débogage, le refactoring et la résistance aux hallucinations, notées de 0 à 100 sur la façon dont le modèle complète chaque catégorie. Les résultats étaient sombres sur le papier : le débogage est tombé de 86,2 à 25,9, le refactoring de 73,6 à 38,4, et la résistance aux hallucinations de 75,9 à 61,7.
Le hic réside dans la méthodologie. Sur 12 tâches de débogage TypeScript, seules trois ont réellement atteint Fable 5. Les neuf restantes ont été interceptées par le nouveau classificateur de sécurité d'Anthropic et redirigées vers Claude Opus 4.8---et BridgeBench note chaque repli comme zéro, car le modèle qui a répondu n'était pas celui sous évaluation.
Le classificateur, déployé comme condition de la réintégration de Fable, a été formé pour bloquer la technique de jailbreak signalée par Amazon---une technique qui a permis à Fable 5 d'identifier et de démontrer des vulnérabilités logicielles. Cela fonctionne. Cela attrape aussi beaucoup de choses qu'il ne devrait pas. Le débogage TypeScript ressemble suffisamment à un "travail de sécurité" pour que le classificateur déclenche constamment le repli.
Ce que Arena.AI a réellement mesuré
Arena.AI, une plateforme de benchmarking et de comparaison de LLM, a posé la même question à travers un autre prisme. La plateforme collecte des milliers de votes de préférence humaine à l'aveugle à travers plusieurs catégories---texte, vision, document, code et agent---et classe les modèles en utilisant le score Elo, le système de notation dérivé des échecs qui s'ajuste pour l'incertitude statistique à travers des milliers de confrontations directes. Lorsque deux modèles s'affrontent anonymement et que les humains choisissent un gagnant, le score reflète la qualité perçue réelle, et non le routage d'infrastructure.
La comparaison avant-après a montré que Fable 5 maintenait largement sa position. Le code frontend est tombé de 1650 à 1623 Elo---une différence que Arena a notée comme étant dans l'intervalle de confiance à mesure que les données continuent de s'accumuler. La performance des documents s'est améliorée de 34 points. Le texte d'expert a augmenté de 25. L'écriture créative a légèrement augmenté de 9. Les catégories qui ont diminué : le codage à -18, les prompts difficiles à -3---sont précisément celles où le classificateur est le plus susceptible d'intercepter le prompt avant que Fable puisse répondre.
En d'autres termes, lorsque Fable 5 gère réellement la tâche, il fonctionne toujours comme Fable 5. La frustration sur X n'est pas due à un modèle moins performant mais plutôt à payer pour un modèle qui n'est souvent pas celui qui répond.
Qui est affecté, qui ne l'est pas
Les utilisateurs généraux faisant de l'écriture créative, de l'analyse de documents, de la recherche et des requêtes de texte de niveau expert ne remarqueront probablement que peu ou pas de différence. Ce sont les catégories où Arena.AI montre une performance stable ou améliorée. S'il y a une amélioration, elle pourrait être trop petite pour être remarquée, surtout dans des tâches subjectives et qualitatives comme l'écriture créative, où il est difficile de mesurer pleinement les résultats.
Donc, en gros, les écrivains, chercheurs et analystes obtiendront le Fable 5 qu'ils attendaient. Les développeurs, c'est une autre histoire.
Quiconque travaillant dans un domaine adjacent à la sécurité---codage de la gestion de la mémoire, tout ce qui touche à des mots comme "vulnérabilité", "exploitation", "hook" ou même "fix"---va régulièrement rencontrer le repli.
L'écart entre l'effondrement de BridgeBench et la stabilité d'Arena se résume au type de tâche. BridgeBench charge sa suite avec exactement le genre de prompts de réparation de code et de débogage qui déclenchent le nouveau classificateur. Les votants humains d'Arena posent un mélange de questions beaucoup plus large, et la plupart d'entre elles ne ressemblent pas à du code d'exploitation pour une couche de sécurité.
Anthropic a déclaré que les classificateurs s'amélioreraient avec le temps, reconnaissant qu'ils jettent actuellement un filet trop large. L'interdiction initiale est venue après que des chercheurs d'Amazon ont trouvé une technique pour amener Fable à identifier et à démontrer des vulnérabilités logicielles---et le gouvernement américain a traité cela comme une menace pour la sécurité nationale. La solution a été de rendre le classificateur suffisamment conservateur pour attraper cela et tout ce qui l'entoure, puis de l'ajuster par la suite.
Anthropic n'a donné aucune date cible pour quand cela se produira.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

DGrid AI : Reconstructing the Trust Mechanism of AI Infrastructure with PoQ and Validation Nodes

200 produits de trading AI sont-ils inutiles ? Un co-fondateur de Foresight Ventures a fait quelque chose de différent

NVIDIA Qwen3.8-Flash-Next atteint un débit de plus de 16 000 tokens/seconde sur la plateforme GB300 NVL72

Qualcomm lance IMSDK 2.0 pour promouvoir le développement d'applications AI en périphérie

Apple lance le Mac mini avec puce M6, à partir de 899 dollars

Thomson Reuters développe un modèle d'IA juridique 'Thomson' pour 40 millions de dollars

Après un financement de 12 millions de dollars en seed, le programme de points d'Axis Robotics vaut-il la peine d'être impliqué ?

Kimi K3 : Une semaine d'observations sur le consensus, les divergences et les tendances

Observation WAIC : Consensus encombré, énorme bulle

Points clés : Texte intégral du discours du scientifique en chef de Google, Shanahan

Modèles de conception agentiques : Un livre qui m'a fait repenser la question "Qu'est-ce qu'un agent, exactement ?"

a16z : 5 façons dont la blockchain contribue à l'infrastructure des agents d'IA

WORLD3 publie un livre blanc sur l'IA stratégique : l'entreprise a traité plus de 100 milliards de tokens de modèles de langage (LLM)

fondateur a16z : À l'ère des Agents, ce qui compte vraiment a changé

Le nombre d'utilisateurs des services LLM de B.AI a dépassé le million

Les utilisateurs de B.AI dépassent officiellement 800 000

Le nombre d'utilisateurs de la plateforme de services B.AI LLM a dépassé les 750 000

La recherche révèle que les routeurs IA tiers présentent des failles de sécurité, ce qui peut conduire au vol de cryptomonnaies

Base dévoile la liste des projets sélectionnés pour l'accélérateur Base Batch 003, qui comprend 12 projets issus des domaines de l'IA et de la DeFi

Fondation Solana : Quinze millions de paiements via agents IA on-chain ont été traités, et les stablecoins deviennent l'outil de règlement par défaut.

Quand tout le monde vend des actions dans le secteur des logiciels, HSBC affirme que vous avez tort.

« Mon oncle a été blessé par un homard » et s'est fait escroquer 440 000 dollars. Les agents IA sont-ils vraiment si doués pour passer à travers les mailles du filet ?
80% Taux de victoire à 40% Drawdown: Le recalibrage brutal d'un trader IA à WEEK AI Wars
Plongez dans le schéma technique d’un système de trading IA basé sur le raisonnement LLaMA et l’exécution multi-agents. Découvrez comment Quantum Quaser utilise les seuils de confiance et les filtres de volatilité lors de WEEK AI Wars, et découvrez la clé pour débloquer 95% de trades de taux de victoire.

Règles et directives du WEEX Trading Hackathon via IA
Cet article présente le cadre réglementaire, les critères de participation et la répartition des prix de la Phase finale du WEEX Trading Hackathon via IA, durant laquelle les finalistes s’affrontent via des stratégies de trading basées sur l’intelligence artificielle en environnement réel.







