Sept agents d'IA classifient et corrigent des erreurs dans Bitcoin : que ont-ils trouvé ?
- Les modèles Qwen 3.8, GPT 5.6 et Fable ont échoué : l'un s'est bloqué et deux ont refusé de travailler.
- 4 des 7 modèles testés sont open source et peuvent être utilisés sans filtres.
Paul Miller, développeur maintenant des bibliothèques de cryptographie utilisées dans des projets Bitcoin et Ethereum, a testé 7 agents d'intelligence artificielle (IA) pour classer et corriger 5 vulnérabilités de sécurité réelles, signalées par le groupe Bitcoin Red Team. Le résultat a montré des différences marquées entre les modèles, tant en termes de dépenses en dollars pour les exécuter que de précision de leurs diagnostics.
Parmi les 7 agents évalués, 3 n'ont pas réussi à terminer la tâche. Qwen 3.8, d'Alibaba, s'est bloqué pendant le processus, sans raison déclarée par Miller. GPT-5.6 Sol, d'OpenAI, et Fable, d'Anthropic, ont directement refusé de travailler sur le code, selon Miller lui-même, bien que la tâche consistait à identifier et réparer des erreurs, et non à les exploiter.
Les 4 agents qui ont terminé le travail, Grok 4.6 (xAI), Kimi K3 (Moonshot AI), DeepSeek V4 Pro et DeepSeek V4 Flash (DeepSeek), ont eu des dépenses en dollars très disparates pour la consommation de tokens (instructions des utilisateurs) lors de leur exécution :
- Grok 4.6 a coûté 4,70 dollars en consommation de calcul.
- DeepSeek V4 Pro a coûté 0,30 dollars pour la même tâche, une différence de 15,7 fois (près de 1500 %) entre le modèle le plus cher et le plus économique à exécuter.
Le temps nécessaire a également varié considérablement. DeepSeek V4 Pro a terminé son travail en 30 minutes, Kimi K3 en 40 minutes et Grok 4.6 en 1 heure, tandis que DeepSeek V4 Flash a nécessité 3 heures, six fois (500 %) plus que DeepSeek V4 Pro pour la même tâche.
Selon Miller, seul Grok 4.6 a coïncidé avec sa propre évaluation de la gravité des 5 vulnérabilités.
Les 3 autres agents qui ont terminé le travail (Kimi K3, DeepSeek V4 Pro et DeepSeek V4 Flash) ont exagéré la gravité des erreurs trouvées, ce qui, selon Miller lui-même, a affecté la qualité générale des résultats fournis par ces 3 modèles.
Le test de Miller se déroule au milieu d'une vague d'attaques utilisant l'intelligence artificielle pour accélérer la recherche et l'exploitation des vulnérabilités de sécurité dans l'écosystème bitcoin.
Au cours des dernières semaines, Coldcard, Boltz, ZEUS, BTCPay Server et LNP2Pbot ont subi des incidents de sécurité liés à des erreurs que des attaquants ont identifiées et exploitées avec l'aide de modèles d'IA. Aucun de ces cas n'a affecté le protocole Bitcoin lui-même, mais des produits et services opérant en dehors du réseau.
Cette vague d'incidents a poussé le Bitcoin Red Team, un groupe de développeurs dédié à la recherche de vulnérabilités de sécurité dans des projets open source de Bitcoin, à lancer un audit massif assisté par IA sur l'écosystème.
L'audit du Bitcoin Red Team a déjà couvert plus de 300 dépôts de code open source, et de ce travail sont issues les 5 vulnérabilités que Miller a utilisées comme base pour son propre test sur les 7 agents d'IA, parmi autres 8 000 erreurs trouvées par ce groupe de chercheurs, comme l'a rapporté CriptoNoticias.
Parmi les 7 agents que Miller a testés, 4 sont open source, Kimi K3, DeepSeek V4 Pro, DeepSeek V4 Flash et Qwen 3.8. Cela signifie que les entreprises qui les ont formés ont publié leurs paramètres de manière publique, permettant à tout utilisateur de les télécharger et de les exécuter sur ses propres machines, sans dépendre de l'approbation de ces entreprises.
Les 3 autres agents, Grok 4.6, GPT-5.6 Sol et Fable, sont fermés, donc ils ne peuvent être utilisés que via la plateforme ou l'interface de programmation d'applications (API) de l'entreprise qui les a développés.
Cette distinction entre modèles open source et fermés est pertinente pour la sécurité de l'écosystème bitcoin. En s'exécutant sur les serveurs de chaque entreprise, les modèles fermés permettent à leurs créateurs de maintenir des filtres de sécurité actifs, comme ceux qui ont conduit GPT-5.6 Sol et Fable à refuser de travailler sur les vulnérabilités dans ce test.
Les modèles open source, en revanche, peuvent être exécutés sur un ordinateur local et être modifiés par tout utilisateur, ce qui rend possible la suppression de ces filtres de sécurité. Un attaquant pourrait utiliser une version sans restrictions de l'un de ces mêmes modèles pour assister à de réelles attaques contre des plateformes de l'écosystème bitcoin, quelque chose qu'aucun filtre externe ne pourrait empêcher.
Le test de Miller expose que, au-delà des avancées de l'intelligence artificielle dans la détection des vulnérabilités, des différences significatives persistent entre les différents modèles en matière de classification et de correction avec précision, tant en termes de dépenses en dollars que de critères appliqués.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

B.AI ouvre l'accès gratuit à DeepSeek V4, enregistre un volume de traitement de 76,9 milliards de tokens

Qwen 27B devance Claude Opus dans certains benchmarks de codage

Visa recherche un nouveau partenaire stablecoin après l'acquisition de BVNK par Mastercard

Clear Street rejoint le réseau XDC en tant que validateur de nœud maître institutionnel

Le fondateur de Curve déclare que la pression du GAFI pourrait rendre la DeFi plus sûre et plus décentralisée

18e anniversaire de l'enregistrement du domaine bitcoin.org

Qwen, 3 milliards de téléchargements pour OpenWeight AI

Les modèles d'IA chinois téléchargés à 41 %, pression sur le marché américain

Démantèlement ordonné en cours : Revue approfondie du marché des prêts et des contrats à terme de cryptomonnaies au deuxième trimestre 2026

GoPlus DeepScan : mise à niveau complète avec un système de protection de la sécurité des contrats intelligents basé sur l'IA

Payward, l'opérateur de Kraken, introduit Claude pour renforcer la sécurité

Cyberattaque à Taïwan utilise l'IA contre des organismes gouvernementaux

web3 : Vulnérabilité des semences Coldcard révélée, plus de 100 millions de dollars de Bitcoin volés

Quatre utilitaires d'il y a 20 ans que Windows 11 ne peut toujours pas remplacer

Course à l'IA : les États-Unis exigent de choisir son camp - Le français Mistral se tourne vers la Chine

Bitcoin : Le marché à terme se transforme petit à petit en poudrière

Le taux des obligations américaines à 10 ans baisse à 4,6743 %

Séminaire pour entreprises : DeFi vers la finance on-chain - Retour sur l'histoire de la finance on-chain avec SMBC Nikko Securities (26/08 19h30 @ Gentoosha)

Probabilité d'augmentation des taux d'intérêt en septembre à 30 %, rebond des devises émergentes

Les perpetuals actions crypto passent de 15 à 250 milliards en trois mois, selon CryptoQuant

ZODL achève la migration du portefeuille Zodl d'Orchard à Ironwood et corrige les défauts du backend Zebra

SanDisk SNDK : un open interest de 1,72 milliard de dollars, leader des actions

Cardano Dijkstra vise le déploiement de Leios en 2026 et de Peras en 2027

Les États-Unis envisagent de poser des "questions à choix unique" à leurs partenaires en IA : Pax Silica évolue d'un cadre de coopération vers un camp technologique

Hoskinson dévoile un projet open source pour le traitement des marques générées par l'IA
![[SCAN 2026 Interview finale] ④1nf1n1ty : Une expérience solide avec plus de 200 CTF](/public-static/39_645e9f2336.png?format=avif)
[SCAN 2026 Interview finale] ④1nf1n1ty : Une expérience solide avec plus de 200 CTF

Coût et efficacité des modèles de programmation testés par DHH : DeepSeek à 23 dollars, Fable à 550 dollars

SanDisk conclut un contrat de stockage AI de 93,9 milliards de dollars

Probabilité de maintien des taux d'intérêt en septembre à 66,9 %, possibilité d'augmentation à 33,1 %




