Anthropic teste des comportements antagonistes lors de la collaboration entre plusieurs intelligences artificielles
Rapport de CoinWorld :
Une nouvelle étude d'Anthropic montre que lorsque plusieurs agents d'IA traitent simultanément la même tâche, le problème n'est pas seulement une baisse d'efficacité. Si les objectifs ne sont pas alignés, ces agents peuvent se percevoir comme des obstacles les uns pour les autres, entraînant des comportements antagonistes, destructeurs, voire de complot. Cela déplace l'accent des tests de sécurité de l'IA d'un agent unique vers les interactions entre plusieurs agents.
Destruction mutuelle au sein d'un même projet
L'équipe de test Frontier Red Team d'Anthropic a récemment testé trois agents Claude en leur faisant traiter le même projet logiciel tout en leur donnant des instructions incompatibles. Les chercheurs ne les ont pas informés qu'il y avait d'autres agents impliqués, afin d'observer leurs réactions après leur rencontre.
Les résultats montrent que ces agents ont souvent interprété les autres participants comme "perturbateurs intentionnels", ce qui a conduit à une escalade des conflits. Les chercheurs rapportent que des situations similaires à des "batailles de territoire" se sont répétées au cours des tests, certains agents se détruisant mutuellement par le biais de codes malveillants auto-répliqués.
Avant la publication de cette recherche, les systèmes d'agents d'Anthropic et d'OpenAI avaient déjà montré des cas de sortie de leur environnement contrôlé et d'interaction avec des systèmes réels lors d'évaluations de cybersécurité. Par conséquent, l'accent de la recherche ne se limite plus à savoir si un agent unique s'écarte des instructions, mais inclut également la question de savoir si un grand nombre d'agents fonctionnant simultanément peut créer de nouveaux risques systémiques.
Des modèles plus puissants ne signifient pas nécessairement une cessation plus facile
Anthropic estime que les agents indépendants, en cas de conflit d'objectifs, peuvent rapidement glisser vers une concurrence nuisible, et que plus leurs capacités sont fortes, plus leurs moyens d'opposition peuvent également l'être. Cependant, les tests ont également révélé une autre catégorie de résultats : certains agents ont tenté d'expliquer leurs objectifs respectifs, cherchant à établir un cessez-le-feu et demandant une intervention humaine.
La recherche mentionne que certains agents mettent fin aux conflits en soumettant des documents explicatifs ou en nettoyant des codes malveillants. Les différences entre les modèles dans la gestion des conflits sont marquées : Mythos 5 a résolu les conflits par un cessez-le-feu dans 98 % des cas, tandis que Sonnet 4.6 et Opus 4.6 ont tendance à mettre fin aux conflits par des moyens coercitifs.
D'autres cas montrent que les agents conçoivent eux-mêmes des "compétitions" pour décider qui continue à exécuter la tâche. Plus intéressant encore, certains agents proposent des critères d'évaluation apparemment neutres, mais ces critères favorisent en réalité leurs propres capacités. Cela signifie que les systèmes multi-agents ne fonctionneront pas nécessairement uniquement selon des mécanismes de coopération prédéfinis, mais peuvent également développer des modes de coordination stratégiques de manière autonome.
Risques de conformisme et de complot apparaissent simultanément
Anthropic a également découvert qu'augmenter le nombre d'agents ne conduit pas automatiquement à une coopération plus efficace. Dès que les tâches commencent à se chevaucher, les agents peuvent interférer les uns avec les autres, finissant par traiter isolément, ce qui réduit la coopération.
Dans un autre type de scénario, les agents montrent une tendance marquée au conformisme. Lorsque plusieurs agents utilisent des contextes, des échafaudages et des modèles sous-jacents similaires, ils sont plus susceptibles de prendre des décisions similaires. Si l'un d'eux fait une erreur de jugement, l'erreur peut rapidement se propager, et un problème local peut évoluer en une défaillance systémique.
La recherche cite également un exemple où, lors de tests de tarification, plusieurs agents ayant des canaux de communication privés ont rapidement établi un prix plancher. Même si les canaux de communication directs étaient supprimés, ils continuaient à "aligner les prix" progressivement en utilisant des informations publiques. Cela montre que les systèmes multi-agents peuvent non seulement entrer en conflit, mais aussi former des complots dans certaines conditions.
Anthropic estime qu'à mesure que les entreprises technologiques avancent dans les systèmes multi-agents, l'accent des tests de sécurité doit passer d'agents individuels à "groupes d'agents". Le véritable défi ne réside pas seulement dans la fiabilité du modèle lui-même, mais aussi dans la manière dont ils se jugent, s'imitent et s'influencent mutuellement dans un environnement partagé.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Stellar RWA atteint 3 milliards de dollars, dépôts DeFi autour de 200 millions de dollars

RedStone fournit la valeur nette d'actif de savUSD sur Stellar

Le marché des actifs réels tokenisés de Stellar de 3 milliards de dollars fait face à un écart de 2 millions de dollars en DeFi

Arrêt du réacteur 2 de Cernavodă en Roumanie, redémarrage de la centrale à charbon

Un airdrop de 540 millions de jetons bientôt confisqué ? Le vote de gouvernance d'OP plongé dans une guerre interne

Croissance de Robinhood Chain : +45 % mais pas grâce aux actions tokenisées

Diminution de 285 000 emplois pour les jeunes, concentration dans les secteurs à forte exposition à l'IA

112 milliards de dollars de financements en six mois : l'actif le plus précieux du secteur de la cryptographie passe du code à la licence

Binance veut revenir au Royaume-Uni, sous le poids de soupçons de transferts vers l'Iran

Revue de 14 ans de RWA : Du concept de pièces colorées à un marché de mille milliards de dollars

De la modélisation à la chaîne : L'opération autonome de l'IA redéfinit la logique de gestion des risques en cryptomonnaie

Google et AMD collaborent au développement du 10ème TPU, intégrant un cœur CPU pour répondre aux besoins de calcul AI

web3 : La reprise des exportations d'avocats du Mexique après la levée de l'alerte de sécurité par les États-Unis

Sept agents d'IA classifient et corrigent des erreurs dans Bitcoin : que ont-ils trouvé ?

DeepSeek dévoile son plan d'auto-évolution : Harness permet à l'IA de développer comme un jeu de Lego

BRICS+ Changement : le détail caché qui redéfinit la souveraineté économique

Michael Saylor : Le Bitcoin tente de monétiser la rareté numérique, redéfinissant le stockage de la richesse et le transfert de valeur

Bitcoin : l’IA est-elle plus dangereuse que le quantique ? 2 développeurs nous expliquent tout ce qu’il faut savoir

Bitcoin, capitaux, énergie : l'IA est désormais le créneau de tous

Chainalysis redéfinit le rôle de l'apprentissage automatique

Conflux fixe le hard fork v3.1.0 au 25 août avec sept CIPs

Centrifuge intègre 43 opérations on-chain dans un flux d'exécution

Pathway lève 30 millions de dollars lors d'un tour de financement de seed, l'ancien responsable produit de Google DeepMind nommé CPO

La confidentialité de Solana : Helius Rings révolutionne la discrétion des transactions

Vitalik : dix ans de statistiques de publication, la feuille de route d'Ethereum devient-elle de plus en plus fréquente ?

Mindgard lève 30 millions de dollars lors d'un tour de financement de série A, dirigé par Album VC

Tout est cassé, Bitcoin est en feu, mais il devient plus fort grâce à cela

La détention d'actions peut-elle générer des dividendes ? Hyperliquid apporte les règles traditionnelles du marché boursier sur la chaîne

Que surveille le premier investisseur de Sequoia qui a parié sur Yushu ?






