Google crée WikiSkill pour que les agents d'IA se souviennent de leurs erreurs et s'améliorent

By: www.diariobitcoin.com|2026/08/29 13:32:09

**Des chercheurs de Google Research ont présenté WikiSkill, un cadre qui conserve les erreurs et les réussites des agents d'IA dans une wiki persistante pour créer de meilleures instructions lors des exécutions futures. Les tests montrent des avancées importantes en mathématiques, dans les tableurs et dans des environnements interactifs, bien que le système ne représente pas encore un apprentissage continu au sens strict.


  • WikiSkill sépare les traces d'exécution, les connaissances accumulées et les instructions actives en trois couches.**
  • Le cadre a élevé la moyenne de Gemini 3.5 Flash de 49,5 % à 68,1 % et celle de Qwen-3.6-27B de 39,4 % à 63,3 %.
  • Les grands modèles tirent mieux parti des compétences évoluées, tandis que les petits peuvent combler une partie de l'écart.

Une mémoire externe pour les agents qui oublient

Des chercheurs de Google Research ont présenté WikiSkill comme un cadre destiné à résoudre une limitation récurrente des agents d'intelligence artificielle : chaque exécution se termine et une grande partie de l'expérience acquise disparaît. Au lieu de modifier les paramètres du modèle après chaque tâche, le système rassemble des informations sur les échecs, les réussites et les stratégies utiles dans une structure similaire à une encyclopédie collaborative. L'agent consulte ensuite ce matériel pour agir avec de meilleures instructions lors de la prochaine occasion.

La proposition n'implique pas que le modèle apprenne de manière continue au sens traditionnel. Le modèle conserve son entraînement original, mais génère des instructions plus précises pour lui-même à partir de l'expérience enregistrée, une solution moins élégante que l'apprentissage permanent et potentiellement vulnérable aux erreurs accumulées. Néanmoins, les résultats de l'étude indiquent que cette mémoire externe peut améliorer de manière significative les performances dans des tâches nécessitant plusieurs étapes et l'utilisation coordonnée d'outils.

Le concept part d'une perspective attribuée à Andrej Karpathy sur une sorte de wiki pour les modèles de langage, où l'expérience des agents se transforme en connaissance persistante et cumulative. WikiSkill amène cette idée au développement automatique de compétences, avec un processus qui tente de convertir les exécutions précédentes en procédures réutilisables sans toucher au comportement appris pendant l'entraînement. La distinction est pertinente car elle permet de tester des changements de comportement sans effectuer un nouvel ajustement complet du modèle.

Le travail a été évalué sur cinq types de tests : raisonnement mathématique, recherche sur le web, manipulation de tableurs, questions et réponses sur des documents et tâches interactives dans un environnement virtuel. Les chercheurs ont utilisé Qwen dans des versions de 4 milliards, 9 milliards et 27 milliards de paramètres, en plus de Gemma-4-31B et Gemini-3.5-Flash. Cette combinaison a permis d'observer comment la mémoire accumulée fonctionne dans des modèles de capacités différentes et face à des tâches avec des exigences très variées.

Trois couches et un cycle d'amélioration

WikiSkill organise l'espace de travail en trois niveaux qui remplissent des fonctions séparées. La Raw Layer conserve les traces complètes de chaque exécution, y compris les appels aux outils, les réponses obtenues et les étapes suivies par l'agent ; ces enregistrements sont immuables et servent de matière première pour analyser le comportement. Au-dessus se trouve la Wiki Layer, où l'expérience se transforme en conclusions structurées, telles que des modèles d'échec, des recommandations opérationnelles et des stratégies qui ont produit des résultats favorables.

La Wiki Layer ne se réinitialise pas après une tâche, mais elle se développe à chaque itération, selon la description des chercheurs. Cette continuité permet à une exécution ultérieure de consulter des problèmes détectés précédemment, même si la stratégie qui les a provoqués n'est plus active. La troisième couche, appelée Skill Layer, contient les instructions procédurales que l'agent utilise pendant l'exécution et fonctionne comme la partie modifiable du système.

Le cycle commence lorsqu'un agent d'inférence termine une tâche avec les compétences disponibles et produit une nouvelle trace. Ensuite, un Wiki Maintainer examine ces enregistrements pour identifier ce qui a mal tourné et quelles décisions ont été utiles, tandis qu'un Skill Proposer utilise les conclusions accumulées pour suggérer des changements concrets dans les instructions actives. L'architecture sépare ainsi l'observation des faits, l'interprétation de l'expérience et l'application d'un nouveau comportement.

Avant d'accepter une modification, un mécanisme de validation ou de gating la teste sur un ensemble indépendant de tâches. Si le changement améliore les résultats, il peut être intégré à la Skill Layer ; s'il nuit à la performance, il est annulé sans supprimer les informations qui ont donné lieu à la proposition. Même une mise à jour échouée conserve son utilité, car la wiki enregistre ce qui a été tenté et pourquoi cela n'a pas fonctionné, permettant ainsi au système d'éviter de répéter le même chemin ou de concevoir une alternative lors de tours ultérieurs.

Résultats inégaux selon le modèle et la tâche

L'étude a rapporté des améliorations de WikiSkill par rapport à des agents sans compétences supplémentaires. En moyenne, Gemini-3.5-Flash est passé de 49,5 % sans compétences à 68,1 % avec WikiSkill, tandis que Qwen-3.6-27B a progressé de 39,4 % à 63,3 %. Les chiffres correspondent à la moyenne des cinq benchmarks et ont été calculés à partir de trois exécutions indépendantes, selon le tableau inclus dans le travail.

En observant des tâches individuelles, les différences deviennent encore plus visibles. Gemini-3.5-Flash est passé de 33,0 % à 72,6 % dans LiveMath et de 50,5 % à 76,6 % dans SpreadSheet, deux des scénarios où les instructions accumulées semblent avoir le plus d'impact. Dans le cas de Qwen-3.6-27B, WikiSkill a atteint 61,9 % dans LiveMath et 81,7 % dans SpreadSheet, contre 33,9 % et 40,8 % respectivement lorsque le modèle a travaillé sans compétences.

Les gains n'ont pas été uniformes dans tous les domaines. Les tâches mathématiques et la manipulation de feuilles de calcul ont montré les sauts les plus larges, tandis qu'OfficeQA, qui exige de répondre à des questions sur des documents et de gérer des contextes longs, a présenté des avancées plus limitées dans plusieurs configurations. Dans Gemini-3.5-Flash, par exemple, le score d'OfficeQA est passé de 48,6 % à 60,7 %, une amélioration pertinente, bien que moindre que celle observée dans LiveMath et SpreadSheet.

La taille du modèle a également influencé la capacité à tirer parti des compétences évoluées. Les chercheurs ont noté que Qwen-3.5-4B avait des difficultés à exécuter de manière fiable des stratégies de recherche à plusieurs étapes lorsqu'il devait les maintenir à travers des contextes étendus, revenant donc souvent à son comportement par défaut. Cependant, un modèle plus petit équipé de WikiSkill peut égaler la performance d'un modèle plus grand qui n'utilise pas le cadre, ce qui ouvre une voie possible pour augmenter l'utilité des systèmes avec moins de ressources.

Transfert de compétences et limites à venir

Une autre observation de l'étude est que les compétences créées par un modèle peuvent être transférées à un autre et, dans certains cas, fonctionner mieux que les instructions que le modèle récepteur a développées par lui-même. Cette possibilité pointe vers un dépôt partagé de procédures, où une compétence utile pour résoudre des feuilles de calcul ou naviguer sur le web pourrait être réutilisée dans différents agents. Cependant, les résultats ne garantissent pas que le transfert soit bénéfique dans tous les cas, c'est pourquoi les chercheurs suggèrent de le vérifier de manière individuelle.

La transfert exige de la prudence car une instruction qui fonctionne dans un modèle peut dépendre de ses capacités, de son style de raisonnement ou de sa manière d'interagir avec les outils. Un agent plus petit pourrait interpréter de manière incomplète une stratégie conçue pour un système plus grand, surtout lorsque la tâche nécessite de maintenir de nombreux étapes en contexte. Le mécanisme de validation offre une barrière contre ce risque, mais n'élimine pas la nécessité d'évaluer chaque compétence dans l'environnement où elle sera utilisée.

WikiSkill expose également une différence fondamentale entre mémoire et apprentissage. Le wiki conserve des informations et le Skill Proposer génère de nouvelles instructions, mais les paramètres du modèle restent inchangés ; c'est pourquoi le système n'acquiert pas une compréhension interne permanente de la même manière qu'un processus d'entraînement continu le ferait. La solution peut améliorer le comportement observable, bien qu'une mauvaise conclusion, un enregistrement incomplet ou une inférence erronée puissent être incorporés à la base de connaissances et affecter les décisions futures.

La conception en couches tente de contenir ce problème en maintenant séparées les traces originales, les conclusions et les compétences actives. La possibilité de revenir à une mise à jour protège l'exécution immédiate, tandis que la conservation des tentatives échouées évite de perdre des informations utiles pour l'analyse ultérieure. Dans l'ensemble, l'approche montre comment les développeurs peuvent construire des agents avec une histoire opérationnelle accumulée sans prétendre avoir résolu l'apprentissage continu, un défi qui reste encore ouvert.

Les résultats suggèrent que la mémoire externe peut devenir un élément important pour les agents travaillant de manière répétée sur les mêmes types de tâches. WikiSkill n'élimine pas les limitations des modèles ni n'assure que chaque expérience produise une amélioration, mais offre une procédure systématique pour observer les erreurs, documenter les stratégies, tester les changements et conserver les leçons apprises. La principale promesse du cadre réside dans la transformation de l'oubli entre les exécutions en un processus graduel de raffinement contrôlé.

Prix de --

--
--
--

Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

Vous pourriez aussi aimer

iconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:[email protected]
Programme VIP:[email protected]