Une nouvelle astuce révèle les pensées cachées de l'IA et ravive la guerre de la distillation
Une astuce informatique permet de dévoiler la 'pensée' des modèles d'IA de pointe, révélant des distillations cachées et des fuites de données potentielles. Des chercheurs démontrent que des versions plus petites des modèles peuvent exposer leurs raisonnements cachés.
- Des chercheurs découvrent une vulnérabilité dans les API d'OpenAI, d'Anthropic et de Google qui expose le raisonnement interne des modèles d'IA.
- La méthode permet de distiller des informations de modèles fermés et de récupérer des mots de passe et des clés API, bien que cela ait déjà été corrigé.
- La distillation devient un sujet géopolitique alors que la Chine et les États-Unis rivalisent pour la suprématie en IA.
Une nouvelle astuce informatique permet de dévoiler les raisonnements internes des modèles d'intelligence artificielle les plus avancés, exposant des secrets que les entreprises technologiques tentent de protéger. Selon un article de Wired, des recherches récentes ont révélé une vulnérabilité dans les API d'OpenAI, d'Anthropic et de Google qui facilite non seulement la distillation à grande échelle, mais peut également filtrer des mots de passe et des clés API.
La méthode, développée par des scientifiques de l'Université de Tübingen, de l'Institut Max Planck, de MATS Research et de l'entreprise Snyk, permet d'extraire les "pensées" cachées des modèles de pointe. Bien que la vulnérabilité ait déjà été corrigée, cette découverte offre des preuves --- bien que non concluantes --- que certains modèles chinois pourraient avoir été entraînés en distillant des informations de raisonnement de modèles américains.
L'astuce qui dévoile le raisonnement de l'IA
Les modèles avancés d'IA résolvent des problèmes difficiles en les décomposant en parties qu'ils analysent dans une "chaîne de pensée" artificielle. Les entreprises gardent ce raisonnement secret, mais envoient une version chiffrée à l'ordinateur de l'utilisateur pour transférer une partie du calcul.
L'attaque des chercheurs repose sur le fait que la plupart des entreprises proposent des modèles de tailles différentes. Les modèles plus petits sont plus faibles mais aussi moins alignés, ce qui signifie qu'ils sont plus enclins à révéler leurs pensées internes.
Alimenter les traces de raisonnement chiffrées à une version plus petite du même modèle peut révéler le raisonnement caché, explique Alexander Panfilov, informaticien à l'Université de Tübingen. "Tous les principaux fournisseurs de modèles de pointe que nous avons testés partagent cette vulnérabilité", avertit-il.
Panfilov et ses collègues ont testé les modèles d'OpenAI, d'Anthropic et de Google via leurs API et ont trouvé le même problème. Ils ont également démontré que la méthode pouvait extraire des informations secrètes, telles que des clés API et des mots de passe intégrés dans les traces de raisonnement.
"L'idée d'échanger des messages à une variante de modèle plus faible qui a la même clé de déchiffrement mais un alignement plus faible est géniale", commente Florian Tramer, scientifique en sécurité informatique à l'ETH de Zurich. "Cela devient définitivement un problème", ajoute-t-il.
La controverse de la distillation
La distillation est une technique bien établie pour copier efficacement les capacités des modèles existants vers de nouveaux. Elle est particulièrement courante dans le développement de modèles à poids ouverts ou entièrement téléchargeables.
Dernièrement, la distillation est devenue un sujet controversé en raison des allégations selon lesquelles des entreprises chinoises d'IA l'utilisent pour copier les meilleurs modèles américains. En février, OpenAI a dit aux législateurs américains que DeepSeek semblait avoir copié l'un de ses modèles pour construire le R1.
En juin, Anthropic a dit aux législateurs qu'Alibaba avait systématiquement distillé ses modèles pour construire le sien, appelé Qwen. Il n'y a aucune indication qu'ils aient utilisé cette technique spécifique, mais les chercheurs pensent que leur méthode permettrait de distiller plus d'informations de modèles fermés que ce qui était cru.
Mark Zuckerberg, directeur exécutif de Meta, a déclaré que la distillation est un principe important du fonctionnement de l'écosystème du code ouvert. Il a averti que restreindre cette pratique mettrait les États-Unis en désavantage.
D'autre part, Kyle Miller, chercheur au Center for Security and Emerging Technologies, dit qu'il n'est pas clair dans quelle mesure la distillation aide réellement la Chine. "Si la capacité des laboratoires chinois à distiller était éliminée, le paysage concurrentiel ne changerait pas de manière drastique", affirme-t-il.
Les chercheurs ont alimenté chaque modèle avec 90 questions pour vérifier si les modèles à poids ouverts distillaient des modèles fermés. En donnant les premiers mots des traces de raisonnement capturées, ils ont parfois constaté que les modèles ouverts généraient des réponses remarquablement similaires.
Preuves de similitude et réactions
Le modèle chinois à poids ouverts Kimi K3, de Moonshot AI, a produit une sortie étonnamment similaire aux traces de raisonnement cachées de Claude Opus 4.8 et GPT 5.6 Sol pour certains prompts. Malgré les similitudes, les chercheurs soulignent que le travail ne peut pas établir de manière causale la distillation.
Deux autres modèles à poids ouverts, DeepSeek de Chine et Inkling de l'entreprise américaine Thinking Machines, n'ont pas montré cette similitude. Moonshot AI et Z.ai n'ont pas répondu aux demandes de commentaires.
Il y avait des spéculations antérieures sur les réseaux sociaux chinois concernant la possibilité de découvrir et d'utiliser des traces de raisonnement cachées pour la distillation. Yarin Gal, scientifique en informatique à l'Université d'Oxford, dit que la distillation est non seulement répandue, mais qu'elle a également aidé l'IA à progresser plus rapidement.
Les entreprises ont déjà pris des mesures : Panfilov et ses co-auteurs ont alerté OpenAI, Anthropic et Google, et chacune a ajusté son API pour atténuer le problème. Michael Aciman, porte-parole d'Anthropic, a déclaré qu'ils valorisent la recherche indépendante et ont commencé à développer des atténuations à court terme.
Google et OpenAI ont décliné de faire des commentaires. Panfilov ajoute que corriger complètement la distillation nécessiterait une révision fondamentale de la façon dont fonctionnent les API.
Implications géopolitiques et de sécurité
La distillation est devenue une question d'importance géopolitique alors que les États-Unis et la Chine rivalisent pour la suprématie en IA. Les faucons de la ligne dure avec la Chine affirment que le pays obtient un avantage stratégique en distillant la technologie américaine.
D'autres soutiennent que la distillation est une méthode largement utilisée pour améliorer rapidement les capacités d'un modèle d'IA. Zuckerberg défend cette pratique du point de vue du code ouvert.
Kyle Miller souligne que cela n'améliore les capacités des modèles existants que dans une mesure limitée et que les entreprises chinoises semblent avoir l'expertise nécessaire pour construire des modèles de pointe à partir de zéro. "Personne ici aux États-Unis ne sait à quel point la distillation bénéficie aux laboratoires chinois", dit-il.
Les chercheurs soulignent également que la méthode pourrait être utilisée pour récupérer des informations personnelles, bien que cette vulnérabilité ait déjà été corrigée. Cependant, certaines traces de raisonnement peuvent encore être découvertes avec la même méthode.
Panfilov et ses collaborateurs affirment que l'utilisation de leur méthode permettrait de distiller plus d'informations des modèles fermés que ce qui était cru jusqu'à présent. Cela pourrait avoir des implications significatives pour la propriété intellectuelle dans l'industrie de l'IA.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

La police britannique saisit des bitcoins d'une valeur de 1,4 million de dollars sur un marché darknet fermé

Le 25ᵉ mot : Un coffre-fort secret dans votre signer Ledger

Barron Trump se retire de la vie publique par crainte d'assassinat, Melania respecte sa décision

Andreessen Horowitz demande une restriction des exigences de vérification des clients pour les stablecoins au marché primaire

DeFi n'est pas fait pour vous, mais pour l'IA

Le fondateur de Tornado Cash, Roman Storm, voit son procès reporté à avril 2027... La cour examine si 'le code est un crime'

Le plan de Phantom pour abandonner Sui expose le pouvoir caché que les interfaces de portefeuille exercent sur les fonds des utilisateurs

Les fondateurs de Binance utilisaient des noms de code inspirés des 'Simpsons', selon d'anciens employés

Les médias iraniens menacent apparemment Barron Trump, le Secret Service américain intervient pour enquêter

Une bague vendue pour 16 milliards de dollars, Oura se prépare à une IPO aux États-Unis

Un agent du FBI et le vol de cryptomonnaies de 1 million de dollars : ce que l'on sait de l'affaire

Qu'est-ce qu'une clé publique en crypto ? Explication des clés, adresses et signatures

L'Iran offre 10 millions de dollars pour cibler Barron Trump

Secret Network émet 1,079 milliard de SCRT pour assurer sa survie après le départ des développeurs

Le BPI propose d'inclure les exigences d'identification des clients pour le marché secondaire des stablecoins

Géorgie, cryptomonnaie et sanctions : comment un lycéen britannique a révélé un réseau clandestin en Russie

Shade Protocol fixe la date limite de brûlage des SHD pour l'éligibilité à Feather

Sunan Yuchen soutenu par le tribunal dans le litige WLFI, demande d'indemnisation personnelle examinée publiquement

Multicoin Capital propose de lancer des contrats à terme perpétuels Pre-IPO

Le Bitcoin est un "code secret" pour prendre sa retraite sans vendre, selon un analyste

Patch critique pour Decred : ceux qui ne mettent pas à jour risquent un fork de réseau

Des agents IA rebelles piratent des systèmes et déclenchent des alarmes dans la Silicon Valley

Protection post-quantique : une IA a découvert une vulnérabilité dans l'un des candidats aux nouvelles signatures numériques

Femme retrouvée morte à Mar del Plata après un faux entretien d'embauche

Pourquoi 110 blockchains d'entreprise sont en route pour un grand bouleversement – et le plan secret de Coinbase pour les absorber

Pourquoi l'histoire d'arbitrage d'Axis attire-t-elle tant d'attention après avoir rempli 50 millions de dollars en 22 heures ?

La communauté de Secret Network propose une augmentation massive de l'offre, diluant l'ancienne à 20%

Donald Trump participera à nouveau au dîner des correspondants de la Maison Blanche après l'attentat qui a conduit à son annulation

Waller termine son voyage au Capitole ! Voici un résumé de ses déclarations des deux derniers jours.








