NVIDIA réalise la réutilisation du cache entre modèles, DeepSeek et Kimi optimisent le KV Cache
Au cours des deux dernières années, l'optimisation de l'inférence des grands modèles s'est concentrée sur le KV Cache, qui contient les résultats intermédiaires des calculs laissés par le modèle après avoir lu le contexte. Plus le contenu est long, plus la consommation de mémoire vidéo et de bande passante est importante. DeepSeek-V2 réduit le KV Cache de 93,3 % grâce à la technologie MLA, tandis que Kimi Linear peut réduire jusqu'à 75 %. Les efforts de tous visent à réduire le coût des longs contextes. Cependant, les solutions existantes présentent des limites : le cache ne peut généralement être réutilisé qu'à l'intérieur du même modèle, et lors du changement de modèle, il est nécessaire de recalculer des dizaines de milliers, voire des centaines de milliers de tokens. Le routage fréquent des modèles entraîne inévitablement des calculs redondants. Le dernier article de NVIDIA propose une solution, découvrant qu'il existe une relation linéaire évidente entre les différents modèles de tailles variées appartenant à la même famille et ayant une structure KV correspondante. Grâce à un calibrage sur 500 segments de texte, chacun contenant 1024 tokens, il est possible de transférer le KV Cache d'un modèle à un autre. Lors du passage de Qwen3-14B à 32B, le recalcul d'un contexte de 32K prend environ 7 secondes, tandis que la conversion du cache ne nécessite qu'environ 0,28 seconde, soit une vitesse environ 25 fois plus rapide. Cela signifie que les petits modèles peuvent d'abord traiter de longs contextes pour générer un KV Cache, et lorsque des capacités plus puissantes sont nécessaires, le cache peut être transféré à un grand modèle pour la génération. Cette application mature du KV Cache entre modèles permettra d'économiser davantage de puissance de calcul lors du routage des modèles, les tâches simples pouvant être effectuées par de petits modèles, tandis que les problèmes complexes peuvent être traités par de grands modèles, évitant ainsi de devoir lire le contexte depuis le début à chaque fois.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

La police militaire découvre une ferme de minage illégale de Bitcoin à São Paulo

Les pertes dues aux fraudes d'investissement dépassent 8 milliards de dollars en 2025, l'État de New York met en garde contre les faux projets de cryptomonnaie et les contrefaçons d'IA

Les États-Unis ajoutent Otisitch Inventati et deux autres à la liste des sanctions antiterroristes

Le Brésil intente un procès contre Discord pour 97 millions de dollars

Figure lance le projet Index, récompensant les contributions humaines pour l'entraînement des données

SKILD AI lance le modèle de base de robot S1, capable d'apprendre des tâches de 10 minutes en une vidéo

Le ministère de la Défense a lancé un appel d'offres pour des complexes robotiques terrestres

L'ancien partenaire technique de MiniMax, Yang Bin, lève 6 millions de dollars pour fonder une entreprise d'IA vocale

Un disque dur de 8000 BTC apparaît comme élément d'un jeu 3D

Lancement de Doubao Work, un agent AI pour le travail

Le modèle de génération vidéo Wan3.0 d'Aliyun est en ligne, prenant en charge la génération de vidéos de 30 secondes

Lancement du modèle multimodal MiMo-V2.5 de Xiaomi sur B.AI avec accès gratuit

Tencent réorganise son équipe de jeux AI, intégrant ARC Lab et l'équipe AI de jeux

LG Electronics reçoit un soutien de 18 millions de dollars en assurance commerciale pour l'exportation de sa plateforme TV

Deux anciens PDG de la bourse de cryptomonnaies polonaise Zondacrypto portés disparus, licence de la société mère révoquée

L'Ukraine achète pour la première fois des drones FPV à fibre optique

Le modèle Meta Muse Video peut générer des vidéos allant jusqu'à 10 secondes

La Corée du Sud construit un système d'IA pour surveiller la manipulation du marché des cryptomonnaies

MiniMax, l'outil de création vidéo AI MiniMax Design dévoilé

L'ASIC australien retire 3106 arnaques cryptographiques, l'IA comme principal moyen

Hyundai Glovis : Inspection de l'installation de Starlink sur 45 navires

Unitree dévoile une vidéo de son robot humanoïde capable de sauter 2m et d'atteindre une vitesse de 12,66 m/s

Le plus grand centre de calcul intelligent d'énergie verte de Chine mis en service, nécessitant 1 kWh pour générer une vidéo AI de 30 secondes

Extension du mariage en ligne dans 'Dія' : nouvelles options d'ici fin 2026

He Yi clarifie que le titre de "prince de Binance" n'est pas réservé à KOL "Hmm"

Tableau de bord en temps réel pour le suivi des attaques exploitant la vulnérabilité COLDCARD

La loi sur l'IA de l'UE entre dans une nouvelle phase d'application, les entreprises en infraction risquent jusqu'à 3 % de leur chiffre d'affaires mondial

NVIDIA lance le Video Codec SDK 13.1 avec des capacités de transcodage sans copie et de localisation précise des images

NVIDIA lance le Video Codec SDK 13.1 avec de nouvelles fonctionnalités




