SemiAnalysis : Kimi K3 réduit la bande passante de transmission KV, la demande pour les réseaux AI reste inchangée
Le 19 juillet, SemiAnalysis a déclaré que Kimi K3 utilise environ trois quarts de sa couche réseau avec KDA, permettant de réduire la bande passante de transmission KV jusqu'à 10 fois, mais cela ne conduira pas à une contraction significative du marché des commutateurs réseau AI. Kimi K3 possède 28 trillions de paramètres et nécessite environ 1,5 To de bande passante HBM pour chaque calcul avant avec MXFP4. Pour maintenir une vitesse d'interaction raisonnable et réaliser un déploiement rentable, il est toujours nécessaire de connecter un grand nombre de puces via des réseaux à haute bande passante comme le GB300 NVL72, tout en s'appuyant sur le service d'extension WideEP. WideEP répartit 896 modèles experts sur plusieurs GPU et exécute deux fois la distribution de tokens et la fusion des résultats à chaque couche et pour chaque calcul avant, nécessitant plus de 120 exécutions par calcul. En revanche, la transmission de cache KV ne se produit qu'une fois par cycle de dialogue, donc la bande passante de transmission économisée par KDA pourrait être bien inférieure à la demande de réseau d'extension générée par de grands modèles experts. SemiAnalysis estime qu'un mécanisme d'attention plus efficace pourrait augmenter la longueur du contexte de 1 million de tokens à plus de 5 millions de tokens, et cette amélioration d'efficacité pourrait élargir l'utilisation de l'IA, augmentant ainsi la demande pour les réseaux.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Qwen 27B devance Claude Opus dans certains benchmarks de codage

NVIDIA étend son plan de financement AI à 500 milliards de dollars

Les revenus totaux de Baidu pour le T2 atteignent 31,3 milliards de yuans, les revenus de l'IA représentant plus de la moitié

NVIDIA lance la production en série de commutateurs optiques à emballage commun, élargissant la chaîne d'approvisionnement

CME prévoit de lancer deux contrats à terme sur la location de GPU le 5 octobre

Gonka commence le support de DeepSeek V4 Flash 0731

Mark Cuban considère les puces d'intelligence artificielle comme un nouveau domaine d'investissement

Le soutien de 500 milliards de dollars d'NVIDIA pour les ventes de GPU

Western Digital analyse que le stockage devient un nouveau goulot d'étranglement pour l'infrastructure AI

NVIDIA examine les modifications de conception de Feynman pour 2028

Le prix moyen de vente du Rubin Ultra atteint 170 000 dollars, les coûts de mémoire représentant la moitié

Elon Musk promet que l'IA pèsera 99 % de la valeur de SpaceX d'ici quatre à cinq ans

NVIDIA Feynman, objectif de production de masse au second semestre 2028

La valeur commerciale de l'usine d'IA de Naver réévaluée à 14,4 billions de wons

AMD établit une base pour l'émission d'obligations par un enregistrement automatique en bloc

Jensen Huang déclare que CUDA peut prolonger la durée de vie des GPU NVIDIA

RUM Group : Rapport financier du deuxième trimestre - Perte nette de 80,9 millions de dollars, augmentation de 82,32 bitcoins dans les réserves

NVIDIA, Google et Microsoft promeuvent l'adoption de l'architecture d'alimentation en courant continu de 800V

B3 Labs lance B3IQ et introduit un modèle d'achat fractionné pour serveurs GPU

TSMC commence la production en série d'emballages CoWoS de 5,5 fois la taille de la réticule avec un rendement supérieur à 98%

Oracle s'associe à Quantinuum pour intégrer l'informatique quantique à la plateforme OCI

Silicon Data lève 30,5 millions de dollars lors d'un tour de financement de série A, dirigé par le Valor Atreides AI Fund

Le dispositif COLDCARD Mk3 peut générer les mêmes phrases mnémotechniques, 4,5 millions d'états peuvent être recherchés en 3 secondes

Alpha Compute investit 779 millions de wons pour développer un centre de données de 200 MW

5C sécurise 1,4 milliard de dollars pour étendre son campus AI en Amérique du Nord

Global AI lève 441 millions de dollars pour étendre ses centres de données aux États-Unis

Lambda lève 917 millions de dollars pour acheter des GPU afin d'étendre sa puissance de calcul en IA

Prévisions : Les puces AI fabriquées en Chine représenteront 90 % du marché d'ici 2026

Moore Threads prévoit d'émettre des actions H et de s'introduire à la Bourse de Hong Kong





