Morgan Stanley interpreta: i prezzi di Token e H100 scendono insieme, i costi dell'IA iniziano a raffreddarsi?

By: rootdata|2026/07/28 08:31:02

TL;DR
· Un rapporto di monitoraggio del settore di luglio 2026 mostra che i prezzi di input Token e i prezzi di affitto a breve termine di H100 sono tornati indietro.
· La discesa dei prezzi si verifica in un contesto in cui il volume delle chiamate è aumentato di diversi fattori e l'utilizzo delle GPU rimane elevato.
· La pressione sui costi si è già attenuata, ma i prezzi di output Token, HBM e l'offerta di cluster di alta gamma limitano ancora l'ampiezza della discesa dei prezzi.


Il "Data Center Watch" di Morgan Stanley pubblicato a luglio mostra che i prezzi delle chiamate di inferenza dell'IA e i prezzi di affitto delle GPU di alta gamma si sono raffreddati contemporaneamente.


Il significato diretto di questa pista è che la fase più tesa delle infrastrutture IA inizia a allentarsi. Per gli utenti comuni e i clienti aziendali, la diminuzione del prezzo degli input Token renderà più economica la chiamata a modelli di grandi dimensioni. Per le aziende di applicazioni IA e i fornitori di cloud, il calo degli affitti di H100 indica che il mercato della potenza di calcolo non è più in una fase di carenza come in precedenza.


Ma questo non è un segnale di un ritiro della domanda. Il campione di monitoraggio mostra che il volume di elaborazione dei Token LLM è aumentato di diversi fattori rispetto all'inizio dell'anno, l'utilizzo dei modelli di punta rimane tra il 70% e l'80%, e l'utilizzo delle GPU ad alte prestazioni supera l'80%. Il raffreddamento dei prezzi sembra più una parte della fornitura, dei modelli open source e dell'efficienza di inferenza che raggiungono insieme la domanda, piuttosto che una debolezza improvvisa della domanda di IA.


I prezzi dei Token scendono leggermente, ma l'uso continua a crescere


Nel luglio 2026, i prezzi degli input Token dei modelli principali continuano a scendere. Secondo il campione del rapporto, i prezzi per un milione di input Token di alcuni modelli principali si aggirano tra i 0,2 e i 5 dollari, con una diminuzione media di circa il 3% rispetto a giugno.


![](https://public.chaincatcher.info/upload/news/202607/c46305d0d77c48beb28f63b14a76e491.png)

Questo intervallo necessita di alcune limitazioni. I prezzi di output Token di modelli chiusi ad alte prestazioni come GPT-4o e Claude 3.5 Sonnet sono generalmente significativamente superiori a quelli degli input Token, e i prezzi di modelli leggeri come GPT-4o mini non possono essere direttamente confrontati con quelli dei modelli di punta. In altre parole, i prezzi bassi nel rapporto riflettono maggiormente gli input Token, i modelli leggeri o i campioni dei fornitori, e non possono essere interpretati come una riduzione dei costi di chiamata per tutti i modelli principali.


Tuttavia, la direzione rimane chiara. Per le aziende di applicazioni IA, i costi unitari di inferenza per le stesse domande, generazione di codice, ricerca avanzata o chiamate di assistenza clienti stanno diminuendo. Negli ultimi anni, uno dei conti più difficili da calcolare nella commercializzazione dei modelli di grandi dimensioni è stato "più usi, più perdite", e la discesa del prezzo unitario degli input Token avvicina almeno alcune applicazioni ad alta frequenza a un intervallo di costo sostenibile.


Più importante, la diminuzione dei prezzi avviene in un contesto di aumento del volume delle chiamate. Da gennaio a luglio 2026, il volume di elaborazione dei Token LLM nel campione del rapporto è aumentato di diversi fattori, con alcune nicchie di mercato che crescono di oltre 4 volte. L'utilizzo dei modelli di punta come OpenAI, Anthropic e Meta rimane stabile tra il 70% e l'80%, e il rilascio dei modelli open weight della serie Llama è anche una delle ragioni principali per l'aumento del volume delle chiamate.


Ciò che il mercato osserva non è "nessuno lo usa quindi i prezzi scendono", ma piuttosto che, con un volume di chiamate maggiore, i fornitori di servizi di modelli, l'ecosistema open weight e l'offerta di infrastrutture hanno insieme abbassato il prezzo unitario.


I modelli open weight non competono più solo sul prezzo


La rapida crescita dei modelli open weight è un'altra linea principale del mercato dei Token di luglio.


Il rapporto mostra che l'uso dei Token dei modelli open weight è aumentato del 26% rispetto a giugno e ha raggiunto 63 volte rispetto allo stesso periodo dell'anno scorso; il prezzo medio ponderato per volume è aumentato del 36% rispetto al mese precedente, e la spesa per Token è aumentata del 71%.


Ciò significa che i modelli open weight non stanno semplicemente schiacciando i modelli chiusi attraverso prezzi bassi. Con le prestazioni che si avvicinano gradualmente ai livelli di punta, i prezzi di chiamata, il volume e la spesa di alcuni modelli open weight stanno crescendo insieme.


A luglio, la quota di spesa dei modelli open weight è salita al 20%, rispetto al 12% di giugno e al 10% di maggio. Anche se i modelli chiusi rappresentano solo il 29% del volume totale dei Token, contribuiscono ancora all'80% della spesa, il che indica che i modelli chiusi ad alte prestazioni detengono ancora la maggior parte del valore commerciale, ma i modelli open weight stanno rapidamente recuperando terreno.


In base al volume di utilizzo dei Token, i primi cinque modelli di luglio sono MiMo v2.5, DeepSeek v4 Flash, GLM 5.2, DeepSeek v4 Pro e MiniMax M3, che insieme rappresentano il 50% del volume totale dei Token.


In base alla spesa per Token, i primi cinque sono Claude Opus 4.8, Claude Opus 4.7, Fable 5, Kimi K3 e GPT-5.6 Sol, che insieme rappresentano il 54% della spesa totale. Tra questi, l'ingresso di Kimi K3 tra i primi cinque per spesa significa che i modelli open weight stanno entrando in un intervallo di alto valore precedentemente dominato dai modelli chiusi.


![](https://public.chaincatcher.info/upload/news/202607/b9daa298e87a4426b668f3f318867b46.png)

Per i clienti aziendali, l'aumento dei modelli disponibili aiuta a ridurre la dipendenza da un singolo fornitore chiuso. Ma da questo rapporto, i cambiamenti portati dai modelli open weight non riguardano solo la riduzione dei prezzi, ma anche la competizione per scenari di chiamata e budget di valore più elevato.


I canoni di affitto di H100 scendono, ma le schede di alta gamma non sono in eccesso


Il mercato del noleggio di GPU ha mostrato una simile differenziazione strutturale.


Nel luglio 2026, il prezzo medio di affitto di H100 nel mercato non delle mega cloud è stato di 2,68 dollari per GPU all'ora, con una diminuzione dell'1,1% rispetto al mese precedente. Questo è il primo calo mensile dopo sette mesi consecutivi di aumento dei canoni di H100.


Questa diminuzione è molto inferiore al 15% - 25% e non può essere descritta come "il canone di H100 è sceso del 20%". Il rapporto monitora ancora il prezzo medio mensile di affitto calcolato per GPU all'ora, e non il canone settimanale per singola scheda.


Ciò indica che l'offerta ha iniziato a rispondere. Maggiore è l'ingresso di GPU nel mercato del noleggio cloud, maggiore è la concorrenza tra i fornitori di servizi cloud e le piattaforme di potenza di calcolo, e i prezzi a breve termine non sono più determinati solo da una carenza estrema. Rispetto alla fase di carenza di GPU di alta gamma, la pressione di non poter acquistare, noleggiare o dover fare la fila per le schede si è attenuata.


Tuttavia, le risorse di alta gamma rimangono costose. I prezzi di H100 sono ancora significativamente superiori a quelli di A100, e l'utilizzo complessivo delle GPU rimane tra il 75% e il 90%, con l'utilizzo delle GPU ad alte prestazioni che supera l'80%. Finché l'utilizzo rimane in questo intervallo, la discesa dei canoni sembra più un modo per eliminare una parte del premio di scarsità, piuttosto che un segno che l'offerta di potenza di calcolo sia già in eccesso.


![](https://public.chaincatcher.info/upload/news/202607/c2cb6d4a5640469e820e4f89624881d3.png)

Per le aziende di IA, questo cambiamento porta due effetti.


Primo, i costi delle attività di inferenza sono più facili da ridurre. L'inferenza richiede un'offerta di potenza di calcolo continua, stabile e a bassa latenza, e la discesa dei canoni di GPU migliorerà la struttura dei costi per i fornitori di servizi API, ricerca IA, assistenti di codice e prodotti di intelligenza aziendale.


Secondo, la pressione sui costi per l'addestramento di grandi modelli è difficile da eliminare simultaneamente. L'addestramento di alta gamma non dipende solo dal numero di GPU, ma anche dall'interconnessione dei cluster, dalla larghezza di banda della memoria, dall'efficienza di programmazione e dalla stabilità dell'alimentazione. La diminuzione dei canoni di H100 non significa che i costi di addestramento su larga scala scendano in modo equivalente, né che tutte le startup IA possano ottenere risorse di cluster di qualità equivalente a basso costo.


Prezzo di --

--

L'aumento dei prezzi della memoria rallenta, la diminuzione dei cluster di alta gamma non è diretta come il noleggio a breve termine


Il segmento in cui i prezzi si stanno allentando meno è la memoria.


Nel maggio-giugno 2026, il campione del rapporto mostra che i prezzi spot della DRAM sono aumentati rapidamente, con un aumento cumulativo di oltre il 90%-100% per categorie come DDR5 16Gb, stabilizzandosi solo a luglio. Al contrario, l'HBM rimane elevato a causa della domanda di acceleratori IA, e i prezzi contrattuali continueranno a ritardare i prezzi spot di 1-2 trimestri.


Per gli acceleratori IA di alta gamma, i chip GPU non sono l'unico collo di bottiglia; HBM, packaging avanzato e consegna dei data center influenzano l'offerta reale. Anche se i prezzi di alcune GPU nel mercato di noleggio sono scesi, l'offerta di memoria upstream e di cluster di alta gamma continuerà a limitare la velocità di riduzione dei costi complessivi.



Questo è anche il motivo per cui "il momento più teso della potenza di calcolo inizia ad allentarsi" non può essere scritto direttamente come "la carenza di potenza di calcolo è finita". La discesa dei prezzi nel mercato di noleggio indica che parte della pressione di offerta a breve termine è stata alleviata. Tuttavia, i cluster di addestramento di alta gamma e le infrastrutture di inferenza su larga scala sono ancora limitati dalla larghezza di banda della memoria, dal packaging avanzato e dal ritmo di consegna delle nuove GPU.


È importante notare il periodo di tempo. Questo rapporto riflette le variazioni di prezzo e utilizzo nel campione di luglio 2026, ed è più adatto come un'istantanea della diminuzione della tensione della potenza di calcolo dell'IA a metà 2026, piuttosto che un riassunto dei prezzi di tutti i fornitori di cloud, tutte le regioni e tutti i contratti a lungo termine.


I costi sono diminuiti, la pressione sui profitti dei fornitori di modelli cambia forma


La discesa dei prezzi di Token e di noleggio GPU è favorevole per le aziende di applicazioni IA, ma non è necessariamente una buona notizia per i fornitori di modelli.


Prezzi di chiamata più bassi aiutano a stimolare la domanda, ad ampliare l'uso delle API e a consentire a più aziende di integrare i grandi modelli nei processi aziendali reali. Il problema è che, se i prezzi scendono più velocemente dell'efficienza di inferenza, i margini di profitto dei fornitori di modelli e delle piattaforme cloud saranno compressi. Soprattutto nel contesto in cui i modelli open weight stanno recuperando terreno e la capacità di contrattazione dei clienti sta aumentando, lo spazio per i prezzi elevati delle API chiuse continuerà a essere messo in discussione.


Per i fornitori di hardware e servizi cloud, la discesa dei prezzi di affitto di H100 rappresenta anche la normalizzazione dei rendimenti estremamente elevati derivanti da una carenza estrema. Contratti a lungo termine, differenze regionali, dimensioni degli ordini e prezzi spot diversi possono portare a differenze significative nei prezzi reali che i diversi clienti ottengono. Guardando solo alla media dei canoni settimanali, non si può dedurre direttamente che i ricavi di tutti i fornitori di cloud scenderanno simultaneamente.


Il segnale più chiaro di questo monitoraggio dei prezzi è che, a metà 2026, l'offerta di infrastrutture IA ha già raggiunto parte della domanda, e i costi di chiamata e di noleggio a breve termine hanno iniziato a raffreddarsi. Ma i confini sono chiari: l'uso dei Token continua a crescere rapidamente, l'utilizzo delle GPU di alta gamma rimane elevato, i prezzi di output Token sono più costosi e l'HBM rimane teso. La discesa dei costi avviene prima nei segmenti più facilmente commerciabili, mentre le aree più difficili da allentare rimangono le forniture di cluster di alta gamma e di memoria upstream.

Questo contenuto è fornito a solo scopo informativo generale e non costituisce consulenza finanziaria, di investimento, legale o fiscale. Qualsiasi evento, ricompensa, promozione online o informazione correlata menzionata nel presente documento non deve essere considerata una raccomandazione, una sollecitazione o un invito ad acquistare, vendere, fare trading o altrimenti negoziare criptovalute. Le criptovalute sono altamente volatili e possono comportare perdite. La disponibilità dei servizi, dei prodotti e degli eventi correlati di WEEX può variare a seconda della regione. È tua responsabilità assicurarti che la tua partecipazione sia conforme alle leggi e ai regolamenti locali applicabili.

Potrebbe interessarti anche

Ultimi listing di monete su WEEX

iconiconiconiconiconiconicon
Assistenza clienti:@weikecs
Cooperazione aziendale:@weikecs
Trading quantitativo e MM:[email protected]
Programma VIP:[email protected]