Morgan Stanley interpreta: i prezzi di Token e H100 scendono insieme, i costi dell'IA iniziano a raffreddarsi?
TL;DR
· Un rapporto di monitoraggio del settore di luglio 2026 mostra che i prezzi di input Token e i prezzi di affitto a breve termine di H100 sono tornati indietro.
· La discesa dei prezzi si verifica in un contesto in cui il volume delle chiamate è aumentato di diversi fattori e l'utilizzo delle GPU rimane elevato.
· La pressione sui costi si è già attenuata, ma i prezzi di output Token, HBM e l'offerta di cluster di alta gamma limitano ancora l'ampiezza della discesa dei prezzi.
Il "Data Center Watch" di Morgan Stanley pubblicato a luglio mostra che i prezzi delle chiamate di inferenza dell'IA e i prezzi di affitto delle GPU di alta gamma si sono raffreddati contemporaneamente.
Il significato diretto di questa pista è che la fase più tesa delle infrastrutture IA inizia a allentarsi. Per gli utenti comuni e i clienti aziendali, la diminuzione del prezzo degli input Token renderà più economica la chiamata a modelli di grandi dimensioni. Per le aziende di applicazioni IA e i fornitori di cloud, il calo degli affitti di H100 indica che il mercato della potenza di calcolo non è più in una fase di carenza come in precedenza.
Ma questo non è un segnale di un ritiro della domanda. Il campione di monitoraggio mostra che il volume di elaborazione dei Token LLM è aumentato di diversi fattori rispetto all'inizio dell'anno, l'utilizzo dei modelli di punta rimane tra il 70% e l'80%, e l'utilizzo delle GPU ad alte prestazioni supera l'80%. Il raffreddamento dei prezzi sembra più una parte della fornitura, dei modelli open source e dell'efficienza di inferenza che raggiungono insieme la domanda, piuttosto che una debolezza improvvisa della domanda di IA.
I prezzi dei Token scendono leggermente, ma l'uso continua a crescere
Nel luglio 2026, i prezzi degli input Token dei modelli principali continuano a scendere. Secondo il campione del rapporto, i prezzi per un milione di input Token di alcuni modelli principali si aggirano tra i 0,2 e i 5 dollari, con una diminuzione media di circa il 3% rispetto a giugno.

Questo intervallo necessita di alcune limitazioni. I prezzi di output Token di modelli chiusi ad alte prestazioni come GPT-4o e Claude 3.5 Sonnet sono generalmente significativamente superiori a quelli degli input Token, e i prezzi di modelli leggeri come GPT-4o mini non possono essere direttamente confrontati con quelli dei modelli di punta. In altre parole, i prezzi bassi nel rapporto riflettono maggiormente gli input Token, i modelli leggeri o i campioni dei fornitori, e non possono essere interpretati come una riduzione dei costi di chiamata per tutti i modelli principali.
Tuttavia, la direzione rimane chiara. Per le aziende di applicazioni IA, i costi unitari di inferenza per le stesse domande, generazione di codice, ricerca avanzata o chiamate di assistenza clienti stanno diminuendo. Negli ultimi anni, uno dei conti più difficili da calcolare nella commercializzazione dei modelli di grandi dimensioni è stato "più usi, più perdite", e la discesa del prezzo unitario degli input Token avvicina almeno alcune applicazioni ad alta frequenza a un intervallo di costo sostenibile.
Più importante, la diminuzione dei prezzi avviene in un contesto di aumento del volume delle chiamate. Da gennaio a luglio 2026, il volume di elaborazione dei Token LLM nel campione del rapporto è aumentato di diversi fattori, con alcune nicchie di mercato che crescono di oltre 4 volte. L'utilizzo dei modelli di punta come OpenAI, Anthropic e Meta rimane stabile tra il 70% e l'80%, e il rilascio dei modelli open weight della serie Llama è anche una delle ragioni principali per l'aumento del volume delle chiamate.
Ciò che il mercato osserva non è "nessuno lo usa quindi i prezzi scendono", ma piuttosto che, con un volume di chiamate maggiore, i fornitori di servizi di modelli, l'ecosistema open weight e l'offerta di infrastrutture hanno insieme abbassato il prezzo unitario.
I modelli open weight non competono più solo sul prezzo
La rapida crescita dei modelli open weight è un'altra linea principale del mercato dei Token di luglio.
Il rapporto mostra che l'uso dei Token dei modelli open weight è aumentato del 26% rispetto a giugno e ha raggiunto 63 volte rispetto allo stesso periodo dell'anno scorso; il prezzo medio ponderato per volume è aumentato del 36% rispetto al mese precedente, e la spesa per Token è aumentata del 71%.
Ciò significa che i modelli open weight non stanno semplicemente schiacciando i modelli chiusi attraverso prezzi bassi. Con le prestazioni che si avvicinano gradualmente ai livelli di punta, i prezzi di chiamata, il volume e la spesa di alcuni modelli open weight stanno crescendo insieme.
A luglio, la quota di spesa dei modelli open weight è salita al 20%, rispetto al 12% di giugno e al 10% di maggio. Anche se i modelli chiusi rappresentano solo il 29% del volume totale dei Token, contribuiscono ancora all'80% della spesa, il che indica che i modelli chiusi ad alte prestazioni detengono ancora la maggior parte del valore commerciale, ma i modelli open weight stanno rapidamente recuperando terreno.
In base al volume di utilizzo dei Token, i primi cinque modelli di luglio sono MiMo v2.5, DeepSeek v4 Flash, GLM 5.2, DeepSeek v4 Pro e MiniMax M3, che insieme rappresentano il 50% del volume totale dei Token.
In base alla spesa per Token, i primi cinque sono Claude Opus 4.8, Claude Opus 4.7, Fable 5, Kimi K3 e GPT-5.6 Sol, che insieme rappresentano il 54% della spesa totale. Tra questi, l'ingresso di Kimi K3 tra i primi cinque per spesa significa che i modelli open weight stanno entrando in un intervallo di alto valore precedentemente dominato dai modelli chiusi.

Per i clienti aziendali, l'aumento dei modelli disponibili aiuta a ridurre la dipendenza da un singolo fornitore chiuso. Ma da questo rapporto, i cambiamenti portati dai modelli open weight non riguardano solo la riduzione dei prezzi, ma anche la competizione per scenari di chiamata e budget di valore più elevato.
I canoni di affitto di H100 scendono, ma le schede di alta gamma non sono in eccesso
Il mercato del noleggio di GPU ha mostrato una simile differenziazione strutturale.
Nel luglio 2026, il prezzo medio di affitto di H100 nel mercato non delle mega cloud è stato di 2,68 dollari per GPU all'ora, con una diminuzione dell'1,1% rispetto al mese precedente. Questo è il primo calo mensile dopo sette mesi consecutivi di aumento dei canoni di H100.
Questa diminuzione è molto inferiore al 15% - 25% e non può essere descritta come "il canone di H100 è sceso del 20%". Il rapporto monitora ancora il prezzo medio mensile di affitto calcolato per GPU all'ora, e non il canone settimanale per singola scheda.
Ciò indica che l'offerta ha iniziato a rispondere. Maggiore è l'ingresso di GPU nel mercato del noleggio cloud, maggiore è la concorrenza tra i fornitori di servizi cloud e le piattaforme di potenza di calcolo, e i prezzi a breve termine non sono più determinati solo da una carenza estrema. Rispetto alla fase di carenza di GPU di alta gamma, la pressione di non poter acquistare, noleggiare o dover fare la fila per le schede si è attenuata.
Tuttavia, le risorse di alta gamma rimangono costose. I prezzi di H100 sono ancora significativamente superiori a quelli di A100, e l'utilizzo complessivo delle GPU rimane tra il 75% e il 90%, con l'utilizzo delle GPU ad alte prestazioni che supera l'80%. Finché l'utilizzo rimane in questo intervallo, la discesa dei canoni sembra più un modo per eliminare una parte del premio di scarsità, piuttosto che un segno che l'offerta di potenza di calcolo sia già in eccesso.

Per le aziende di IA, questo cambiamento porta due effetti.
Primo, i costi delle attività di inferenza sono più facili da ridurre. L'inferenza richiede un'offerta di potenza di calcolo continua, stabile e a bassa latenza, e la discesa dei canoni di GPU migliorerà la struttura dei costi per i fornitori di servizi API, ricerca IA, assistenti di codice e prodotti di intelligenza aziendale.
Secondo, la pressione sui costi per l'addestramento di grandi modelli è difficile da eliminare simultaneamente. L'addestramento di alta gamma non dipende solo dal numero di GPU, ma anche dall'interconnessione dei cluster, dalla larghezza di banda della memoria, dall'efficienza di programmazione e dalla stabilità dell'alimentazione. La diminuzione dei canoni di H100 non significa che i costi di addestramento su larga scala scendano in modo equivalente, né che tutte le startup IA possano ottenere risorse di cluster di qualità equivalente a basso costo.
L'aumento dei prezzi della memoria rallenta, la diminuzione dei cluster di alta gamma non è diretta come il noleggio a breve termine
Il segmento in cui i prezzi si stanno allentando meno è la memoria.
Nel maggio-giugno 2026, il campione del rapporto mostra che i prezzi spot della DRAM sono aumentati rapidamente, con un aumento cumulativo di oltre il 90%-100% per categorie come DDR5 16Gb, stabilizzandosi solo a luglio. Al contrario, l'HBM rimane elevato a causa della domanda di acceleratori IA, e i prezzi contrattuali continueranno a ritardare i prezzi spot di 1-2 trimestri.
Per gli acceleratori IA di alta gamma, i chip GPU non sono l'unico collo di bottiglia; HBM, packaging avanzato e consegna dei data center influenzano l'offerta reale. Anche se i prezzi di alcune GPU nel mercato di noleggio sono scesi, l'offerta di memoria upstream e di cluster di alta gamma continuerà a limitare la velocità di riduzione dei costi complessivi.
Questo è anche il motivo per cui "il momento più teso della potenza di calcolo inizia ad allentarsi" non può essere scritto direttamente come "la carenza di potenza di calcolo è finita". La discesa dei prezzi nel mercato di noleggio indica che parte della pressione di offerta a breve termine è stata alleviata. Tuttavia, i cluster di addestramento di alta gamma e le infrastrutture di inferenza su larga scala sono ancora limitati dalla larghezza di banda della memoria, dal packaging avanzato e dal ritmo di consegna delle nuove GPU.
È importante notare il periodo di tempo. Questo rapporto riflette le variazioni di prezzo e utilizzo nel campione di luglio 2026, ed è più adatto come un'istantanea della diminuzione della tensione della potenza di calcolo dell'IA a metà 2026, piuttosto che un riassunto dei prezzi di tutti i fornitori di cloud, tutte le regioni e tutti i contratti a lungo termine.
I costi sono diminuiti, la pressione sui profitti dei fornitori di modelli cambia forma
La discesa dei prezzi di Token e di noleggio GPU è favorevole per le aziende di applicazioni IA, ma non è necessariamente una buona notizia per i fornitori di modelli.
Prezzi di chiamata più bassi aiutano a stimolare la domanda, ad ampliare l'uso delle API e a consentire a più aziende di integrare i grandi modelli nei processi aziendali reali. Il problema è che, se i prezzi scendono più velocemente dell'efficienza di inferenza, i margini di profitto dei fornitori di modelli e delle piattaforme cloud saranno compressi. Soprattutto nel contesto in cui i modelli open weight stanno recuperando terreno e la capacità di contrattazione dei clienti sta aumentando, lo spazio per i prezzi elevati delle API chiuse continuerà a essere messo in discussione.
Per i fornitori di hardware e servizi cloud, la discesa dei prezzi di affitto di H100 rappresenta anche la normalizzazione dei rendimenti estremamente elevati derivanti da una carenza estrema. Contratti a lungo termine, differenze regionali, dimensioni degli ordini e prezzi spot diversi possono portare a differenze significative nei prezzi reali che i diversi clienti ottengono. Guardando solo alla media dei canoni settimanali, non si può dedurre direttamente che i ricavi di tutti i fornitori di cloud scenderanno simultaneamente.
Il segnale più chiaro di questo monitoraggio dei prezzi è che, a metà 2026, l'offerta di infrastrutture IA ha già raggiunto parte della domanda, e i costi di chiamata e di noleggio a breve termine hanno iniziato a raffreddarsi. Ma i confini sono chiari: l'uso dei Token continua a crescere rapidamente, l'utilizzo delle GPU di alta gamma rimane elevato, i prezzi di output Token sono più costosi e l'HBM rimane teso. La discesa dei costi avviene prima nei segmenti più facilmente commerciabili, mentre le aree più difficili da allentare rimangono le forniture di cluster di alta gamma e di memoria upstream.
Questo contenuto è fornito a solo scopo informativo generale e non costituisce consulenza finanziaria, di investimento, legale o fiscale. Qualsiasi evento, ricompensa, promozione online o informazione correlata menzionata nel presente documento non deve essere considerata una raccomandazione, una sollecitazione o un invito ad acquistare, vendere, fare trading o altrimenti negoziare criptovalute. Le criptovalute sono altamente volatili e possono comportare perdite. La disponibilità dei servizi, dei prodotti e degli eventi correlati di WEEX può variare a seconda della regione. È tua responsabilità assicurarti che la tua partecipazione sia conforme alle leggi e ai regolamenti locali applicabili.
Potrebbe interessarti anche

Matrixdock trasforma la trasparenza delle riserve in un'infrastruttura finanziaria on-chain dopo due anni di verifica indipendente

Il sogno cripto è già svanito? L'industria affronta un punto di svolta dopo l'euforia

ETF HYPE: Hyperliquid parte più forte di Bitcoin

Cerimonia di firma della cooperazione strategica tra HSK Chain e Morpho si svolge a Hong Kong

Chi ha eliminato gli intermediari ora fa da intermediario per l'AI

Bitcoin: carenza di 127.000 BTC tra domanda di mercato e futures, secondo un analista

Strategia interrompe per 5 settimane l'acquisto di Bitcoin, utilizzando 25 milioni di dollari per riacquistare silenziosamente le proprie azioni scontate

La crescita delle azioni tokenizzate raggiunge il 56% in tre mesi: come può la crittografia affrontare il problema della frammentazione della liquidità?

Il danno della stablecoin "WEMIX Dollar" di WEMIX, il gioco coreano - Emissione non autorizzata e fuga a causa di un attacco al contratto intelligente

Dentro la battaglia tra CME e CFTC sui futures perpetui onchain

NVIDIA investe 1 miliardo di dollari in Naver, diventando indirettamente azionista di Upbit?

Il satirico di HBO "prende di mira" Trump e il suo impero delle criptovalute

WLD ottiene nuovamente investimenti istituzionali, può tornare al vertice grazie all'immaginazione valutativa di OpenAI?

Addio a oltre 100 progetti: la maturità dell'industria si misura anche attraverso le sue chiusure

Confronto tra Whitepaper di Sui e Aptos: Architettura, Consenso e Scalabilità Spiegati

BitMEX, causa collettiva per il rimborso di 622,66 BTC annunciata lo stesso giorno della chiusura

Kalshi perde la richiesta di ingiunzione d'emergenza in tribunale federale

Dieci anni di pazienza portano a un ritorno di mille miliardi: il vincitore principale della quotazione di Changxin a Hefei

Perché i token vengono scambiati? Il modello "T-C-T'" derivato da "Il Capitale" di Marx ("Ecco come funziona la blockchain Ep.11" Yoshihiko Uchida, Yuya Sakai, Shinya Otsuka)

Kimi si avvicina e le azioni crollano, le fazioni dell'AI negli Stati Uniti accelerano la collaborazione nelle prossime due settimane

trade.xyz diventa il principale concorrente di Hyperliquid con il 90% del volume RWA?

Perché KIMI non può festeggiare in un nightclub?

CME Lancia Futures su Singole Azioni, Allineando i Futures Azionari con le Materie Prime

FWA offre premi fino a 2000 volte, guadagnando 1000 ETH in una settimana

Strategia: vendita di azioni per 89,2 miliardi di yen | Acquisto di BTC rinviato

Stable Vault di Aave

Non basta più la crescita... Alea Research spiega perché il mercato ora scommette sulla 'crescita monetizzabile'

Abraxas Capital, l'istituzione che fa venire i brividi agli analisti on-chain

Franco Colapinto avrà un ultimo test con l'Alpine prima della pausa estiva







