Morgan Stanley interpreta: ¿Los precios de Token y H100 bajan simultáneamente, comenzando a enfriarse los costos de IA?
TL;DR
· Un seguimiento de la industria de julio de 2026 muestra que los precios de los Token de entrada y los precios de alquiler a corto plazo de H100 han caído simultáneamente.
· La caída de precios ocurre en un contexto donde el volumen de llamadas ha crecido varias veces y la tasa de utilización de GPU sigue siendo alta.
· La presión de costos se ha aliviado, pero la oferta de Token de salida, HBM y clústeres de alta gama aún limita el alcance de la reducción de precios.
Un informe de Morgan Stanley publicado en julio titulado "Data Center Watch" muestra que los precios de las llamadas de inferencia de IA y los precios de alquiler de GPU de alta gama se han enfriado en ese momento.
La implicación directa de esta pista es que la fase más tensa de la infraestructura de IA comienza a aflojarse. Para los usuarios comunes y los clientes empresariales, la caída en el precio de los Token de entrada hará que las llamadas a modelos grandes sean más baratas. Para las empresas de aplicaciones de IA y los proveedores de nube, la caída en el alquiler de H100 indica que el mercado de potencia de cálculo ya no está tan escaso como en el período anterior.
Pero esto no es una señal de que la demanda esté disminuyendo. La muestra de seguimiento muestra que el volumen de procesamiento de Token LLM ha crecido varias veces desde principios de año, la tasa de utilización de los modelos principales sigue en el rango del 70%-80%, y la tasa de utilización de GPU de alto rendimiento también supera el 80%. La caída de precios parece más bien una parte de la oferta, modelos de código abierto y eficiencia de inferencia alcanzando la demanda, en lugar de una debilidad repentina en la demanda de IA.
Los precios de Token caen ligeramente, pero el uso sigue aumentando
En julio de 2026, los precios de los Token de entrada de los modelos principales continúan cayendo. Según la muestra del informe, el precio de algunos modelos principales por cada millón de Token de entrada se sitúa aproximadamente entre 0.2 y 5 dólares, con una caída promedio de aproximadamente el 3% en comparación con julio.

Este rango necesita ser limitado. Los precios de los Token de salida de modelos de alto rendimiento y de código cerrado como GPT-4o y Claude 3.5 Sonnet suelen ser significativamente más altos que los de entrada, y los precios de modelos ligeros como GPT-4o mini no pueden compararse directamente con los modelos insignia. Es decir, los precios bajos en el informe reflejan más los Token de entrada, modelos ligeros o muestras de proveedores, y no deben interpretarse como que todos los costos de llamada de modelos principales han caído al mismo rango.
Aun así, la dirección sigue siendo clara. Para las empresas de aplicaciones de IA, el costo de inferencia por unidad está disminuyendo para las mismas preguntas, generación de código, búsqueda mejorada o llamadas de servicio al cliente. Uno de los aspectos más difíciles de calcular en la comercialización de modelos grandes en los últimos años ha sido "cuanto más se usa, más se pierde", la caída en el precio unitario de los Token de entrada al menos acerca a algunas aplicaciones de alta frecuencia a un rango de costos más asequible.
Más importante aún, la reducción de precios ocurre en un contexto de aumento en el volumen de llamadas. Desde la primera mitad de 2026 hasta julio, el volumen de procesamiento de Token LLM en la muestra del informe ha crecido varias veces desde principios de año, y algunos segmentos han crecido más de 4 veces. La tasa de utilización de los modelos principales como OpenAI, Anthropic y Meta sigue siendo estable en niveles altos del 70%-80%, y la liberación de modelos de peso abierto de la serie Llama también es una razón importante para el aumento en el volumen de llamadas.
Lo que el mercado ve no es "no se usa, por lo que bajan los precios", sino que bajo un mayor volumen de llamadas, los proveedores de servicios de modelos, el ecosistema de pesos abiertos y la oferta de infraestructura han reducido el precio unitario.
Los modelos de peso abierto ya no compiten solo por precios bajos
El rápido crecimiento de los modelos de peso abierto es otra línea principal en el mercado de Token de julio.
El informe muestra que el uso de Token de modelos de peso abierto en julio creció un 26% en comparación con el mes anterior, alcanzando 63 veces el año anterior; su precio promedio ponderado por volumen ha aumentado un 36% en comparación con el mes anterior, y el gasto en Token ha crecido un 71% en comparación con el mes anterior.
Esto significa que los modelos de peso abierto no están simplemente presionando a los modelos de código cerrado a través de precios bajos. A medida que su rendimiento se acerca gradualmente a los niveles de vanguardia, el precio de llamada, el volumen de uso y el gasto de algunos modelos de peso abierto están creciendo simultáneamente.
En julio, la cuota de gasto de los modelos de peso abierto aumentó al 20%, por encima del 12% de junio y el 10% de mayo. Aunque los modelos de código cerrado solo representan el 29% del total de Token, aún contribuyen con el 80% del gasto, lo que indica que los modelos de código cerrado de alto rendimiento aún controlan la mayor parte del valor comercial, pero los modelos de peso abierto están alcanzando rápidamente.
Según el volumen de uso de Token, los cinco modelos principales en julio fueron MiMo v2.5, DeepSeek v4 Flash, GLM 5.2, DeepSeek v4 Pro y MiniMax M3, que en conjunto representan el 50% del total de Token.
Según el gasto en Token, los cinco primeros son Claude Opus 4.8, Claude Opus 4.7, Fable 5, Kimi K3 y GPT-5.6 Sol, que en conjunto representan el 54% del gasto total. Entre ellos, la inclusión de Kimi K3 entre los cinco principales en gasto significa que los modelos de peso abierto están ingresando a un rango de alto valor que anteriormente estaba dominado por modelos de código cerrado.

Para los clientes empresariales, la mayor variedad de modelos disponibles ayuda a reducir la dependencia de un solo proveedor de código cerrado. Pero según este informe, los cambios traídos por los modelos de peso abierto no solo incluyen la reducción de precios, sino también la competencia por escenarios de llamada y presupuestos de mayor valor.
La caída en el alquiler de H100, pero los chips de alta gama no han entrado en un estado de exceso
El mercado de alquiler de GPU también ha mostrado una división estructural similar.
En julio de 2026, el precio promedio de alquiler de H100 en el mercado de proveedores de nube no de gran escala fue de 2.68 dólares por GPU por hora, con una caída del 1.1% en comparación con el mes anterior. Esta es la primera caída en comparación mensual después de siete meses de aumento en el alquiler de H100.
Esta disminución es mucho menor que del 15% al 25%, y no se puede describir como "el alquiler de H100 ha caído un 20%". El informe sigue rastreando el precio promedio mensual de alquiler calculado por GPU por hora, y no el alquiler semanal por tarjeta.
Esto indica que el lado de la oferta comienza a reaccionar. Más GPU están ingresando al mercado de alquiler en la nube, la competencia entre proveedores de servicios en la nube y plataformas de potencia de cálculo se intensifica, y los precios de alquiler a corto plazo ya no están determinados solo por una escasez extrema. En comparación con la fase de escasez de GPU de alta gama, la presión de no poder comprar, alquilar o hacer cola por las tarjetas se ha aliviado.
Pero los recursos de alta gama siguen siendo caros. El precio de H100 sigue siendo significativamente más alto que el de A100, la tasa de utilización general de GPU se mantiene entre el 75% y el 90%, y la tasa de utilización de GPU de alto rendimiento supera el 80%. Mientras la tasa de utilización se mantenga en este rango, la caída del alquiler parece más bien una eliminación de una parte de la prima de escasez, en lugar de que la oferta de potencia de cálculo esté completamente en exceso.

Para las empresas de IA, este cambio trae dos efectos.
Primero, el costo de los negocios de inferencia es más fácil de reducir. La inferencia requiere un suministro de potencia de cálculo continuo, estable y de baja latencia, y la caída en el alquiler de GPU mejorará la estructura de costos de los proveedores de servicios API, búsqueda de IA, asistentes de código y productos de agentes inteligentes empresariales.
En segundo lugar, la presión de costos para entrenar modelos grandes es difícil de desaparecer simultáneamente. El entrenamiento de alta gama no solo depende de la cantidad de GPU, sino también de la interconexión de clústeres, el ancho de banda de memoria, la eficiencia de programación y el suministro eléctrico estable. La caída en el alquiler de H100 no significa que el costo de entrenamiento a gran escala disminuya en la misma proporción, ni que todas las empresas emergentes de IA puedan obtener recursos de clúster de calidad equivalente a bajo costo.
El aumento de precios de la memoria se ha desacelerado, y la reducción de precios de los clústeres de alta gama no es tan directa como el alquiler a corto plazo
El eslabón más débil en la reducción de precios es la memoria.
En mayo y junio de 2026, la muestra del informe mostró que los precios al contado de DRAM aumentaron rápidamente, con aumentos acumulados de más del 90%-100% para categorías como DDR5 16Gb, estabilizándose solo en julio. En comparación, el HBM sigue manteniendo altos precios debido a la demanda de aceleradores de IA, y el precio contractual seguirá rezagado respecto al precio al contado por 1-2 trimestres.
Para los aceleradores de IA de alta gama, el chip GPU en sí no es el único cuello de botella; el HBM, el empaquetado avanzado y la entrega de centros de datos también afectan la oferta real. Incluso si los precios de algunas GPU en el mercado de alquiler han caído, la entrega de memoria y clústeres de alta gama aún limitará la velocidad de reducción de costos en general.
Esta es también la razón por la cual "el momento más tenso de la potencia de cálculo comienza a aflojarse" no puede escribirse directamente como "el desabastecimiento de potencia de cálculo ha terminado". La caída de los precios en el mercado de alquiler indica que parte de la presión de oferta a corto plazo se ha aliviado. Pero los clústeres de entrenamiento de alta gama y de inferencia a gran escala siguen siendo restringidos por el ancho de banda de memoria, empaquetado avanzado y el ritmo de envío de nuevas generaciones de GPU.
Es importante tener en cuenta el contexto temporal. Este informe refleja los cambios en precios y tasas de utilización en la muestra de julio de 2026, siendo más adecuado como un corte de la disminución de la tensión en la potencia de cálculo de IA a mediados de 2026, y no como un resumen de precios para todos los proveedores de nube, todas las regiones y todos los contratos a largo plazo.
Los costos han bajado, la presión de ganancias de los proveedores de modelos ha cambiado de forma
La caída de los precios de Token y de alquiler de GPU es una buena noticia para las empresas de aplicaciones de IA, pero no necesariamente es todo positivo para los proveedores de modelos.
Un precio de llamada más bajo ayuda a estimular la demanda, ampliar el uso de API, y también permite que más empresas integren grandes modelos en procesos comerciales reales. El problema es que, si la caída de precios es más rápida que la mejora en la eficiencia de inferencia, los márgenes de beneficio de los proveedores de modelos y plataformas en la nube se verán presionados. Especialmente en un contexto donde los modelos de peso abierto están alcanzando y la capacidad de negociación de los clientes está aumentando, el espacio de precios altos para las API de código cerrado seguirá siendo desafiado.
Para los proveedores de hardware y servicios en la nube, la caída en los precios de alquiler de H100 también representa la normalización de los altos retornos que antes se debían a la escasez extrema. Los contratos a largo plazo, las diferencias regionales, las escalas de volumen y las diferencias en los precios al contado harán que los precios reales que obtengan diferentes clientes varíen significativamente. Mirando solo el promedio de alquiler semanal, no se puede deducir directamente que todos los ingresos de los proveedores de nube disminuirán simultáneamente.
La señal más clara de este seguimiento de precios es que, a mediados de 2026, la oferta de infraestructura de IA ha alcanzado parte de la demanda, y los costos de llamada y alquiler a corto plazo han comenzado a enfriarse. Pero los límites son claros: el uso de Token sigue creciendo rápidamente, la tasa de utilización de GPU de alta gama sigue siendo alta, los precios de los Token de salida son más caros, y el HBM sigue siendo ajustado. La reducción de costos ocurre primero en las partes más fáciles de comercializar, mientras que los clústeres de alta gama y la oferta de memoria upstream siguen siendo las más difíciles de aflojar.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Matrixdock convierte la transparencia de reservas en infraestructura financiera en la cadena tras dos años de verificación independiente continua

¿Se ha desvanecido la utopía cripto? La industria enfrenta un punto de inflexión tras la desaparición del fervor

ETF HYPE: Hyperliquid comienza más fuerte que Bitcoin

Ceremonia de firma de cooperación estratégica entre HSK Chain y Morpho celebrada en Hong Kong

Los que eliminaron a los intermediarios ahora son intermediarios de IA

La demanda de Bitcoin muestra un déficit de 127,000 BTC en términos de spot y futuros, según analistas

Strategy detiene la compra de Bitcoin durante 5 semanas, utilizando 25 millones de dólares para recomprar sus propias acciones descontadas

El crecimiento de las acciones tokenizadas alcanza un 56% en tres meses: ¿cómo puede la criptografía resolver el problema de la fragmentación de la liquidez?

El stablecoin único "WEMIX Dollar" de WEMIX sufre daños por la toma de control del contrato inteligente—emisión y fuga no autorizadas

Dentro de la batalla entre el CME y la CFTC sobre futuros perpetuos en cadena

NVIDIA invierte 1.000 millones de dólares en Naver, ¿convirtiéndose indirectamente en accionista de Upbit?

El satírico de HBO "ataca" a Trump y su imperio de criptomonedas

WLD recibe nuevamente inversión institucional, ¿podrá volver a la cima gracias a la valoración de OpenAI?

Adiós a más de 100 proyectos: la madurez de la industria también se mide por sus cierres

Comparación de Whitepapers de Sui y Aptos: Arquitectura, Consenso y Escalabilidad Explicados

BitMEX presenta una demanda colectiva exigiendo la devolución de 622.66 BTC el mismo día que anunció su cierre

Kalshi pierde la solicitud de medida cautelar de emergencia en un tribunal federal

Diez años de acompañamiento con un retorno de billones: el mayor ganador de la salida a bolsa de Changxin en Hefei

¿Por qué se intercambian los tokens? Modelo "T-C-T'" derivado de "El Capital" de Marx ("Así es como funciona la blockchain Ep.11" Yoshihiko Uchida, Yuya Sakai, Shinya Otsuka)

Kimi se acerca y las acciones caen, las facciones de IA en EE. UU. aceleran su unión en dos semanas

¿Trade.xyz se convierte en el mayor competidor de Hyperliquid al absorber el 90% del flujo de RWA?

¿Por qué KIMI no puede ir a la discoteca a celebrar?

CME lanza futuros sobre acciones individuales, acercándose a los futuros de materias primas

FWA puede multiplicar por 2000, el protocolo genera mil ETH en una semana

Estrategia: venta de acciones por 89.200 millones de yenes | No se adquieren BTC

El Stable Vault de Aave

No es suficiente con solo crecer... Alea Research, las razones por las que el mercado ahora apuesta por el 'crecimiento monetizable'

Abraxas Capital, la institución que pone nerviosos a los analistas de blockchain

Franco Colapinto tendrá la prueba final con Alpine antes del descanso de verano
