Google Gemini reduce hasta 88% el uso de tokens al analizar videos
**Google incorporó análisis de video basado en agentes a varios modelos Gemini Flash. La herramienta selecciona de forma autónoma las escenas, fotogramas, audio o transcripciones relevantes y, según la compañía, puede reducir el uso de tokens hasta 88% mientras mejora ligeramente la precisión en determinadas evaluaciones.
Los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite pueden analizar segmentos de menos de un segundo, incluidos cambios de estado y cortes que podrían perderse con un muestreo convencional de un fotograma por segundo. Esta capacidad resulta relevante para la edición automatizada, donde una transición breve o una modificación instantánea puede alterar el significado de una escena.
El sistema también puede localizar momentos específicos en horas de grabación sin consumir millones de tokens durante el proceso. Para ello, identifica ventanas de tiempo potencialmente relevantes y vuelve a muestrearlas a una velocidad de fotogramas más alta cuando detecta una anomalía o una señal que requiere mayor resolución temporal.
Además de encontrar escenas, Gemini puede contar movimientos repetidos y objetos individuales a lo largo del tiempo. La herramienta no se limita a observar imágenes, porque combina fotogramas, audio y transcripciones según la naturaleza de la tarea que el desarrollador le haya planteado.
Google sostiene que esta selección autónoma permite que el modelo concentre sus recursos en los momentos y señales que realmente importan. La consecuencia es un flujo de análisis menos rígido, en el que la inteligencia artificial decide qué examinar, a qué velocidad hacerlo y mediante cuál modalidad antes de entregar una respuesta.
Hasta ahora, Gemini utilizaba un procesamiento estático que, de manera predeterminada, muestreaba el video a un fotograma por segundo, aunque los desarrolladores podían ajustar esa configuración mediante la API. Desde el lanzamiento del análisis nativo de video en 2025, el sistema combinaba el estudio de los fotogramas con la transcripción de la pista de audio.
El enfoque basado en agentes conecta el razonamiento del modelo directamente con las herramientas nativas de video. De acuerdo con Google, Gemini puede iniciar un ciclo de búsqueda, recuperar una parte concreta del archivo, observar el resultado y decidir si necesita consultar otro segmento, aumentar la velocidad de muestreo o cambiar de modalidad.
Las ventajas de eficiencia son más visibles en materiales largos, que pueden ir desde tutoriales de 10 minutos hasta conferencias de 90 minutos y archivos de varias horas. Con el método estático, los desarrolladores debían escoger entre asumir un consumo elevado de tokens o utilizar técnicas selectivas propias que podían descartar detalles relevantes.
Google afirma que sus resultados en 1H-VideoQA y LVBench muestran una caída de 88% en el uso de tokens, acompañada por un aumento ligero de la precisión. En la evaluación 1H-VideoQA de la compañía, Gemini 3.7 Flash con análisis basado en agentes alcanza la mayor precisión con el menor costo por consulta, según los datos presentados por la empresa.
La compañía también incluyó LongVideoBench entre las pruebas utilizadas para comparar el desempeño de los modelos. En ese conjunto de evaluaciones, Google describe a Gemini 3.7 Flash como la alternativa con la mayor calidad general y la mejor combinación entre precisión y eficiencia de costos.
Estos resultados son afirmaciones de Google y reflejan sus propios benchmarks, por lo que no equivalen por sí solos a una validación independiente de todos los escenarios de uso. Aun así, el ahorro potencial puede ser relevante para aplicaciones que procesan grandes bibliotecas audiovisuales, especialmente cuando cada consulta requiere buscar un instante concreto y no describir el video completo.
El análisis agéntico ya está activo para videos subidos y videos de YouTube mediante la API de Gemini en Google AI Studio y en Gemini Enterprise Agent Platform. Los desarrolladores deben configurar el modo de procesamiento como "agentic" dentro de la API para activar el comportamiento selectivo.
Google planea extender la tecnología a sus propios productos en una fecha posterior. La empresa espera llevarla próximamente a todos los usuarios de la aplicación Gemini que utilicen dispositivos Flash y Flash Lite, mientras que en los próximos meses también prevé emplearla en la función Ask YouTube dentro de la página de reproducción.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Google Pics lleva las imágenes AI a Workspace, desafiando a Canva y Adobe

Google Gemini 3.8 Flash se lanzará el miércoles, con el nombre en clave Skimaki

Tim Cook deja su puesto: Bitcoin, IA, lo que el nuevo CEO de Apple debe gestionar urgentemente

Gemini recibe apoyo arbitral y no asume responsabilidad por el colapso del plan de préstamos Earn

El mercado de bonos del Tesoro de EE. UU. atrapado en una tormenta triple de inflación, austeridad y suministro

Los ingresos de ArbitrumDAO alcanzaron los 6,19 millones de dólares en el primer semestre

Lo que el derroche de $344 millones en gastos políticos de criptomonedas quiere del Congreso

La seguridad de la IA se convierte en un mercado multimillonario y atrae 100 millones de dólares

ADP débil y Treasuries en alza: ¿qué cambia para los inversores?

El presidente de Circle testifica ante el Congreso, pidiendo una mejora en el marco regulatorio de las stablecoins y el mercado de activos digitales

¿Qué es Hedera Hashgraph y cómo funciona HBAR?

¿Qué son los NFTs y todavía importan los tokens no fungibles en 2026?

¿Qué es Chainlink y cómo funciona la red oracle LINK?

Adquisición de Bridge por Stripe: los volúmenes en stablecoin se han cuadruplicado

Última hora: ¿Rafał Zaorski detenido? La fiscalía ataca a Zondacrypto. "R.Z." en manos del CBZC

Los ataques a los almacenes cambian el mapa del retail ucraniano: los precios de los productos podrían aumentar entre un 5% y un 8%

Qué es la reducción a la mitad de Bitcoin y por qué afecta el precio

IA: Anthropic y Nvidia llegan a las tierras de un gigante de la minería de Bitcoin

Noticias de la SEC sobre criptomonedas: ¿Comercio 24/7 en Wall Street con o sin blockchain?

Crypto finalmente se fusionará con las finanzas AI

Encuentran una granja de criptomonedas con 110 dispositivos en un edificio no residencial

RWA: La empresa matriz de NYSE apuesta por tZERO para tokenizar Wall Street

Bitcoin Asia concluye: más allá de las tendencias, tres señales reales

Los bonos a 10 años de Japón superan el 3%, BTC cae a 77,000 dólares

COFE Tech cierra ronda previa a la oferta pública a una valoración de 178 millones de dólares

OpenPayd obtiene 43 licencias en EE. UU. antes del acuerdo con Nasdaq

El CEO de MicroStrategy, Phong Le, responde sobre la pausa en la compra de Bitcoin: la empresa no tomará decisiones basadas en el precio específico del Bitcoin

De Glamsterdam a Hegotá: ¿Qué resolverá Ethereum en su próxima fase tras la expansión?

Los incendios en Skarżysko-Kamienna y Lublin no son un accidente. El gobierno confirma sabotaje











